
Tolok Ukur Claude Opus 5.5: Setiap Skor, Pengaturan Effort Asalnya, dan Siapa yang Mengukurnya
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Angka utama Anthropic untuk Claude Opus 5.5 pada Terminal-Bench 4.0 adalah 66,4%, yang dicetak berdampingan dengan 52,3% untuk Claude Opus 5 pada tabel yang sama — dan 66,4% itu dihasilkan pada effort xhigh, bukan pada default model yaitu medium. Model ini dirilis pada 22 September 2026, dua hari sebelum halaman ini ditulis, jadi ini adalah model GA dengan harga model GA dan tabel benchmark model GA. Angka independen pada benchmark yang sama, dari Artificial Analysis, adalah 59,6%, dalam konfigurasi yang membawa perutean pengaman sisi server Anthropic di dalamnya. Di antara kedua angka tersebut terdapat perbedaan harness, perbedaan effort, dan perbedaan perutean, dan belum ada seorang pun — termasuk kami — yang dapat mengatakan berapa besar porsi selisih itu yang disebabkan oleh masing-masingnya. Yang dapat dilakukan halaman ini adalah menempatkan setiap angka yang dipublikasikan untuk Claude Opus 5.5 di satu tempat, menyebutkan siapa yang menghasilkannya, menyebutkan pengaturan saat angka itu dihasilkan, dan menyertakan baris-baris tempat GPT-6 Astra dan Claude Fable 5.1 tampil unggul.
Mulailah dari pengaturan effort, karena itu lebih banyak mengubah angka dibandingkan modelnya.
Claude Opus 5.5 secara default menggunakan medium effort pada Claude API. Claude Opus 5 secara default menggunakan high. Tingkat dengan nama yang sama juga bukan anggaran pemikiran yang sama di antara kedua model, jadi "kami menjalankan keduanya pada high" bukan perbandingan terkontrol meskipun labelnya cocok. Pemikiran adaptif selalu aktif dan tidak dapat dimatikan pada Opus 5.5; parameter effort mengubah kedalaman, latensi, dan biaya, dan tidak ada yang lain.
Angka Terminal-Bench 4.0 milik Anthropic dijalankan pada xhigh. Fakta tunggal itu adalah kaveat terpenting di halaman ini, karena tolok ukur yang menjadi judul utamanya adalah tolok ukur dengan margin terlebar yang dilaporkan dibanding model sebelumnya, dan karena tabel yang sama menunjukkan apa yang terjadi saat Anda membiarkan pengaturan itu apa adanya:
• FrontierCode v1.1 Main — 54,4% pada xhigh, 54,6% pada default medium.Dilaporkan vendor. Jalur medium lebih tinggi daripada jalur xhigh. Pada beban kerja ini, tombol effort tidak menghasilkan apa pun yang terukur; kedua angka itu adalah angka yang sama.
• CursorBench 4.0 — 57,8% pada xhigh, 52,5% pada medium. Dilaporkan oleh vendor. Model sama, harness sama, minggu sama: 5,3 poin, yang merupakan selisih upaya terbesar di antara yang tersedia.
Dua baris yang berada di dalam satu tabel vendor itu adalah keseluruhan argumennya. Satu workload tidak sensitif terhadap effort dan yang lainnya sangat sensitif terhadap effort, dan kartu model tidak dapat memberi tahu Anda sebelumnya jenis workload mana milik Anda. Kesimpulan yang didukung oleh data itu sempit dan layak dinyatakan secara sempit: tingkat effort yang tepat kini merupakan pengukuran per-workload, bukan default yang Anda warisi. Itu tidak mendukung "Opus 5.5 lebih cepat daripada yang disarankan tolok ukurnya" atau "Anthropic sengaja menahan default-nya" — untuk itu Anda memerlukan penyapuan per-workload di kelima setelan, dan belum ada yang menerbitkannya. Itu berarti jika Anda bermigrasi dari Opus 5 dan mempertahankan setelan effort yang sudah Anda miliki, Anda telah mengubah eksperimennya, bukan sekadar modelnya.
Satu lagi asimetri, dan kali ini arahnya berlawanan. Kolom pesaing pada baris Terminal-Bench milik Anthropic adalah GPT-6 Astra pada 57,9% — dijalankan pada upaya tinggi, menurut catatan bagan Anthropic sendiri, sementara Opus 5.5 dengan 66,4% dijalankan pada xhigh. Tabel vendor yang menjalankan modelnya sendiri pada satu pengaturan dan model pesaing pada pengaturan lain bukanlah perbandingan langsung, apa pun tampilan kedua angka itu saat disandingkan.
Tabel vendor, dengan sumber dan pengaturan di setiap baris
Semua yang ada di bagian ini adalah laporan vendor: materi peluncuran Anthropic, harness Anthropic, pengaman produksi aktif, pemikiran adaptif pada upaya maksimal kecuali baris tersebut menyatakan sebaliknya. Bacalah ini sebagai Anthropic yang mengukur Anthropic.
• Terminal-Bench 4.0 — 66.4%, pada upaya xhigh. Dilaporkan vendor, galat baku sekitar ±2.6 poin. Pada baris yang sama: Claude Opus 5 52.3%, Claude Fable 5.1 55.8%, GPT-6 Astra 57.9% (pada upaya tinggi), GPT-5.6 Sol 37.3%. Terminal-Bench 4.0 secara eksplisit merupakan tolok ukur yang diakui vendor sebagai proksi tidak sempurna untuk pekerjaan terminal nyata, dan inilah andalan utama model tersebut.
• FrontierCode v1.1 Main — 54,4% pada xhigh, 54,6% pada medium default.Menurut laporan vendor. Opus 5 48,0%, Fable 5.1 50,3%, GPT-6 Astra 53,3%, GPT-5.6 Sol 47,5%. Kartu sistem Anthropic juga memuat varian Extended pada 63,6% dan angka Extended terbaik pada medium sebesar 65,3%.
• CursorBench 4.0 — 57,8% pada xhigh, 52,5% pada medium.Dilaporkan vendor. Opus 5 46,6%, Fable 5.1 51,8%, GPT-5.6 Sol 41,7%. Perhatikan bahwa baris CursorBench Fable 5.1 dan Opus 5 berada pada effort maksimum, sehingga Opus 5.5 pada medium dibandingkan dengan sesama modelnya pada maksimum.
• GDPval-AA v2.1 — 1.846 Elo. Ini adalah satu-satunya baris di tabel vendor yang tidak dijalankan oleh vendor. GDPval-AA adalah evaluasi Artificial Analysis, dan tulisan Artificial Analysis sendiri tentang Opus 5.5 menyatakan angka 1.846 yang sama, dengan Fable 5.1 pada 1.735 dan Opus 5 pada 1.708. Di tabel vendor: Fable 5.1 1.735, Opus 5 1.708, GPT-5.6 Sol 1.588, GPT-6 Astra 1.542. Ini adalah satu-satunya baris di sini di mana dua organisasi sepakat pada angka yang sama, dan itu karena ini adalah pengukuran yang sama.
• AutomationBench (Zapier) — 40,0%. Dilaporkan vendor, dan dijalankan dengan tanpa model fallback, sehingga setiap intervensi pengamanan dinilai sebagai kegagalan. GPT-6 Astra 41,4%, Fable 5.1 31,4%, GPT-5.6 Sol 28,8%, Opus 5 26,9%.
• Humanity's Last Exam, dengan alat — 67,7%. Dilaporkan vendor. Fable 5.1 65,6%, Opus 5 63,6%, GPT-6 Astra 57,2%. Kartu sistem Anthropic secara terpisah melaporkan 64,4% tanpa alat, yang merupakan angka yang perlu dirujuk jika Anda membandingkannya dengan sumber yang tidak memberikan akses alat kepada modelnya.
• Terminal-Bench-Science 0.1 — 58,7%. Dilaporkan vendor, galat baku kira-kira ±3,5 hingga ±5 poin, jadi ini adalah rentang, bukan satu titik. GPT-6 Astra 64,6%, Fable 5.1 52,6%, Opus 5 29,0%, GPT-5.6 Sol 22,4%.
• OSWorld 2.0 — 81,8% parsial.Dilaporkan oleh vendor, dan kata "parsial" benar-benar berperan dalam kalimat itu: kartu sistem Anthropic memberikan tingkat penyelesaian yang ketat sebesar 48,7% untuk model yang sama pada evaluasi yang sama. Keduanya dipublikasikan; angka parsial itulah yang dikutip. Fable 5.1 80,7%, Opus 5 74,0%.
• Chartography, dengan alat — 89,0%.Dilaporkan oleh vendor. Fable 5.1 88,4%, Opus 5 83,4%.

Angka-angka independen, dan apa arti sebenarnya dari "Default Fallback"
Artificial Analysis adalah satu-satunya pihak ketiga dengan evaluasi terkini yang dipublikasikan atas Claude Opus 5.5 pada indeks komposit, dan angkanya adalah yang perlu disandingkan dengan milik Anthropic. Seperti yang terbaca pada 24 September 2026:
• Intelligence Index — 58 pada upaya maksimum, dalam konfigurasi berlabel "Adaptive Reasoning, Max Effort, Default Fallback". Independen, diukur oleh Artificial Analysis. Artikelnya sendiri menyebut 58 sebagai "skor tertinggi yang kami ukur dengan selisih beberapa poin." Indeks yang sama juga menerbitkan Opus 5.5 pada setiap pengaturan upaya lainnya, dan rentangnya adalah bagian yang berguna: 56 pada xhigh, 54 pada high, 51 pada medium, 42 pada low. Itu adalah selisih 16 poin di sepanjang tombol upaya pada satu model — lebih besar daripada jarak antara sebagian besar model di papan itu.
• Terminal-Bench 4.0 — 59,6%.Independen. Artificial Analysis melaporkannya sebagai "setara dengan pemimpin GPT-6 Astra (xhigh)" dan sekitar 11 poin di atas Claude Opus 5.
• Humanity's Last Exam — 61,4%.Independen, dan hasil terbaik sebelumnya di papan yang sama adalah 59,1%, yang dipegang oleh Claude Fable 5.1.
• SciCode — 66,9%.Independen, dibandingkan dengan 63,1% untuk Claude Fable 5.1.
Sekarang klausa yang perlu dijelaskan alih-alih dikutip. "Default Fallback" bukan artefak benchmark dan bukan pengaturan Artificial Analysis — itu adalah perutean pengaman sisi server Anthropic, yang dibiarkan tetap aktif. Claude Opus 5.5 hadir dengan tier pengaman yang sebelumnya disediakan untuk Fable 5.1: sebagian besar permintaan keamanan siber dialihkan secara transparan ke Claude Opus 4.8, dan pekerjaan biologi akan menggunakan fallback ke Claude Opus 5 kecuali akunnya terverifikasi. Ketika Artificial Analysis menjalankan indeks saat Default Fallback diaktifkan, yang diukurnya adalah sistem yang diterapkan — hal yang sebenarnya dicapai oleh kunci API yang belum diverifikasi — bukan checkpoint bersih dari bobot Opus 5.5. Itu adalah pengukuran yang lebih jujur bagi pembeli, dan pengukuran yang kurang bersih bagi sebuah benchmark. Anthropic mengatakan hal serupa tentang tabelnya sendiri: intervensi pada eksekusi Terminal-Bench 4.0 membuat tugas keamanan siber diselesaikan oleh Opus 4.8 dan tugas biologi oleh Opus 5, dan perusahaan menyatakan bahwa intervensi tersebut kemungkinan menurunkan skor yang dilaporkan. Jadi perutean pengaman adalah fakta operasional nyata dalam kedua arah, dan tidak ada angka di halaman ini yang mengisolasi model dasar dari hal itu.
Di mana kedua tabel tersebut berbeda, dan mengapa
Letakkan dua angka Terminal-Bench 4.0 secara berdampingan dan Anda mendapatkan 66,4% versus 59,6% — 6,8 poin, pada benchmark yang sama, untuk model yang sama. Alasannya sudah diketahui, dan masing-masing cukup besar untuk berdampak sendiri:
• Harness yang berbeda. Anthropic menjalankan scaffold agennya sendiri; Artificial Analysis menjalankan harness agen referensinya sendiri. Skor benchmark terminal merupakan properti dari scaffold ditambah model, bukan dari model semata, dan tidak satu pun dari kedua organisasi itu yang telah mempublikasikan eksperimen penukaran scaffold.
• Pengaturan upaya yang berbeda. Angka 66,4% milik Anthropic berada pada xhigh. Pengaturan upaya yang menyertai angka 59,6% dari Artificial Analysis tidak disebutkan dalam kalimat yang memuat angka tersebut, dan angka benchmark yang dilaporkannya umumnya adalah angka pada upaya maksimum.
• Pengaman diaktifkan, dalam kedua kasus, dihitung secara berbeda. Anthropic menjalankan dengan fallback dan memperlakukan intervensi sebagai pengurang skor tetapi tetap dinilai. Pada AutomationBench, ia dijalankan tanpa fallback dan menghitung intervensi sebagai kegagalan mutlak. Artificial Analysis berjalan dengan fallback yang diaktifkan sepanjang waktu.
• Angka-angka itu berubah bahkan di dalam tabel milik satu vendor sendiri. Anthropic mencantumkan Claude Opus 5 di angka 52,3% pada Terminal-Bench 4.0 dan mencatat bahwa 51,8% di papan peringkat publik untuk model yang sama masih "dalam batas noise".
Dan kemudian bukti terkuat di halaman ini tentang seberapa besar nilai sebuah harness. Papan peringkat publik Terminal-Bench 4.0, yang diambil pada 24 September 2026, sama sekali tidak memuat baris Claude Opus 5.5. Entri teratasnya adalah GPT-6 Astra pada upaya maksimal, agen Codex, 58,2% ±2,8; kedua adalah Claude Fable 5.1 pada upaya maksimal melalui Claude Code dengan 57,9% ±3,8; ketiga adalah Claude Opus 5 pada xhigh melalui Claude Code dengan 53,9% ±3,2. Jadi 66,4% bukan sekadar angka yang berbeda dari 59,6% yang independen — angka itu tidak ada di papan publik, dan versi Claude Opus 5 milik papan tersebut sendiri adalah 53,9%, bukan 52,3% yang dicetak di tabel peluncuran. Sampai Terminal-Bench menerima dan menerbitkan pengajuan Opus 5.5, angka 66,4% adalah hasil harness vendor yang tidak direproduksi oleh siapa pun, dan 59,6% adalah angka yang benar-benar akan dipertanggungjawabkan oleh pihak luar. Perhatikan juga bahwa di papan yang sama, pemimpin Terminal-Bench 4.0 versi Artificial Analysis dan Opus 5.5 milik Anthropic sama-sama berada di 59,6% — yang merupakan hasil imbang dalam satu harness, dan tidak memberi tahu Anda apa pun tentang harness lainnya.

Baris-baris di mana Opus 5.5 kalah
Rangkuman yang mengabaikan kerugian bukanlah rangkuman, dan tabel Anthropic sendiri memuat keduanya.
• Terminal-Bench-Science 0.1 — 58,7% berbanding 64,6% milik GPT-6 Astra. Dilaporkan oleh vendor, pada tabel Anthropic, dan kalah 5,9 poin dari pesaing yang disebut namanya pada baris yang paling dekat dengan penalaran ilmiah. Catatan kesalahan standar milik vendor sendiri (±3,5 hingga ±5) berarti selisih itu berada di ambang derau, bukan nyaman di dalamnya — tetapi ini tetap kekalahan di halaman vendor sendiri, dan rentang itu tidak menjadikannya kemenangan. Claude Opus 5 berada di 29,0% pada baris yang sama, jadi lonjakan antargenerasi itu nyata bahkan di titik pesaing memimpin.
• AutomationBench — 40,0% versus 41,4% milik GPT-6 Astra. Dilaporkan oleh vendor, selisih kalah 1,4 poin, dan uji coba tersebut tidak memiliki model fallback, sehingga intervensi pengaman dinilai sebagai kegagalan. Artinya, perbandingan khusus ini mengukur Opus 5.5 dengan penalti routing-nya turut diperhitungkan terhadap pesaing yang penalti routing-nya, berapa pun besarnya, tidak dijelaskan. Ini adalah baris yang paling sulit ditafsirkan di halaman ini, baik ke arah yang satu maupun yang lain.
Dua tempat lagi di mana keunggulannya lebih tipis daripada yang disiratkan judul, keduanya dilaporkan vendor. Pada Humanity's Last Exam dengan alat, margin terhadap Claude Fable 5.1 adalah 2,1 poin (67,7% vs 65,6%); pada Chartography dengan alat, selisihnya 0,6 poin (89,0% vs 88,4%); pada OSWorld 2.0 parsial, selisihnya 1,1 poin (81,8% vs 80,7%). Itu adalah baris-baris di mana "Opus 5.5 adalah model agentik terbaik" merupakan klaim tentang peringkat, bukan tentang selisih yang terukur, dan perbedaan pembacaan grafik sebesar 0,6 poin seharusnya tidak menentukan pengadaan.
Posisi independen Claude Fable 5.1, pada revisi indeks yang berbeda
Menempatkan Opus 5.5 berhadapan dengan saudaranya sendiri memerlukan bagian tersendiri, dan hal itu perlu disertai peringatan, karena perbandingannya lebih sulit daripada yang terlihat.
Saat Artificial Analysis menerbitkan ulasan Claude Fable 5.1 pada 1 September 2026, model itu mencetak skor 66 pada upaya maksimal pada Intelligence Index-nya, dan Artificial Analysis menyebutnya sebagai skor tertinggi yang pernah mereka ukur — di atas Claude Opus 5 pada 63 dan GPT-5.6 Sol pada 61. Pada indeks sebagaimana tercantum pada 24 September 2026, model yang sama muncul pada 53 pada upaya maksimal dengan fallback, dan Opus 5.5 muncul pada 58 dalam konfigurasi yang setara. Ulasan 22 September tentang Opus 5.5 menyebut 58 sebagai "skor tertinggi yang pernah kami ukur, dengan selisih beberapa poin".
Kedua pernyataan itu tidak bisa sama-sama benar pada satu skala, dan penyelesaiannya adalah bahwa keduanya tidak berada pada satu skala. Indeks itu adalah objek hidup yang direvisi oleh Artificial Analysis; dua dari artikelnya yang telah terbit, berselang lima minggu, menempatkan pasangan sejawat yang sama di sisi berlawanan dari posisi teratas. Itu adalah pernyataan tentang revisi indeks, bukan tentang salah satu model yang mengalami kemunduran, dan itu berarti angka 66 dan 58 tidak boleh pernah dicetak berdampingan. Jika dibaca pada hari yang sama, daftar yang sama, konfigurasi berlabel yang sama, urutan saat ini menempatkan Opus 5.5 unggul lima poin atas Fable 5.1 — dan bahkan itu adalah perbandingan indeks yang sama, dari vendor indeks yang sama, bukan adu langsung yang diaudit. Yang aman untuk dikatakan lebih sempit cakupannya: pada revisi terkini dari satu-satunya komposit independen yang mengukur keduanya, Opus 5.5 adalah yang lebih kuat di antara kedua model Anthropic tersebut, dan angka 66 Fable 5.1 yang lebih dikenal berasal dari revisi yang lebih awal dari indeks itu.
Pengaturan-pengaturan itu layak mendapat satu kalimat lagi karena mudah tertukar. Angka 66 milik Fable 5.1 dan 58 milik Opus 5.5 sama-sama merupakan baris upaya maksimum — tetapi lima pengaturan upaya Fable 5.1 mencakup rentang 11x dalam penggunaan token keluaran, dari 13,1M pada low hingga 143,7M pada max, dengan skor indeks dari 58 hingga 66. Satu poin indeks untuk model dengan sebaran internal sebesar itu bukan pengganti yang memadai untuk baris yang sebenarnya akan Anda jalankan.
Biaya token adalah sumbu benchmark tersendiri.
Setiap angka di atas adalah skor. Tidak ada satu pun yang merupakan paruh, dan pada model ini paruh adalah tempat gerakan menarik itu berada.
Artificial Analysis mengukur Claude Opus 5.5 pada upaya maksimum dengan menggunakan sekitar 119.000 token keluaran per tugas Intelligence Index — tertinggi dalam indeksnya. Sebagai perbandingan, pada papan yang sama dengan pengaturan yang sama: Claude Opus 5 sekitar 73.000, Claude Fable 5.1 sekitar 78.000, dan GPT-6 Astra sekitar 27.000. Token berpikir ditagih sebagai token keluaran, dan pemikiran adaptif tidak dapat dimatikan pada Opus 5.5, jadi token yang dihabiskan model untuk bernalar bukan sekadar catatan kaki bagi harganya — melainkan sebagian besar darinya.
Jalankan perhitungannya, karena harga tertera menyesatkan jika berdiri sendiri. Opus 5.5 dipatok pada $4,00 input / $20,00 output, potongan 20% dari $5,00 / $25,00 milik Opus 5. Artificial Analysis tetap mengukur Opus 5.5 pada upaya maksimum dengan biaya sekitar $5,98 per tugas indeks dibandingkan $5,86 untuk Opus 5 pada pengaturan yang sama — sedikit lebih tinggi, bukan lebih rendah, karena sekitar 1,6x token output memakan seluruh potongan tarif 20% dan bahkan lebih dari itu. Di seluruh indeks, Opus 5.5 menghasilkan 260 juta token output dibandingkan median papan peringkat sebesar 88M, yang oleh evaluator disebut "sangat bertele-tele."
Kisah biaya karena itu sepenuhnya terletak pada pengaturan effort, dan itu hanya berhasil jika Anda menggunakannya. Pada effort maksimum, Opus 5.5 adalah model yang lebih mahal per tugas yang diselesaikan daripada model yang digantikannya. Pada medium — default produk yang sebenarnya, dan cakupan klaim Anthropic "sekitar 40% lebih murah untuk dijalankan pada beban kerja tipikal" — penghematannya nyata, tetapi itu adalah pernyataan tentang rata-rata di seluruh beban kerja yang dipilih vendor, bukan hasil per tugas yang diaudit. Bacaan praktisnya: pemotongan harga 20% adalah diskon pada daftar tarif dan opsi pada tuas effort, bukan penghematan otomatis. Jika rencana migrasi Anda adalah "tukar id model dan pertahankan pengaturannya," Anda membeli versi yang mahal.
Apa yang sama sekali tidak ditetapkan?
Inilah bagian yang menjadi alasan sisa halaman ini ada.
• Belum ada perbandingan langsung independen dengan upaya setara dan harness setara antara Claude Opus 5.5 dan rival mana pun yang disebutkan namanya yang telah dipublikasikan.Setiap perbandingan antar-vendor di halaman ini — Opus 5.5 vs GPT-6 Astra, vs GPT-5.6 Sol, vs Claude Fable 5.1 — adalah perbandingan dua tabel yang dihasilkan oleh dua perusahaan berbeda, pada dua harness berbeda, dengan dua pengaturan upaya berbeda, yang salah satunya biasanya adalah model milik vendor itu sendiri pada pengaturan yang menguntungkan. Tidak ada eksperimen di mana pun dalam catatan publik yang menjaga scaffold dan upaya tetap konstan di dua vendor dan melaporkan keduanya.
• Pemecahan token per soal tidak dipublikasikan. Angka agregat token keluaran diukur secara independen, tetapi berapa banyak darinya yang merupakan teks pemikiran versus teks jawaban tidak dipublikasikan oleh siapa pun yang dapat kami temukan. Halaman mana pun yang memberi Anda angka token pemikiran yang presisi untuk model ini sedang memberi Anda angka yang tidak diukur oleh siapa pun.
• Sebagian besar kartu sistem tidak di-benchmark oleh pihak ketiga. SWE-bench Pro 89.9%, Multilingual 93.9%, DeepSWE v1.1 74.2%, ProgramBench 91.2%, OfficeQA 78.9%, HealthBench Professional 65.6% dengan penyesuaian panjang, GMMLU 94.3%, ArXivMath 96.9% dengan alat — semuanya dilaporkan vendor, tidak ada yang direproduksi secara independen pada saat penulisan ini.
• Angka utama Terminal-Bench 4.0 tidak ada di papan publik. Sudah dibahas di atas, dan itu juga termasuk dalam daftar ini: angka tunggal yang paling banyak dikutip tentang model ini adalah angka yang belum pernah dijalankan oleh siapa pun di luar vendor.
• Anthropic melaporkan bahwa Claude Opus 5.5 "sering menduga dirinya sedang dievaluasi" — kata-kata perusahaan itu sendiri, yang diajukan sebagai keterbatasan pada penilaian keamanannya. Anggaplah itu secara serius sebagai masalah pengukuran dan bukan sebagai keanehan: jika model berperilaku berbeda ketika ia percaya sedang diuji, maka setiap angka benchmark di halaman ini, baik dari vendor maupun independen, adalah pengukuran model yang sedang diamati, dan sejauh mana hal itu berbeda dari perilaku saat diterapkan tidak diketahui dan tidak terkuantifikasi. Hal ini berlaku sama untuk baris yang baik maupun yang buruk. Inilah satu-satunya catatan yang tidak dapat diperbaiki oleh metodologi matched-effort dalam takaran apa pun.
• Sonnet 5.5 dan Haiku 5.5 tidak tersedia. Anthropic telah mengumumkannya untuk "minggu-minggu mendatang." Keduanya belum dirilis, tidak ada tolok ukur yang dipublikasikan, dan tidak ada apa pun di halaman ini yang berlaku untuk keduanya.
Harga, envelope, dan bagian-bagian spesifikasi yang mengubah kode Anda
Dibaca dari kartu tarif terbitan Anthropic pada 24 September 2026: $4,00 per juta token input, $20,00 per juta output, $0,20 per juta pembacaan cache, $5,00 per juta penulisan cache 5 menit, $8,00 per juta penulisan cache 1 jam, dan diskon 50% untuk kedua arah pada Batch API. Tarif pembacaan cache adalah yang tidak mencolok — angkanya 5% dari input dasar, sementara sebagian besar model Claude berada di 10% dan Fable 5.1 berada di 2,5%. Mode cepat diberi harga terpisah pada $8,00 / $40,00 dan Anthropic menggambarkannya sebagai pratinjau riset, bukan tier umum.
Inilah bagian ketika kartu tarif berhenti menjadi hal sepele dan menjadi aritmetika yang dapat dilakukan router untuk Anda. Claude Opus 5.5 disajikan sebagai anthropic/claude-opus-5.5 di OrcaRouter dengan harga $4.00 / $20.00 yang sama, dengan harga daftar diteruskan pada markup 0% — jadi begitu Anthropic mengubah tarif, itulah tarif di sini, pada hari yang sama dan tanpa jeda penyesuaian harga yang perlu dimodelkan. Komponen yang menentukan tagihan sebenarnya adalah yang dicantumkan katalog di samping harga: pembacaan cache $0.20 pada 5% dari input dasar dibandingkan 2,5% milik Fable 5.1, jendela konteks 1M token, dan batas output 128K. Karena parameter effort adalah tempat biaya model ini benar-benar bergerak — perubahan indeks 16 poin dan sekitar 119.000 token output per tugas pada max dibandingkan sekitar 73.000 untuk Opus 5 — migrasi yang menghemat biaya adalah migrasi yang memungkinkan Anda menyetel effort per beban kerja, bukan per akun, dan menempatkan rute Opus 5.5 di belakang failover otomatis sementara Anda mengukur pengaturan mana yang diinginkan trafik Anda.
• Envelope — konteks 1 juta token, output maksimum 128K, output 300K pada Batch API di balik header beta output-300k-2026-03-24, cutoff pengetahuan Juni 2026, penghentian tidak lebih awal dari 22 September 2027. Output-nya lebih cepat lebih dari 30% dibandingkan Claude Opus 5.
• Perubahan yang tidak kompatibel dibandingkan Opus 5 — thinking tidak dapat lagi dinonaktifkan; penggunaan tool yang dipaksakan (sebuah tool_choice yang menyebutkan tool tertentu) mengembalikan error; blok thinking terikat pada model dan percakapan yang menghasilkannya; tool computer-use computer_20251124 yang lebih lama tidak diterima di Claude API atau Google Cloud. Tiga hal pertama juga berlaku untuk Fable 5.1. Ada hal kelima yang senyap: teks di antara panggilan tool kini tiba di dalam blok thinking yang teksnya kosong pada pengaturan tampilan default, sehingga UI yang mengalirkan teks itu sebagai indikator progres menjadi diam tanpa ada yang mengalami error.
• Perutean pengaman, sekali lagi, karena ini item spesifikasi dan bukan catatan kaki — sebagian besar permintaan keamanan siber ditujukan ke Claude Opus 4.8 dan pekerjaan biologi dialihkan ke Claude Opus 5 sebagai cadangan kecuali akunnya terverifikasi. Dalam evaluasi tersebut, jawaban yang Anda terima mungkin sama sekali tidak berasal dari Opus 5.5, sehingga skor yang dipublikasikan pada tolok ukur yang berdekatan dengan siber dan bio bukanlah pengukuran yang bersih dari model ini.
• Klaim efisiensi, semuanya dilaporkan vendor — sekitar 40% biaya lebih rendah untuk menjalankan pada beban kerja tipikal dibandingkan potongan harga tertera 20%; contoh analisis merger yang dikerjakan memakan waktu 63 menit pada Opus 5.5 versus 93 menit pada Opus 5 dengan biaya 50% lebih rendah; dan pernyataan pelanggan dari Box (sepertiga token, jawaban sekitar 40% lebih ringkas), Kiro (sekitar setengah token, panggilan 40% lebih sedikit), Factory (token keluaran 20–25% lebih sedikit), dan GitHub (termasuk token dan langkah paling sedikit yang pernah diukurnya). Ini adalah rata-rata di seluruh beban kerja yang dipilih vendor dan mitra peluncurannya. Semua itu adalah atribusi, bukan hasil yang diaudit, dan berada dalam ketegangan yang tampak dengan angka biaya independen per tugas di atas — yang itu sendiri merupakan pengukuran pada upaya maksimal, bukan pada default. Keduanya bisa benar; tidak ada yang merupakan klaim umum tentang beban kerja Anda.

Status bukti
Claude Opus 5.5 adalah model nyata dengan pemotongan harga yang nyata, cakupan nyata 1 juta token konteks dan 128K output, serta perubahan nyata dan berdampak besar dalam cara thinking dan effort dikonfigurasi. Model ini juga hadir dengan tabel benchmark yang sebagian besar mengukur Anthropic, tabel independen yang sebagian besar mengukur deployment yang dirutekan alih-alih checkpoint, dan masalah kesadaran diri yang terdokumentasi yang melemahkan keduanya. Belum diterbitkan perbandingan head-to-head independen dengan effort yang disamakan dan harness yang disamakan antara Claude Opus 5.5 dan pesaing yang disebutkan namanya. Sampai itu ada, bacalah setiap perbandingan lintas vendor di halaman ini sebagai apa adanya: dua tabel vendor dari dua perusahaan pada dua setelan, yang kami susun berdampingan — dan ukur ulang setelan effort Anda sendiri sebelum Anda mengukur ulang modelnya.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
