Kartu judul untuk panduan API Claude Opus 5.5, bertuliskan 'ID Model, empat perubahan yang merusak, dan perubahan kelima yang senyap', dengan strip spesifikasi yang menampilkan id model claude-opus-5-5, jendela konteks 1M, output 128K, dan $4 / $20 per 1 juta token.
Engineering & Research

Panduan API Claude Opus 5.5: ID Model, Empat Perubahan Besar, dan Yang Kelima yang Senyap

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ubah string model dari claude-opus-5 menjadi claude-opus-5-5 dan kode Anda tetap dapat dikompilasi, tetap lolos pemeriksaan tipe, dan tetap lulus apa pun yang dianggap sebagai rangkaian pengujian. Lalu permintaan itu gagal dengan 400 di produksi. Empat bentuk permintaan yang diterima Claude Opus 5 ditolak mentah-mentah oleh Claude Opus 5.5, dan perubahan kelima tidak merusak apa pun — yang justru membuatnya menjadi satu-satunya yang akan sampai ke pengguna Anda. Ini adalah referensi integrasi untuk model tersebut: pengenalnya, permukaan yang melayaninya, kontrak permintaan, keempat error, perubahan kelima yang senyap, dan bagaimana parameter effort sekarang bekerja. Jika perilakunya cocok dengan Claude Fable 5.1, tim yang sudah bermigrasi ke sana telah menyelesaikan sebagian pekerjaannya, jadi setiap perubahan di bawah ini menyebutkan apakah hal itu juga berlaku untuk model tersebut.

Semua yang ada di sini dibaca dari dokumentasi Claude milik Anthropic sendiri pada 2026-09-24, dua hari setelah model itu dirilis. Klaim vendor dilabeli sebagai klaim vendor, angka independen sebagai independen, dan keduanya tidak pernah disajikan pada pengaturan upaya yang sama seolah-olah keduanya dapat dibandingkan.

ID model, dan di mana ia dilayani

Identifikasinya adalah claude-opus-5-5 — id model tetap tanpa akhiran tanggal, skema yang sama seperti claude-opus-5. Tidak ada bentuk snapshot tersemat yang terpisah untuk diadopsi dan tidak ada alias yang mengarah ke hal lain.

Ikhtisar model Anthropic mencantumkan lima surface, dengan string yang sama persis ini:

• Claude API — claude-opus-5-5, tersedia untuk semua pelanggan.

• Amazon Bedrock — anthropic.claude-opus-5-5 (satu-satunya platform yang memberi awalan vendor).

• Claude Platform di AWS — claude-opus-5-5, menggunakan id API Claude alih-alih id bergaya Bedrock.

Google Cloud — claude-opus-5-5.

• Microsoft Foundry — claude-opus-5-5; nama deployment itulah yang Anda kirim, dan Foundry mengikuti jadwal siklus hidup Claude API.

Dua dari lima tersebut lebih penting daripada sisa bagian ini. Amazon Bedrock dan Google Cloud menetapkan tanggal siklus hidup dan penghentian mereka sendiri, dan — seperti yang ditunjukkan oleh perubahan yang merusak di bawah ini — Bedrock juga satu-satunya platform tempat alat penggunaan komputer lama masih berfungsi. Jika Anda menggunakan Bedrock, Anda tidak menjalani migrasi yang sama seperti yang lain.

Apa yang harus dipenuhi oleh setiap permintaan sekarang

Panduan migrasi Anthropic menyatakan kontrak tersebut sebagai daftar, dan daftar itu cukup singkat untuk memeriksa klien Anda sendiri terhadapnya. Apa pun model asal Anda, permintaan ke claude-opus-5-5 harus:

• Kirim tanpa thinking field atau thinking: {"type": "adaptive"} — keduanya setara, karena pemikiran adaptif selalu aktif.

• Kendalikan kedalaman berpikir dengan effort, satu-satunya parameter permintaan yang melakukannya; kelima level didukung dan nilai defaultnya adalah medium.

• Gunakan tool_choice dengan {"type": "auto"} (default) atau {"type": "none"}. Memaksa tool akan ditolak.

• Hilangkan temperature, top_p dan top_k, atau biarkan pada nilai defaultnya. Nilai lain apa pun akan ditolak, pada model ini seperti pada semua hal dari Claude Opus 4.7 dan seterusnya.

• Jangan akhiri pesan dengan giliran asisten yang telah diisi sebelumnya; itu sudah ditolak pada Opus 4.6 dan versi setelahnya.

• Deklarasikan penggunaan komputer sebagai computer_toolset_20260801 toolset di Claude API dan Google Cloud.

• Jangan kirim header beta jendela konteks. Jendela konteks 1M adalah default, dan header yang ditulis untuk model lama tidak berpengaruh.

Ketika panduan menyatakan bahwa suatu pengaturan ditolak, API mengembalikan HTTP 400. Itulah keseluruhan mode kegagalan dari beralih ke model ini: bukan keluaran yang terdegradasi, bukan peringatan dalam log — melainkan permintaan yang tidak pernah dijalankan.

Anthropic's Migrating to Claude Opus 5.5 documentation page, showing the 'What every request to Claude Opus 5.5 must satisfy' list: the claude-opus-5-5 model id with no date suffix, thinking adaptive-only, the effort parameter with five levels low through max defaulting to medium, tool_choice auto or none, sampling parameters at their defaults, no prefilled assistant turn, the computer_toolset_20260801 toolset on the Claude API and Google Cloud, and a 1M-token context window requiring no beta header.

Empat perubahan yang merusak

1. Berpikir tidak dapat dinonaktifkan

Pemikiran adaptif selalu aktif. thinking: {"type": "disabled"} mengembalikan 400, dan anggaran manual juga demikian — thinking: {"type": "enabled", "budget_tokens": N}. Teks galat menyebutkan tipe yang Anda kirim lalu menyebutkan penggantinya:

• "thinking.type.disabled" tidak didukung untuk model ini. Gunakan "thinking.type.adaptive" dan "output_config.effort" untuk mengontrol perilaku berpikir.

• "thinking.type.enabled" tidak didukung untuk model ini. Gunakan "thinking.type.adaptive" dan "output_config.effort" untuk mengontrol perilaku berpikir.

Konsekuensi praktisnya bukanlah error, melainkan apa yang terjadi setelah Anda memperbaikinya. Pada Claude Opus 4.8 dan versi sebelumnya, permintaan tanpa field thinking dijalankan tanpa thinking. Pada Claude Opus 5.5 setiap permintaan berpikir, dan max_tokens tetap menjadi batas keras yang mencakup thinking plus teks respons. Token thinking ditagih sebagai token output meskipun teks thinking tidak pernah dikembalikan kepada Anda. Endpoint yang sebelumnya berjalan tanpa thinking karena itu dapat menghasilkan lebih banyak token output per permintaan setelah "perbaikan" daripada sebelumnya. Panduan Anthropic adalah menurunkan effort di tempat Anda dulu menonaktifkan thinking, dan — pada effort xhigh atau max — memulai max_tokens pada 64k dan menyetelnya dari sana.

Bentuk responsnya juga berubah. Sebuah respons dapat dimulai dengan satu atau beberapa blok thinking sebelum blok teks pertama, sehingga kode yang membaca balasan berdasarkan posisi — content[0].text, atau penangan stream yang memperlakukan content_block_start pertama sebagai teks — akan rusak pada respons seperti ini bahkan ketika permintaannya berhasil. Pilih blok berdasarkan bidang type sebagai gantinya.

2. Penggunaan alat secara paksa mengembalikan kesalahan

tool_choice tipe any dan tool mengembalikan 400, dan validasi yang sama juga berlaku untuk endpoint penghitungan token, sehingga penghitungan pra-penerbangan gagal dengan cara yang sama seperti panggilan sebenarnya:

• tool_choice: tipe "tool" dan "any" tidak didukung untuk model ini.

Auto dan none tidak terpengaruh. Penggantian yang didokumentasikan adalah dengan tetap menggunakan tool_choice: {"type": "auto"}, tandai tools dengan strict: true untuk argumen yang valid sesuai skema, atau pindahkan skema ke structured outputs — dan sebutkan di prompt kapan tool tersebut berlaku, karena auto tidak menjamin pemanggilan. Penggunaan tool strict menerima subset JSON Schema: setiap objek dalam input_schema milik tool harus menetapkan additionalProperties: false, jadi periksa setiap skema sebelum mengaktifkan flag tersebut. Dan perhatikan celah yang ditinggalkan ini: jika kode Anda bergantung pada memaksa pemanggilan, bukan sekadar mengizinkannya, auto memulihkan izin dan bukan jaminannya. Periksa bahwa blok tool_use benar-benar kembali.

3. Blok pemikiran terikat pada model dan pada percakapan

Setiap blok pemikiran mencatat model mana yang menghasilkannya, dan setiap model membaca bloknya sendiri ditambah sekumpulan blok milik model lain yang telah ditentukan. Aturan-aturan itu berlaku di kedua arah:

• Claude Opus 5.5 membaca blok pemikiran dari Claude Opus 5 dan model Opus, Sonnet, serta Haiku yang lebih awal — tetapi tidak dari model Claude Fable atau Claude Mythos.

• Pada Claude API, Claude Fable 5.1 dan Claude Mythos 5.1 membaca blok Claude Opus 5.5. Tidak ada model lain yang melakukannya.

• Percakapan yang beralih dari Claude Opus 5.5 ke apa pun selain keduanya akan menjalankan giliran-giliran berikutnya tanpa penalaran sebelumnya.

Router atau fallback yang memindahkan percakapan adalah cara yang jelas untuk memicunya. Bagian yang lebih halus adalah bahwa blok itu juga terikat pada prefiks percakapan — system prompt, tool, dan setiap pesan sebelumnya. Anthropic menegakkan pemeriksaan prefiks secara default untuk akun yang dibuat pada atau setelah 2026-08-31 00:00 UTC, di Claude API dan di platform cloud: putar ulang sebuah blok setelah mengubah system prompt, daftar tool, atau pesan sebelumnya, dan permintaan akan mengembalikan 400. Ada dua jalan keluar. Kirim thinking-binding-controls-2026-08-01 header beta dan setel thinking.block_binding.prefix_mismatch_behavior ke "drop_block" untuk membuang blok yang terdampak alih-alih menggagalkan permintaan. Atau pertahankan percakapan tetap append-only dan ubah instruksi dengan pesan sistem di tengah percakapan alih-alih mengeditnya — yang memang sudah dilakukan oleh Claude Code, claude.ai, Claude Managed Agents, dan Claude Agent SDK.

Ada satu kabar baik yang mudah terlewat: ketika sebuah permintaan membawa blok yang tidak dapat dibaca oleh model tujuan, API akan membuangnya sebelum model melihatnya. Permintaan tersebut berhasil, dan blok yang dibuang tidak ditagih.

4. Alat computer-use yang lebih lama ditolak di Claude API dan Google Cloud

Entri tools bertipe computer_20251124 mengembalikan 400 pada Claude API dan Google Cloud. Pesan tersebut menyebutkan tipe yang ditolak lalu mencantumkan tipe-tipe yang diterima model:

• 'claude-opus-5-5' tidak mendukung jenis tool: computer_20251124.

Penggantinya adalah computer_toolset_20260801 toolset: hapus computer-use-2025-11-24 header beta, dan kirim entri tools tanpa nama dan tanpa dimensi tampilan. Ini bukan hanya perubahan permintaan — loop agen ikut berubah. Aksi datang sebagai blok tool_use anggota alih-alih satu computer tool, bisa ada beberapa dalam satu giliran, aksinya adalah blok tersebut name alih-alih input.action, dan setiap hasil harus menggemakan toolset_name kembali. Di Amazon Bedrock, computer_20251124 tetap berfungsi persis seperti di Claude Opus 5 dan tidak ada perubahan yang diperlukan.

Manakah dari keempatnya yang juga berlaku untuk Claude Fable 5.1

Anthropic menyatakan bahwa tiga hal pertama juga berlaku pada Claude Fable 5.1 — thinking yang selalu aktif, tidak adanya pemaksaan pilihan tool, serta blok thinking yang terikat pada model dan percakapan. Perubahan pada computer-use tidak demikian: yang itu spesifik untuk model ini di Claude API dan Google Cloud. Jadi tim yang sudah beralih ke Claude Fable 5.1 telah menghentikan jalur kode yang menonaktifkan thinking dan pemaksaan pilihan tool-nya, serta memiliki pola percakapan append-only; yang tersisa hanyalah id model dan toolset computer-use. Tim yang datang dari Claude Opus 5 menghadapi keempatnya sekaligus. Itulah migrasi yang layak dijadwalkan, dan jumlah pekerjaannya berbeda-beda tergantung dari mana Anda memulai.

Perubahan kelima: tidak ada error, dan feed progres Anda menjadi senyap

Pada Claude Opus 5, catatan singkat yang ditulis model di antara pemanggilan alat dikembalikan sebagai blok teks biasa. Pada Claude Opus 5.5 — seperti pada Claude Fable 5.1 — narasi tersebut dikembalikan sebagai blok pemikiran pembaruan progres, paling banyak satu sebelum setiap pemanggilan alat. Dan thinking.display secara default bernilai "omitted", sehingga blok-blok tersebut diterima dengan bidang thinking yang kosong bersama signature-nya.

Tidak ada permintaan yang gagal. Tidak ada error yang dicatat. Aplikasi yang mengalirkan teks antartool kepada penggunanya sebagai indikator kemajuan tiba-tiba berhenti menampilkan kemajuan di antara pemanggilan tool dan mulai tidak menampilkan apa pun. Gejala yang terlihat adalah UI yang tampak membeku tepat selama rentang pekerjaan ketika pengguna paling menginginkan kepastian, dan akan dilaporkan sebagai masalah performa, masalah jaringan, atau hang — bukan sebagai bug migrasi. Inilah perubahan yang dikirim ke produksi.

Perbaikannya adalah pengaturan tampilan, ditambah pembacaan yang cocok dengannya:

• Atur thinking.display ke "updates" — beta, di balik thinking-display-updates-2026-08-18 header — untuk mengembalikan pembaruan progres sementara penalarannya sendiri tetap tersembunyi. Inilah pengaturan yang diinginkan oleh feed progres.

• Atau setel ke "summarized" untuk menerima pembaruan progres dan ringkasan penalaran yang dicampur bersama dalam blok yang sama.

• Lalu baca teks dari blok thinking, bukan dari blok teks, render setiap blok thinking yang tidak kosong sebelum blok tool_use yang didahuluinya, dan kembalikan blok-blok tersebut tanpa perubahan bersama sisa giliran asisten.

Catatan Anthropic sendiri tentang hal ini patut dikutip dalam semangatnya: antarmuka yang menampilkan teks di antara pemanggilan alat diharapkan menetapkan nilai tampilan, bukan mengandalkan nilai default. Jika integrasi Anda saat ini sepenuhnya mengabaikan blok pemikiran, itulah satu-satunya tempat di mana default aman.

A single-column scoreboard titled 'Claude Opus 5.5 — the migration at a glance' listing six rows: thinking always on and cannot be disabled; forced tool use returning a 400 error; thinking blocks bound to the model and the conversation; the old computer tool rejected on the Claude API and Google Cloud; progress text hidden by default; and the fix of setting thinking.display to summarized. Footer reads: per Anthropic's Claude Opus 5.5 migration guide, read 2026-09-24; vendor-reported.

Usaha adalah permukaan API.

Karena thinking tidak dapat dinonaktifkan, output_config.effort menjadi satu-satunya pengatur seberapa banyak model bernalar, dan karena itu satu-satunya pengatur biaya dan latensi untuk tugas tertentu. Ada empat hal tentangnya yang perlu diketahui sebelum Anda menyalin pengaturan dari model lama.

Default telah bergeser. Claude Opus 5.5 secara default menggunakan upaya sedang, sedangkan Claude Opus 5 dan model Opus sebelumnya secara default menggunakan upaya tinggi. Permintaan yang menghilangkan upaya kini berjalan satu tingkat lebih rendah daripada sebelum pergantian tersebut. Anthropic juga mendokumentasikan bahwa model cenderung berpikir lebih banyak per giliran pada pengaturan upaya tertentu dibandingkan Claude Opus 5, terutama pada xhigh dan max. Kedua efek tersebut saling mendorong ke arah yang berlawanan, dan itulah sebabnya instruksi vendor adalah menjalankan penyapuan upaya baru pada eval Anda sendiri alih-alih memindahkan pengaturan dari satu konteks ke konteks lain.

Skalanya adalah low / medium / high / xhigh / max, kelimanya didukung di sini. Tingkat yang disebutkan itu pada dasarnya bukan anggaran token yang tetap — Anthropic mendeskripsikan effort sebagai sinyal perilaku, bukan anggaran yang ketat — dan alokasi token di balik setiap tingkat berubah antar model, jadi "high" pada Claude Opus 5.5 bukanlah "high" pada Claude Opus 5. Menyetel effort ke default model sama saja dengan tidak menyertakannya.

Dua detail operasional, karena keduanya memakan biaya jika terlewat. Pertama, mengubah nilai effort tingkat atas antar permintaan membatalkan cache prompt: pilih satu tingkat dan pertahankan konstan dalam percakapan yang mengandalkan cache hit, lalu variasikan antar beban kerja. Kedua, model ini mendukung effort per pesan (header beta mid-conversation-output-config-2026-07-01), yang mengubah tingkat dari giliran yang lebih belakangan tanpa memulai ulang cache. Minimum cache prompt di sini adalah 512 token, turun dari 1.024 pada generasi sebelumnya, sehingga prompt yang sebelumnya terlalu pendek untuk di-cache kini dapat membuat entri tanpa perubahan kode.

Batas keluaran: 128K sinkron, 300K pada Batch

Messages API sinkron membatasi output pada 128K token. Message Batches API mencapai 300K token output di balik output-300k-2026-03-24 header beta — string persis itu. Input adalah jendela konteks 1M token penuh secara default tanpa memerlukan header.

Pembacaan praktisnya: batas 128K tidak berubah dari Claude Opus 5, jadi tidak ada bagian dari integrasi sinkron yang perlu dianggarkan ulang hanya pada poros itu. Yang perlu dianggarkan ulang adalah proses berpikir di dalamnya. Karena max_tokens kini mencakup proses berpikir plus teks pada setiap permintaan, nilai yang tadinya pas untuk teks respons di Claude Opus 5 menjadi lebih ketat di sini — dan pada tingkat upaya xhigh atau max, vendor menyarankan untuk memulai dari 64k lalu melakukan penyetelan. Jika pekerjaan berjalan lama yang ukurannya ditetapkan berdasarkan batas sinkron 128K kini terpotong, yang berubah bukanlah batas itu.

Safeguard routing adalah bagian dari spesifikasi.

Ini fakta integrasi, bukan catatan kaki kebijakan: pada beberapa prompt, string model yang Anda kirim tidak menggambarkan apa yang menjawab.

Claude Opus 5.5 hadir dengan pengklasifikasi keamanan, dan permintaan yang ditolak dikembalikan sebagai HTTP 200 dengan stop_reason: "refusal" dan sebuah stop_details yang menyebutkan area kebijakannya. Model ini mencakup lebih banyak kategori daripada Claude Opus 5 — perkirakan bio, frontier_llm dan reasoning_extraction di samping yang sudah dikenal, yaitu cyber. Penolakan reasoning_extraction diblokir sepenuhnya alih-alih dicoba ulang: fallback sisi server Anthropic tidak mencobanya ulang, dan penolakan itu dikembalikan kepada Anda.

Untuk kategori yang melakukan percobaan ulang, mekanismenya adalah sebuah parameter. Setel fallbacks ke "default" dengan server-side-fallback-2026-07-01 sebagai header beta dan API menjalankan ulang permintaan yang ditolak pada model yang direkomendasikan Anthropic untuk kategori tersebut, dalam satu panggilan, dan mengembalikan satu respons. Pusat bantuan Anthropic menyebutkan perutean untuk model ini secara langsung: permintaan keamanan siber yang ditandai dialihkan ke Claude Opus 4.8, dan pengklasifikasi biologinya — set bergaya Fable-5 — menyebabkan fallback ke Claude Opus 5 untuk pekerjaan ilmu hayati penggunaan ganda. Seperangkat kecil kemampuan pengembangan LLM frontier juga dialihkan ke Claude Opus 5. Anthropic juga mencatat bahwa pemeriksaan meninjau semua yang dibaca model, bukan hanya pesan terbaru Anda, sehingga memori, konten konektor, hasil pencarian, dan file dapat memicu pergantian.

Tiga hal yang perlu diperhatikan untuk integrasi Anda. Bacalah tingkat atas model kolom pada setiap respons, karena kolom ini melaporkan model yang sebenarnya menghasilkan pesan tersebut, dan fallback blok konten menandai setiap titik alih tangan. Verifikasi batas laju milik fallback itu sendiri, karena fallback yang terkena batas laju tidak akan dicoba dan penolakan yang dikembalikan sebagai gantinya — fallback menurun menjadi penolakan saat beban tinggi. Dan perlakukan setiap hasil tolok ukur yang dipublikasikan dengan pengaman aktif sebagai pengukuran sistem yang dirutekan, bukan semata Claude Opus 5.5, yang persis seperti yang dikatakan Anthropic tentang angka-angkanya sendiri di bawah ini.

Fallback sisi server bersifat beta dan hanya untuk Claude API: fitur ini tidak didukung pada Message Batches API, dan tidak tersedia di Amazon Bedrock, Google Cloud, atau Microsoft Foundry, yang di sana middleware SDK justru merupakan jalur yang didokumentasikan. Di sisi verifikasi, jalur akses tersedia untuk kedua kategori — Cyber Verification Program dan Life Sciences Verification Program — tetapi perhatikan asimetri yang didokumentasikan pusat bantuan Anthropic pada saat penulisan ini: Claude Opus 5.5 saat ini tidak tercantum dalam Cyber Verification Program, sementara program ilmu hayat dijelaskan memberikan organisasi terverifikasi akses ke model-model paling cakap.

Konteks, batas waktu, pensiun, dan Mode Cepat

Sisa envelope, dari halaman model dan tabel deprecations:

• Jendela konteks — 1 juta token, default, tanpa header beta.

• Batas pengetahuan — Juni 2026, yang juga merupakan batas data pelatihan.

• Pensiun — tidak lebih cepat dari 2027-09-22 di platform yang dioperasikan Anthropic, dengan pemberitahuan setidaknya 60 hari sebelumnya. Amazon Bedrock dan Google Cloud menetapkan tanggalnya sendiri. Claude Opus 5 berstatus Aktif setidaknya hingga 2027-07-24, jadi tidak ada peralihan paksa.

• Daftar tarif — $4.00 per juta masukan, $20.00 per juta keluaran, $5.00 per juta penulisan cache 5 menit, $8.00 per juta penulisan cache 1 jam, $0.20 per juta pembacaan cache. Batch berharga setengah harga di kedua arah, yaitu $2.00 / $10.00.

• Pembacaan cache adalah pencilan yang patut diperhatikan: $0,20 adalah 5% dari input dasar, sedangkan sebagian besar model Claude berada di 10% dan Claude Fable 5.1 di 2,5%. Beban kerja campuran dengan penggunaan ulang cache yang tinggi merasakannya sebagai diskon nyata.

• Mode cepat — masih didokumentasikan sebagai pratinjau riset, hanya Claude API, dengan harga terpisah $8.00 input / $40.00 output per juta. Aktifkan dengan speed: "fast" dan fast-mode-2026-02-01 header beta. Fitur ini tidak tersedia di Bedrock, Claude Platform di AWS, Google Cloud, atau Microsoft Foundry, tidak dengan Batch API, dan tidak dengan komitmen Priority Tier. Perlu dicatat bahwa Claude Opus 5.5 sama sekali tidak mendukung Priority Tier.

Apa yang dikatakan tolok ukur, dan pada pengaturan yang mana

Pengaturan effort adalah alasan tabel vendor dan tabel independen tidak dapat dibandingkan baris per baris, dan alasan setiap angka di bawah ini menyertakan pengaturannya.

Dilaporkan oleh vendor, harness milik Anthropic sendiri. Catatan peluncuran Anthropic menyatakan bahwa, kecuali dinyatakan lain, semua hasil Claude Opus 5.5 menggunakan adaptive thinking pada max effort; pengecualiannya adalah Terminal-Bench 4.0, yang dilaporkan pada xhigh untuk Claude Opus 5.5 dan high untuk GPT-6 Astra karena itu adalah skor tertinggi masing-masing model. Atas dasar itu, vendor melaporkan Terminal-Bench 4.0 sebesar 66,4%, FrontierCode v1.1 Main sebesar 54,4%, CursorBench 4.0 sebesar 57,8%, GDPval-AA v2.1 sebesar 1.846 Elo, AutomationBench sebesar 40,0%, Humanity's Last Exam dengan tools sebesar 67,7%, Terminal-Bench-Science 0.1 sebesar 58,7%, OSWorld 2.0 sebesar 81,8% parsial, dan Chartography dengan tools sebesar 89,0%. Pada effort medium default model ini, vendor memberikan FrontierCode sebesar 54,6% dan CursorBench sebesar 52,5%. Perhatikan apa yang diungkapkan dalam catatan yang sama: evaluasi dijalankan dengan pengaman produksi aktif, dan ketika pengaman itu terpicu, tugas-tugas keamanan siber diselesaikan oleh Claude Opus 4.8 serta tugas-tugas biologi dan pengembangan LLM frontier oleh Claude Opus 5 — Anthropic menyatakan hal ini kemungkinan menurunkan performa Claude Opus 5.5 pada benchmark tersebut. Karena itu, skor yang dipublikasikan pada evaluasi yang terdampak bukanlah pengukuran yang bersih untuk model ini.

Independen, Artificial Analysis. Pada Intelligence Index v4.3.2, Claude Opus 5.5 mencetak 58 dalam konfigurasi yang oleh Artificial Analysis dilabeli "Adaptive Reasoning, Max Effort, Default Fallback" — skor tertinggi yang terukur darinya, unggul beberapa poin, dan memimpin enam dari sepuluh evaluasi penyusunnya. Pada indeks yang sama dan harness yang sama, Claude Fable 5.1 mencetak 53 dan Claude Opus 5 mencetak 51. Artificial Analysis mempublikasikan tangga effort secara lengkap, yang merupakan artefak independen paling berguna di sini: max 58, xhigh 56, high 54, medium 51, low 42. Pengukurannya sendiri menempatkan Claude Opus 5.5 pada sekitar 119.000 token output per tugas indeks pada effort max, dibandingkan dengan sekitar 73.000 untuk Claude Opus 5, 78.000 untuk Claude Fable 5.1, dan 27.000 untuk GPT-6 Astra — token yang ditagih sebagai token output — dan halamannya melaporkan biaya $5,98 per tugas indeks. Pihaknya juga mengukur Terminal-Bench 4.0 pada 59,6% dan Humanity's Last Exam pada 61,4%, dibandingkan dengan 66,4% dan 67,7% dari vendor pada effort max di harness yang berbeda.

Bacalah kedua paragraf itu secara berdampingan dan kesimpulan jujurnya sempit. Terminal-Bench 66,4% dari vendor dan 59,6% independen adalah tolok ukur yang sama yang dijalankan oleh orang berbeda pada pengaturan yang tidak dijamin sama, dan keduanya bukan bukti tentang beban kerja Anda. Tangga upaya adalah temuan yang dapat dialihkan: pada indeks independen, pengaturan model ini sendiri merentang enam belas poin, yang merupakan rentang lebih lebar daripada selisih antara model ini dan pendahulunya. Memilih tingkat upaya lebih penting daripada memilih di antara model-model ini, dan klausa "Default Fallback" pada label itu adalah perutean pengaman yang dijelaskan di atas, bukan artefak tolok ukur.

Efisiensi yang dilaporkan vendor, dengan atribusi. Anthropic mengatakan Claude Opus 5.5 tampil pada level Claude Fable 5.1 untuk sebagian besar pekerjaan dengan biaya menjalankan sekitar 40% lebih rendah, dan bahwa beban kerja tipikal berbiaya sekitar 40% lebih murah daripada di Claude Opus 5, meskipun hanya ada pemotongan harga resmi sebesar 20%. Outputnya lebih dari 30% lebih cepat. Ini semua adalah karakterisasi vendor atas rata-rata di seluruh beban kerja yang dipilih vendor. Pernyataan pelanggan saat peluncuran adalah jenis bukti yang sama: Box melaporkan sepertiga token dan jawaban yang sekitar 40% lebih ringkas, Kiro sekitar setengah token dan sekitar 40% lebih sedikit panggilan, Factory 20–25% lebih sedikit token keluaran, GitHub termasuk yang paling sedikit token dan langkah yang pernah diukurnya. Anthropic juga melaporkan uji pemeriksaan fakta internal di mana 16 dari 18 laporannya memenuhi standar kualitas yang tidak pernah dilewati oleh Claude Fable 5.1 maupun Claude Opus 5 dalam upaya apa pun. Semuanya dilaporkan vendor dan tidak ada yang diaudit. Keterbatasan yang diungkapkan ini luar biasa jujur dan layak disertakan: Anthropic mengatakan Claude Opus 5.5 "sering menduga dirinya sedang dievaluasi".

Terakhir, model-model saudaranya: Anthropic mengatakan Claude Sonnet 5.5 dan Claude Haiku 5.5 akan hadir "dalam beberapa minggu mendatang". Keduanya belum dirilis, keduanya belum memiliki harga, dan keduanya belum tersedia di platform mana pun saat ini.

Menguji keempat perubahan tanpa cutover penuh

Risiko migrasi di sini bukanlah kualitas — melainkan bahwa jalur kode yang tidak pernah Anda uji di staging adalah jalur yang mengembalikan 400 di produksi. Keempat breaking change tersebut semuanya merupakan perubahan bentuk request, yang berarti semuanya gagal secara deterministik dan segera, dan satu-satunya cara untuk menemukan jalur yang terlewat adalah dengan mengalirkan lalu lintas nyata melalui jalur-jalur itu.

Claude Opus 5.5 tersedia di OrcaRouter sebagai anthropic/claude-opus-5.5dengan harga daftar milik Anthropic sendiri tanpa markup 0% — harga daftar penyedia diteruskan apa adanya, jadi perubahan harga vendor langsung berlaku di sini pada hari yang sama.

The OrcaRouter model page for Claude Opus 5.5, showing the identifier anthropic/claude-opus-5.5, input at $4.00 and output at $20.00 per 1M tokens, a 1M-token context window, 128K max output, text plus image and file input, and OpenAI-compatible and Anthropic Messages endpoints served from api.orcarouter.ai.

Itu memungkinkan Anda mengarahkan persentase lalu lintas produksi ke model tersebut sementara sisanya tetap berjalan di Claude Opus 5, memantau permintaan mana yang gagal dan mengapa, lalu memperbaikinya satu per satu. Keempat galat tersebut bersifat menjelaskan sendiri: masing-masing menyebutkan parameter yang ditolaknya dan, pada tiga dari empat kasus, penggantinya. Failover otomatis menutupi celah selama suatu jalur masih rusak — permintaan yang gagal terhadap model yang belum sepenuhnya Anda karakterisasi akan dialihkan ke model yang sudah Anda kenali, alih-alih memunculkan 400 ke pengguna.

Urutan kerja yang praktis: tukar ID model dan setel effort secara eksplisit terlebih dahulu, karena nilai default-nya sudah berubah ke medium; selanjutnya hapus jalur thinking-disabled dan forced-tool-choice; lalu perbaiki pembaca streaming — pemilihan blok berdasarkan tipe dan pengaturan thinking.display — karena itulah yang gagal secara senyap, bukan secara mencolok; dan sisakan migrasi toolset computer-use untuk terakhir jika Anda menggunakan Bedrock, karena itulah yang tidak berlaku di sana. Semua hal lainnya — harga, jendela konteks, tarif cache, dan default 1M-token — sudah seperti yang Anda tinggalkan.

Rutekan sebagian lalu lintas langsung ke model baru tanpa peralihan penuh: Claude Opus 5.5 di OrcaRouterberjalan pada harga daftar Anthropic dengan failover otomatis ke model yang sudah Anda karakterisasi.

Dibandingkan dalam artikel ini4

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari