
Claude Opus 5.5 vs Claude Opus 5: Tingkat Upaya Tidak Berarti Hal yang Sama
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Hal pertama yang perlu diketahui sebelum membandingkan Claude Opus 5.5 dengan Claude Opus 5 adalah bahwa kedua model tidak berbagi skala effort yang sama, dan hampir setiap perbandingan head-to-head yang akan Anda baca minggu ini mengabaikan hal itu. Opus 5 secara default menggunakan high effort. Opus 5.5 secara default menggunakan medium, dan pada level bernama yang sama ia berpikir lebih banyak per giliran daripada pendahulunya. Jadi "Opus 5.5 pada default versus Opus 5 pada default" bukanlah eksperimen terkontrol — ini adalah perbandingan antara dua jumlah pemikiran yang berbeda. Vendor mengatakan hal itu juga dalam panduan migrasinya sendiri: uji beberapa level effort, dan jangan gunakan ulang pengaturan Opus 5, karena level dengan nama yang sama tidak dipetakan ke anggaran pemikiran yang sama. Setelah Anda mengontrol hal itu, kesenjangan antara kedua model menyempit di beberapa tempat, melebar di tempat lain, dan keputusan upgrade bergantung pada sesuatu selain kemampuan mentah — biaya per tugas yang diselesaikan, dan empat perubahan API yang akan merusak kode yang berjalan di Opus 5 saat ini.
Apa yang sebenarnya berbeda, spesifikasi demi spesifikasi

Kedua model ini di atas kertas lebih mirip daripada yang tersirat dari nomor versinya:
• Harga — Claude Opus 5.5 sebesar $4,00 untuk input / $20,00 untuk output per juta token vs Claude Opus 5 sebesar $5,00 / $25,00
• Pembacaan cache — $0.20 per juta vs $0.50 per juta, pemotongan 60% pada pos biaya yang mendominasi eksekusi agentic
• Penulisan cache — $5 per juta untuk jendela 5 menit dan $8 untuk jendela 1 jam pada 5.5, dibandingkan $6.25 pada Opus 5
• Konteks dan output — 1 juta token konteks dan 128K output pada keduanya; keduanya mencapai output 300K pada Batch API di balik output-300k-2026-03-24 header beta
• Upaya default — sedang pada Opus 5.5 vs tinggi pada Opus 5
• Berpikir — adaptif dan selalu aktif di keduanya, tetapi pada Opus 5.5 tidak bisa lagi dinonaktifkan sama sekali
• Batas pengetahuan — Juni 2026 vs Mei 2026
• Latensi — Anthropic menilai Opus 5.5 "moderat" dibandingkan dengan jajaran model saat ini, dan menyatakan bahwa model ini menghasilkan output lebih dari 30% lebih cepat daripada Opus 5
• Pensiun — tidak lebih awal dari 22 September 2027 untuk Opus 5.5, dan tidak lebih awal dari 24 Juli 2027 untuk Opus 5
Perhatikan apa yang tidak berbeda: jendela konteks, batas keluaran, diskon batch, dan model pemikiran adaptif yang selalu aktif. Opus 5.5 bukanlah model dengan konteks lebih besar atau keluaran lebih panjang. Model ini lebih murah, lebih cepat, dan lebih efisien secara token dalam cakupan yang sama.
Tolok ukur, dan tanda bintang usaha pada masing-masingnya

Angka-angka ini berasal dari materi peluncuran Anthropic — dilaporkan oleh vendor, dijalankan terhadap model-modelnya sendiri — dan pengaturan effort lebih penting di sini daripada nama model:
• Terminal-Bench 4.0 — 66.4% vs 52.3%, dengan Opus 5.5 dijalankan pada upaya xhigh, bukan pada pengaturan default
• FrontierCode v1.1 (Main) — 54,4% vs 48,0%, dan 54,6% untuk Opus 5.5 pada upaya medium bawaan
• CursorBench 4.0 — 57,8% vs 46,6%, dan 52,5% pada tingkat sedang
• GDPval-AA v2.1 — 1846 Elo vs 1708
• AutomationBench — 40,0% vs 26,9%
• Humanity's Last Exam, dengan alat — 67,7% vs 63,6%
• Terminal-Bench-Science 0.1 — 58,7% vs 29,0%, selisih terlebar dalam kumpulan ini
• OSWorld 2.0 — 81,8% parsial vs 74,0%
• Chartography, dengan alat — 89,0% vs 83,4%
Hasil FrontierCode adalah yang perlu dikaji. Opus 5.5 mencetak 54,4% pada xhigh dan 54,6% pada medium — secara statistik angka yang sama, dengan hanya sebagian kecil anggaran berpikir. Apa pun peningkatan yang dibuat Anthropic, pada tolok ukur itu peningkatan tersebut tidak berasal dari berpikir lebih keras. CursorBench bergerak ke arah sebaliknya: 57,8% pada xhigh dibandingkan dengan 52,5% pada medium, selisih lima poin yang menunjukkan bahwa upaya masih menghasilkan akurasi nyata pada beberapa tugas. Pelajarannya bukanlah "gunakan medium" atau "gunakan xhigh"; melainkan bahwa tingkat upaya yang tepat kini menjadi pengukuran per beban kerja, dan kebiasaan lama membiarkan Opus 5 pada default high-nya tidak lagi memberi tahu Anda apa pun tentang model baru.
Anthropic menambahkan satu catatan yang layak diulang: pada tingkat kemampuan ini, margin tolok ukur adalah "panduan yang kurang dapat diandalkan untuk perbedaan di dunia nyata," dan perusahaan tersebut mengatakan bahwa kesenjangan internalnya dengan Claude Fable 5.1 lebih sempit daripada yang tersirat dari skor yang dipublikasikan. Itu adalah pihak vendor yang memberi tahu Anda agar tidak membaca terlalu jauh ke dalam tabelnya sendiri.
Biaya per tugas yang diselesaikan adalah perbandingan yang menentukan
Harga per token adalah satuan yang salah untuk agen, dan perbandingan inilah tempat hal itu terlihat. Contoh perhitungan Anthropic sendiri: sebuah analisis merger yang memakan waktu 63 menit pada Opus 5.5 dan biayanya 50% lebih murah daripada tugas yang sama pada Opus 5, yang memakan waktu 93 menit. Daftar tarif menjelaskan sebagian dari itu — pemotongan 20% pada input dan output, 60% pada pembacaan cache — tetapi tidak semuanya. Sisanya adalah model yang menggunakan lebih sedikit token dan lebih sedikit giliran untuk mencapai hasil yang sama. Kutipan pelanggan yang diterbitkan bersama peluncuran menunjuk ke arah yang sama: Box melaporkan sepertiga token dan jawaban yang sekitar 40% lebih ringkas, Kiro sekitar setengah token dengan 40% lebih sedikit panggilan, Factory 20–25% lebih sedikit token output, GitHub termasuk yang paling sedikit token dan langkah yang pernah diukurnya.
Itu adalah pernyataan pelanggan yang diterbitkan vendor, bukan hasil yang diaudit, dan angka agregat "sekitar 40% lebih murah untuk beban kerja umum" adalah karakterisasi Anthropic atas rata-rata di seluruh beban kerja yang dipilihnya. Versi jujurnya untuk perencanaan Anda sendiri: anggap potongan harga resmi 20% itu nyata dan bisa diandalkan, lalu perlakukan tambahan 20% sebagai hipotesis yang dapat Anda uji dalam satu sore dengan menjalankan tugas yang sama pada kedua model dan menghitung token.
Satu catatan struktural tentang mengapa pemotongan biaya cache berdampak jauh lebih besar daripada porsinya. Agen yang mengirim ulang prompt sistem yang panjang dan pohon file setiap giliran membayar tarif baca cache untuk sebagian besar inputnya, bukan tarif input baru. Menurunkannya dari $0,50 menjadi $0,20 per juta mengubah ekonomi sesi berjalan lama jauh lebih besar daripada yang ditunjukkan tarif utama — dan itulah alasan beban kerja yang hanya nyaris layak di Opus 5 dapat menjadi jelas layak di Opus 5.5 tanpa perubahan apa pun pada prompt Anda.
Empat perubahan yang merusak, sebagai daftar periksa migrasi
Opus 5.5 adalah model baru, bukan Opus 5 yang hanya diganti namanya, dan catatan migrasi Anthropic mencantumkan empat perubahan yang akan merusak kode yang sudah berjalan di produksi:
• Thinking tidak dapat dinonaktifkan. Setiap jalur kode yang menonaktifkan thinking akan error atau mengubah perilaku, dan kedalaman kini hanya dikendalikan melalui parameter effort.
• Penggunaan alat secara paksa akan menghasilkan error. tool_choice yang memaksa penggunaan alat tertentu tidak didukung.
• Blok Thinking terikat pada model yang menghasilkannya dan pada percakapan, sehingga blok tersebut tidak dapat diputar ulang lintas model seperti yang diasumsikan oleh sebagian pipeline.
• Alat penggunaan komputer yang lebih awal, computer_20251124 tidak diterima di Claude API atau di Google Cloud.
Ada perubahan kelima yang tidak menggagalkan apa pun dan karena itu lebih berbahaya. Teks di antara panggilan alat kini dikembalikan di dalam blok pemikiran yang teksnya kosong pada pengaturan tampilan bawaan. Jika aplikasi Anda menstrimkan teks itu kepada pengguna sebagai pembaruan progres, aplikasi akan diam di antara panggilan alat sampai Anda menetapkan nilai tampilan yang mengembalikan teks tersebut. Setiap pengujian lulus; antarmuka hanya berhenti memberikan narasi.
Tiga hal pertama juga berlaku untuk Claude Fable 5.1, jadi tim yang sudah bermigrasi ke model tersebut telah melakukan sebagian dari pekerjaan ini. Tim yang masih menggunakan Opus 5 belum melakukannya.
Ketika Opus 5 masih menjadi pilihan yang tepat
Peningkatan ini tidak otomatis, dan ada empat alasan nyata untuk tetap bertahan:
• Prediktabilitas biaya. Opus 5 adalah model yang sudah Anda karakterisasi. Jika anggaran Anda dimodelkan berdasarkan konsumsi tokennya, beralih ke model yang berpikir dengan jumlah berbeda pada tingkat upaya dengan nama yang sama akan membuat model tersebut tidak valid sampai Anda mengukurnya ulang.
• Kompatibilitas. Jika ada bagian dari stack Anda yang bergantung pada menonaktifkan thinking, memaksa sebuah tool, atau tool computer-use yang lama, migrasinya adalah pekerjaan kode, bukan sekadar penukaran string.
• Perutean pengamanan. Opus 5.5 dilengkapi dengan pengamanan kelas Fable 5.1, yang berarti sebagian besar permintaan keamanan siber dialihkan ke Claude Opus 4.8 dan pekerjaan biologi beralih ke Claude Opus 5 kecuali akun Anda terverifikasi. Jika produk Anda berada di salah satu domain tersebut, "peningkatan" dapat berarti pengguna Anda mendapatkan jawaban dari model yang lebih kecil. Opus 5 tidak memiliki perutean tersebut.
• Umur panjang. Opus 5 tidak akan ke mana-mana dalam waktu dekat — Anthropic mencantumkan penghentian tidak lebih awal dari 24 Juli 2027, yang berarti sepuluh bulan lagi.
Bagi semua orang lainnya, perhitungannya sederhana: kemampuan lebih besar, harga lebih rendah, token lebih sedikit, dan daftar periksa migrasi yang dapat diselesaikan seorang insinyur dalam sehari.
Menjalankan keduanya selama peralihan

Bagian yang canggung dari setiap migrasi unggulan adalah bagian tengahnya: Anda ingin Opus 5.5 menangani lalu lintas baru tanpa mempertaruhkan jalur produksi pada model yang belum Anda karakterisasi pada pengaturan upaya Anda sendiri, dan Anda ingin tetap membuat Opus 5 melayani sementara Anda mencari tahu. Ini masalah perutean, bukan masalah re-platforming, dan ada baiknya kita tepat tentang apa yang berada di mana. Claude Opus 5 sudah tersedia di OrcaRouter hari ini dengan harga daftar Anthropic sendiri dengan markup 0% — harga daftar penyedia diteruskan apa adanya, sehingga perubahan tarif vendor langsung aktif di sisi kami pada hari yang sama, bukan setelah sinkronisasi. Claude Opus 5.5 belum menjadi salah satu rute kami; model ini tersedia melalui API Anthropic sendiri dan cloud-cloud utama. Saat hadir, model ini menjadi satu rute lagi pada kunci yang sama, bukan kontrak kedua dan SDK kedua, yang memungkinkan Anda menempatkan persentase lalu lintas pada model baru sementara failover otomatis menjaga sisanya pada model yang sudah Anda karakterisasi. Menyusun panggilan lintas keduanya — draf dari satu model dan tahap verifikasi dari model lainnya — adalah satu baris routing-DSL.
Jelaskan dengan tepat apa manfaatnya bagi Anda. Hal ini tidak memberi Anda tolok ukur independen untuk Opus 5.5; belum ada yang bisa, karena satu-satunya perbandingan langsung yang dipublikasikan adalah milik Anthropic sendiri dan pelacak independen masih menetapkan konfigurasi upaya. Yang diberikannya kepada Anda adalah satu-satunya pengukuran yang benar-benar prediktif terhadap tagihan Anda, pada prompt Anda, pada tingkat upaya yang akan Anda gunakan.
Aturan keputusan
Jika Anda memulai sesuatu yang baru, gunakan Claude Opus 5.5 dan mulailah pada medium effort, lalu ukur apakah low tetap bertahan pada tugas Anda — Anthropic melaporkan bahwa low mendekati pengaturan yang lebih tinggi pada beberapa evaluasi coding dengan biaya yang jauh lebih rendah, dan angka FrontierCode di atas menunjukkan bahwa pengaturan default tidak menyisakan banyak potensi yang belum dimanfaatkan.
Jika Anda menjalankan Claude Opus 5 di produksi, pemicu untuk bermigrasi bukanlah tabel benchmark. Pemicunya adalah apakah Anda dapat menyerap empat perubahan API dan apakah beban kerja Anda berada di bidang keamanan siber atau biologi, tempat perutean pengaman akan diam-diam mengalihkan sebagian traffic Anda ke model yang lebih kecil. Segala hal lain tentang peningkatan ini adalah pemotongan harga yang menyamar sebagai peluncuran model, dan semua itu layak untuk diambil.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
