
Claude Sonnet 5.5 vs Claude Opus 5: Lebih Murah di Setiap Lini, dan Unggul di Indeks
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 984 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Claude Opus 5 dirilis pada 24 Juli 2026 dengan harga $5,00 per juta token input dan $25,00 per juta token output. Claude Sonnet 5.5 mencapai ketersediaan umum pada 28 September 2026 dengan harga $2,00 dan $10,00. Itu berarti potongan 60% pada input dan potongan 60% pada output untuk model yang dua generasi lebih baru — dan, pada harness yang dijalankan Artificial Analysis terhadap keduanya, model yang berada di 56 pada Intelligence Index v4.3 dibandingkan 51 milik Claude Opus 5. Ini adalah perbandingan langka ketika model yang lebih baru dan lebih murah juga menjadi model dengan skor lebih tinggi pada indeks pihak ketiga, dan ketika alasan yang tersisa untuk model petahana bukanlah peringkat benchmark melainkan kelas pekerjaan tertentu. Kedua model menerima konteks 1 juta token, keduanya menghasilkan hingga 128K token, keduanya membaca teks, gambar, dan file, dan keduanya mengonfigurasi penalaran melalui parameter effort alih-alih anggaran token berpikir. Karena antarmukanya sama, memilih di antara keduanya murni pertanyaan tentang berapa biaya tugas yang selesai dan tugas mana yang gagal.
Dua rilis, satu antarmuka
Mulailah dari betapa sedikitnya perubahan, karena itu lebih banyak daripada di sebagian besar lompatan generasi.
• Jendela konteks — 1.000.000 token pada keduanya
• Output maksimum — 128.000 token pada keduanya
• Modalitas masukan — teks, gambar, dan berkas pada keduanya; tidak ada audio, tidak ada video pada keduanya
• Penalaran — pemikiran adaptif dengan tingkat usaha yang dapat dikonfigurasi pada keduanya, sehingga kedalaman menjadi parameter permintaan, bukan string model terpisah
• Kemampuan — visi, alat, JSON, dan penalaran pada keduanya, sesuai entri katalog OrcaRouter untuk anthropic/claude-opus-5 dan lini Sonnet
Konsekuensi praktisnya adalah prompt yang ditulis untuk Claude Opus 5 tidak perlu ditulis ulang agar dapat dijalankan pada Claude Sonnet 5.5, dan loop agen yang disetel di sekitar batas output 128K tidak memerlukan tier baru. Migrasi hanyalah penukaran string model plus pemeriksaan ulang setelan effort mana yang Anda sematkan — tidak lebih. Bagi tim yang mengalami langsung transisi multi-modal dan multi-parameter dalam dua tahun terakhir, itulah berita utamanya, bukan tolok ukurnya.
Satu hal yang memang berubah adalah harga, dan harga itu berubah di setiap lini, bukan hanya pada dua yang ada di slide pemasaran.
• Input — $2.00 per juta dibandingkan $5.00, pengurangan 60%
• Output — $10.00 per juta dibandingkan $25.00, potongan 60%
• Pembacaan cache — $0,20 per juta dibandingkan $0,50, potongan 60%
• Penulisan cache — $2,50 per juta dibandingkan $10,00 untuk jendela lima menit, potongan 75%
Jika Anda menjalankan agen yang membaca ulang prefiks panjang pada setiap giliran, baris pembacaan cache-lah yang membayar migrasi tersebut. Pada $0,20 dibandingkan $0,50, setiap token yang di-cache dalam sesi panjang turun menjadi 40% dari biaya lamanya, dan pembacaan cache adalah bagian terbesar dari jumlah token di sebagian besar loop agentik. Penghematannya berlipat ganda dengan cara yang tidak tertangkap oleh angka utama per token.
Dari mana lima poin itu berasal
Artificial Analysis memberi skor Claude Sonnet 5.5 sebesar 56 dan Claude Opus 5 sebesar 51 pada Intelligence Index v4.3, keduanya diukur dalam konfigurasi "Adaptive Reasoning, Max Effort". Lima poin bukanlah kesalahan pembulatan pada skala itu — sebagai konteks, evaluator yang sama menempatkan Sonnet 5 pada 38 dan Gemini 3.1 Pro Preview pada 30, jadi selisih antara Claude Opus 5 dan Claude Sonnet 5.5 adalah sepertiga dari selisih antara Claude Opus 5 dan generasi Sonnet sebelumnya.
Angka peluncuran Anthropic sendiri untuk Claude Sonnet 5.5 menunjuk ke arah yang sama dengan instrumen yang berbeda. Perusahaan melaporkan 70,6% pada Terminal-Bench 4.0 — tes yang sama yang pada Claude Opus 5 terdokumentasi sebesar 89,1% dalam tabel Anthropic sebelumnya, angka yang menggunakan revisi harness berbeda dan tidak boleh dikurangkan dari angka yang lebih baru. Itulah satu peringatan sumber paling penting dalam artikel ini: Terminal-Bench beralih ke 4.0 pada pertengahan 2026, indeks yang mencantumkannya direvisi ke v4.3 agar selaras, dan perbandingan lintas versi tolok ukur tersebut bukan operasi aritmetika. Jika sebuah angka menyertakan versi, sebutkan versinya.
Yang bisa dibandingkan secara bersih adalah progresi sisi Sonnet milik vendor itu sendiri — 10,3% pada Terminal-Bench 4.0 untuk Sonnet 5 menjadi 70,6% untuk Sonnet 5.5 — dan pembacaan indeks pihak ketiga, di mana kedua angka berasal dari harness yang sama pada hari yang sama. Berdasarkan bukti itu, penerusnya benar-benar telah melampaui flagship Juli untuk penalaran umum, yang merupakan klaim lebih kuat daripada yang dibuat oleh slide vendor mana pun.
Jebakan panjang keluaran
Di sinilah aritmetika berhenti bersikap baik terhadap model yang lebih baru.
Artificial Analysis melaporkan bahwa mengevaluasi Claude Sonnet 5.5 pada rangkaian indeksnya menghabiskan biaya $7,60 per tugas. Claude Opus 5 menghabiskan $5,86 per tugas pada rangkaian yang sama. Model yang lebih baru, dengan potongan 60% pada setiap baris daftar tarifnya, justru sekitar 30% lebih mahal untuk menyelesaikan satu tugas. Alasannya ada dalam laporan yang sama: Sonnet 5.5 mengeluarkan 410 juta token di seluruh rangkaian dibandingkan median 88 juta pada model-model yang dilacak, yang oleh evaluator disebut "sangat bertele-tele." Claude Opus 5 mengeluarkan 140 juta pada rangkaian yang sama.
Jika dibagi, mekanismenya sederhana. Sonnet 5.5 menghasilkan sekitar tiga kali token keluaran Claude Opus 5 untuk pekerjaan yang identik, dengan 40% dari harga keluaran. Tiga kali 0,4 adalah 1,2 — penalti 20% sebelum efek cache, yang berada di sekitar hasil $7,60 versus $5,86. Harga per token tidak salah; hanya saja itu bukan angka yang menentukan faktur.
Ini tidak membuat model yang lebih baru jadi pembelian yang lebih buruk. Ini membuat keputusannya bergantung pada sesuatu yang dilewatkan oleh sebagian besar perbandingan: apakah beban kerja Anda memungkinkan Anda membatasi output. Pekerjaan peringkasan dengan instruksi panjang, pipeline ekstraksi terstruktur yang menghasilkan JSON, pengklasifikasi yang mengembalikan label — dalam semua itu, verbositas tidak pernah muncul, dan pemotongan tarif 60% adalah uang nyata. Agen terbuka yang diminta "memperbaiki repo" tanpa disiplin output memberi Sonnet 5.5 tali tiga kali lebih panjang.
Pengaturan upaya dan migrasi yang tidak dianggarkan siapa pun
Kedua model mengekspos kedalaman penalaran melalui parameter effort dengan beberapa tingkat, dan keduanya menyertakan nilai default alih-alih nilai tetap — tinggi di Claude Platform, sedang di dalam aplikasi Claude. Godaan saat melakukan migrasi adalah membiarkan pengaturan tersebut tetap seperti pada model lama dan menganggap pekerjaan selesai.
Itu adalah kesalahan karena alasan yang terukur. Catatan kaki Anthropic sendiri untuk Claude Sonnet 5.5 menyatakan bahwa konfigurasi Max effort mendapat skor lebih rendah daripada Xhigh pada FrontierCode, yang berarti effort bukanlah pengatur yang monoton dan pengaturan tertinggi bukanlah peningkatan gratis. Tetapkan effort dengan mengukur tugas Anda, bukan dengan memilih opsi termahal yang tersedia.
Ada juga perbedaan perilaku yang nyata di sisi Sonnet yang patut diketahui sebelum peluncuran. Anthropic menyatakan bahwa Claude Sonnet 5.5 adalah Sonnet pertama yang hadir dengan pengamanan siber dan fallback yang setara dengan model tingkat teratasnya, sehingga permintaan keamanan berisiko lebih tinggi secara terlihat beralih ke Sonnet yang lebih awal alih-alih dilayani oleh model yang Anda sebut. Jika beban kerja Anda berada di domain itu, log Anda akan menunjukkan model yang tidak Anda minta. Claude Opus 5 mendahului pengaturan tersebut di lini Sonnet, meskipun perutean kelas yang sama ada di seluruh produk Anthropic untuk pekerjaan biologi dan keamanan siber pada tier unggulan.
Di OrcaRouter kedua endpoint sudah live hari ini — anthropic/claude-opus-5 dan anthropic/claude-sonnet-5berada di katalog yang sama dengan semua yang lain, dihargai sesuai daftar harga penyedia dengan markup 0% — dan Claude Sonnet 5.5 akan dapat diakses dengan kredensial yang sama begitu dicantumkan. Sementara itu, kemampuan yang relevan adalah failover otomatis: jika satu tier Anthropic dibatasi lajunya atau mengembalikan error, permintaan dapat diarahkan ulang ke tier lainnya tanpa perubahan kode, yang merupakan lindung nilai termurah terhadap kemungkinan keliru soal perbandingan ini.
Keputusan itu, dinyatakan sebagai aturan.
Jika lingkup pekerjaan Anda terbatas — Anda mengendalikan bentuk keluaran, prompt-nya terstruktur, dan jumlah token per tugas dapat diprediksi — beralihlah ke Claude Sonnet 5.5 dan ambil penghematan 60%. Indeksnya setuju, daftar tarifnya setuju, dan tidak ada lagi argumen kemampuan di sisi lain.
Jika pekerjaan Anda bersifat terbuka dan agentik, jalankan eksperimennya sebelum Anda mempercayai salah satu daftar harga. Ukur token per tugas yang diselesaikan pada trafik Anda sendiri selama seminggu untuk setiap model; hasil pihak ketiga sebesar $7,60 versus $5,86 adalah peringatan khusus bahwa kartu tarif yang lebih murah dapat menghasilkan tagihan yang lebih besar. Claude Opus 5 tetap menjadi default yang lebih aman untuk pekerjaan otonom berhorizon panjang sampai Anda memiliki angka itu.
Putusan jujurnya: ini adalah generasi Sonnet pertama di mana alasan memilih model unggulan bertumpu pada bentuk tugas, bukan kemampuan mentah, dan siapa pun yang masih mengambil keputusan hanya berdasarkan nama model kini kehilangan 60% potensi atau membayar 30% lebih banyak per tugas yang diselesaikan, hanya bergantung pada ke arah mana mereka menebak.



Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
