
Claude Sonnet 5.5 vs Claude Opus 5.5: Tolok Ukurnya Makin Mirip, Tagihannya Tidak
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 984 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Claude Sonnet 5.5 mencapai ketersediaan umum pada 28 September 2026 dengan harga $2,00 per juta token input dan $10,00 per juta token output. Claude Opus 5.5, unggulan Anthropic, dirilis enam hari lebih awal pada 22 September dengan harga $4,00 dan $20,00 — tepat dua kali lipat pada kedua lini. Pembacaan yang jelas adalah bahwa Opus 5.5 adalah batas atas dan Sonnet 5.5 adalah kompromi yang Anda ambil ketika anggaran benar-benar nyata. Tabel peluncuran Anthropic sendiri tidak mendukung pembacaan itu. Berdasarkan angka yang diterbitkan perusahaan, Claude Sonnet 5.5 mencatat 1844 melawan 1846 milik Opus 5.5 pada GDPval-AA v2.1, 1811 melawan 1822 pada AA-Briefcase v1.1, dan 70,6% melawan 66,4% pada Terminal-Bench 4.0 — ia memenangkan satu tolok ukur yang mengukur pekerjaan yang benar-benar dilakukan di dalam terminal. Dua baris di bawah angka-angka itu, keterangan Anthropic sendiri menyatakan bahwa Opus 5.5 "tetap jelas lebih kuat pada pekerjaan yang kompleks dan terbuka." Kedua pernyataan itu benar, dan mencari cara untuk memegang keduanya sekaligus adalah sebagian besar tujuan perbandingan ini.
Apa yang dikatakan tabel peluncuran, dan apa yang enggan dikatakannya
Pola dalam blok benchmark Anthropic adalah model yang telah menutup sebagian besar kesenjangan, bukan model yang telah mengambil posisi terdepan. GDPval-AA v2.1, kumpulan tugas berbobot ekonomis, adalah hasil imbang dengan selisih dua poin. AA-Briefcase v1.1, evaluasi dokumen dan hasil kerja, adalah hasil imbang dengan selisih sebelas poin. CursorBench 4.0 justru sebaliknya: 55,5% untuk Sonnet 5.5 berbanding 57,8% untuk Opus 5.5. OSWorld 2.1 berada pada 80,1% berbanding 81,8%, dan Humanity's Last Exam pada 64,5% dengan alat berbanding 67,7%. Hanya Terminal-Bench 4.0 yang mematahkan pola, dan mematahkannya dengan telak — 70,6% berbanding 66,4%, keunggulan empat poin bagi Sonnet pada pekerjaan baris perintah agentik.
Bacalah label baris alih-alih angka dan hal lain akan muncul. Beberapa entri Opus 5.5 tersebut membawa anotasi upaya — 66,4% pada Xhigh — dan catatan kaki menyatakan bahwa konfigurasi Max mendapat skor lebih rendah daripada Xhigh pada FrontierCode, bukan lebih tinggi. Upaya yang lebih tinggi tidak monoton. Tim yang sadar anggaran yang mengasumsikan "upaya maksimal" adalah peningkatan gratis sedang membeli token untuk jawaban yang lebih buruk pada setidaknya salah satu pengujian Anthropic sendiri. Dan pada FrontierCode 1.1 catatan kaki yang sama menempatkan Sonnet 5.5 pada 46,2% dalam konfigurasi Max dibandingkan Opus 5.5 54,4%, yang merupakan angka tunggal paling jelas untuk di mana sang unggulan masih menjauh: pekerjaan kode berhorizon panjang di bawah definisi tugas yang memberi imbalan pada ketekunan.
Ada satu peringatan lagi yang perlu disampaikan secara terang-terangan, bukan dipendam. Anthropic mencatat bahwa uji GDPval-AA dan AA-Briefcase yang dipublikasikannya dijalankan pada deployment pra-rilis yang mengandung bug structured-outputs. Hal itu memengaruhi kedua model dalam tabel yang sama, jadi perbandingannya tidak menjadi tidak valid, tetapi ini berarti angka absolutnya harus diperlakukan sebagai snapshot, bukan hasil yang sudah final. Tabel benchmark vendor adalah artefak pemasaran dengan lampiran metodologi, dan yang ini disertai lampirannya.
Di mana pengukuran independen mendarat
Artificial Analysis memberi skor pada kedua model dalam satu harness, dengan konfigurasi yang sama yang diberinya label "Adaptive Reasoning, Max Effort, Default Fallback," pada Intelligence Index v4.3. Claude Opus 5.5 berada di angka 58. Claude Sonnet 5.5 berada di angka 56. Itu adalah selisih dua poin pada skala di mana evaluator yang sama menempatkan Opus 5 di 51, Sonnet 5 di 38, DeepSeek V4 Pro di 36, dan Gemini 3.1 Pro Preview di 30. Sonnet baru yang hadir dua poin di bawah produk unggulan dan lima poin di atas generasi Opus sebelumnya adalah klaim substantif dari rilis ini, dan ini merupakan klaim pihak ketiga, bukan klaim vendor.
Lalu halaman yang sama membalik perhitungan ekonominya. Artificial Analysis melaporkan bahwa satu kali proses evaluasi Sonnet 5.5 menghabiskan $7,60 per tugas, dibandingkan $5,98 untuk Opus 5.5, meskipun Sonnet 5.5 setengah harga per token. Penyebabnya ada tepat di halaman itu: Sonnet 5.5 menghasilkan 410 juta token di seluruh suite indeks, dibandingkan median 88 juta untuk model-model yang dilacaknya — "sangat bertele-tele," dalam kata-kata evaluator. Opus 5.5 menghasilkan 260 juta token pada suite yang sama. Dengan $10 per juta token keluaran dibandingkan $20, faktor kebertele-telean sekitar 1,6 tetap membuat Sonnet 5.5 membayar sekitar 27% lebih banyak per tugas yang diselesaikan.
Inilah bagian dari perbandingan yang tidak dapat ditunjukkan oleh daftar harga per token kepada Anda, dan inilah alasan kedua angka itu bisa berdampingan tanpa kontradiksi. Per token, Sonnet 5.5 lebih murah separuhnya. Per tugas yang diselesaikan, pada rangkaian evaluasi dengan prompt terbuka dan tanpa disiplin panjang keluaran, model ini bisa jadi lebih mahal. Yang mana di antara keduanya yang menggambarkan beban kerja Anda, itulah keputusan sebenarnya.
Tingkat upaya, batas keluaran, dan bentuk integrasi
Bagi seorang pembeli, sifat-sifat yang penting secara mekanis hampir identik antara kedua model ini.
• Konteks — 1.000.000 token pada keduanya, dari penyedia yang sama, sehingga asumsi rekayasa prompt tetap berlaku tanpa perubahan
• Output maksimum {{1}}token{{/1}} pada keduanya{{2}}{{/2}} bukanlah pembeda.
• Modalitas — input teks, gambar, dan file pada keduanya; keduanya tidak menerima audio atau video
• Kontrol penalaran — pemikiran adaptif pada keduanya, dengan kedalaman yang diatur oleh parameter effort, bukan anggaran token pemikiran. Di Claude Platform, nilai default-nya tinggi; di dalam aplikasi Claude, nilainya sedang.
• Penulisan cache — $5,00 per juta untuk Claude Opus 5.5 versus $2,50 untuk Claude Sonnet 5.5, satu-satunya baris di mana model yang lebih murah juga merupakan model yang lebih murah untuk diberi prefiks yang dibangun ulang
• Pembacaan cache — $0.20 per juta untuk keduanya, seri persis pada baris yang mendominasi eksekusi agen yang panjang
Karena permukaannya cocok, migrasi di antara keduanya hanyalah perubahan string model dan pengukuran ulang upaya, bukan proyek integrasi. Hal itu tidak lazim lintas vendor, dan itulah sebabnya pasangan khusus ini sama sekali layak diperbandingkan: kedua kandidat berbeda dalam harga dan kedalaman, bukan dalam API yang harus Anda tulis.
Satu perbedaan operasional layak mendapat penjelasannya sendiri. Anthropic menyatakan bahwa Claude Sonnet 5.5 adalah Sonnet pertama yang diluncurkan dengan pengamanan siber dan fallback yang setara dengan model tingkat teratasnya, yang berarti permintaan keamanan siber berisiko lebih tinggi secara terlihat dialihkan ke Sonnet sebelumnya alih-alih dijawab oleh model yang Anda sebutkan. Jika beban kerja Anda menyentuh domain tersebut, string model bukan jaminan model mana yang merespons — di kedua tier. Anthropic juga mencatat bahwa jika Anda menjalankan Sonnet dengan thinking dinonaktifkan, Anda harus beralih ke perilaku between-tools, yang merupakan perubahan kode, bukan flag konfigurasi. Tidak satu pun dari itu alasan untuk menghindari model ini; keduanya adalah alasan untuk mengetahui sebelum Anda merilis.
Di OrcaRouter, Claude Opus 5.5 dapat dirutekan hari ini dengan kredensial yang sama seperti setiap model lain di katalog, pada harga daftar penyedia dengan markup 0%, dengan failover otomatis yang tersedia di bawahnya. Claude Sonnet 5.5 belum menjadi rute di platform kami — model ini baru berusia satu hari, dan sampai ia terdaftar, pernyataan yang jujur adalah bahwa Anda akan mengaksesnya melalui API Anthropic sendiri. Siapa pun yang saat ini menjalankan Opus 5.5 melalui kami dapat memperkirakan biaya peralihan pada hari ia tersedia tanpa mengubah hal lain apa pun dalam integrasi mereka.
Yang mana ditaruh di mana
Pembagian yang mengikuti angka-angka itu: Claude Sonnet 5.5 untuk pekerjaan agen yang terikat terminal, di mana ia adalah yang lebih kuat di antara keduanya pada angka Terminal-Bench 4.0 milik Anthropic sendiri dan setengah harganya; Claude Sonnet 5.5 untuk apa pun yang berorientasi throughput, karena perbedaan biaya hanya menyempit ketika tugas memaksa keluaran panjang; Claude Opus 5.5 untuk pekerjaan kelas FrontierCode, refaktor jangka panjang di seluruh basis kode besar, dan beban kerja apa pun yang margin 54,4% hingga 46,2%-nya mencerminkan bentuk masalah aktual Anda alih-alih baris papan peringkat.
Jika tugas Anda bersifat terbuka dan Anda tidak dapat memprediksi panjang keluaran, anggap harga per token sebagai angka yang sepenuhnya salah. Ukur token per tugas yang diselesaikan pada trafik Anda sendiri selama satu minggu sebelum Anda memutuskan salah satu opsi; angka artificial-analysis sebesar $7,60 versus $5,98 adalah peringatan bahwa model murah bisa kalah pada metrik yang sebenarnya Anda bayarkan.
Putusan jujur: ini bukan lagi soal pertukaran antara kemampuan dan biaya. Ini pertanyaan apakah pekerjaan Anda terbatas. Untuk tugas yang terbatas, bervolume tinggi, dan digerakkan oleh alat, model yang lebih murah juga yang lebih baik berdasarkan bukti yang tersedia, dan model unggulan tidak bernilai dua kali lipat. Untuk pekerjaan yang terbuka dan berhorizon panjang, kalimat Anthropic sendiri — bahwa Opus 5.5 tetap jelas lebih kuat — adalah yang patut dipercaya, dan belum ada tingkat konvergensi benchmark berapa pun yang mengubahnya.



