Kartu judul untuk Claude Sonnet 5.5 berjudul 'harga sama, kerja lebih sedikit', dengan subjudul '$2 / $10 per juta token, tidak berubah dari Sonnet 5' dan tiga kartu statistik yang bertuliskan 56 (AA Intelligence Index), #3 / 216 (peringkat pada indeks tersebut) dan $7.60 (biaya per tugas pada upaya maksimal).
Guides & Insights

Claude Sonnet 5.5: Klaim Biaya 30%, dan Enam Perubahan yang Merusak Kode Sonnet 5

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Claude Sonnet 5.5 dirilis pada 28 September 2026 dengan tarif yang persis sama dengan Claude Sonnet 5 — $2 per juta token masukan, $10 per juta token keluaran, $0,20 per juta pembacaan cache — sementara pengumuman Anthro​pic mengawali dengan "berjalan 30%+ lebih cepat dan berbiaya hingga 30% lebih murah untuk sebagian besar pekerjaan." Kedua pernyataan itu benar, dan jarak di antara keduanya adalah inti ceritanya. Penghematan tidak ada di kartu tarif, karena kartu tarifnya tidak berubah. Penghematan itu berasal dari menjalankan model pada pengaturan upaya yang lebih rendah daripada yang dibutuhkan pendahulunya, yang berarti angka 30% adalah klaim tentang titik operasi yang harus Anda pilih, bukan harga yang Anda warisi. Pengukuran independen membuat percabangannya menjadi tajam: pada Artificial Analysis, Claude Sonnet 5.5 dengan upaya maksimum menghabiskan biaya $7,60 per tugas pada Intelligence Index dibandingkan $5,09 untuk Claude Sonnet 5 pada upaya maksimum — sekitar 49% lebih banyak, bukan 30% lebih sedikit. Itu bukan kontradiksi dari angka Anthro​pic. Itu adalah ujung lain dari kurva yang sama, dan di situlah sebagian besar migrasi akan mendarat secara default jika tidak ada yang menjalankan ulang penyapuan upaya mereka.

Dua klaim memakai satu nomor

Postingan Anthropic membuat klaim per tugas di tiga tempat dan masing-masing bergantung pada effort. Versi terkuat: pada Terminal-Bench 4.0, pada effort Medium — default di aplikasi Claude — Sonnet 5.5 "jauh melampaui skor terbaik Sonnet 5 dengan biaya per tugas kurang dari sepersepuluh." Pada AA-Briefcase v1.1, pada effort Medium, ia mengalahkan skor terbaik Sonnet 5 dengan biaya sekitar sepersembilan. Pada CursorBench 4.0, pada effort Low, ia melampaui skor terbaik Sonnet 5 dengan biaya kurang dari sepersepuluh.

Bacalah itu sebagai satu kesatuan dan mekanismenya jelas. Untuk Sonnet 5.5, batas bawah berada di atas batas atas Sonnet 5 pada beberapa evaluasi. Anda tidak mendapatkan 30% itu dengan membayar lebih sedikit per token; Anda mendapatkannya dengan tidak lagi memerlukan pengaturan yang mahal. Anthropic mengatakan hal yang sama dalam dokumentasi migrasi, satu halaman setelah bagian pemasaran: "Tingkat upaya dikalibrasi ulang. Sebuah tingkat upaya tidak menghasilkan jumlah pemikiran yang sama seperti pada Claude Sonnet 5. Jalankan ulang penyapuan upaya Anda alih-alih membawa pengaturan lama."

Kalimat itu adalah pernyataan yang paling penting secara operasional yang diterbitkan Anthropic minggu ini, dan justru itulah yang tidak masuk ke dalam sebagian besar liputan peluncuran.

Apa yang diterbitkan Anthropic — dilaporkan vendor, belum direproduksi

Semua yang ada di bagian ini adalah pengukuran Anthropic sendiri, dari pengumuman Sonnet 5.5 dan kartu sistem. Ini klaim vendor, bukan hasil independen, dan jejak catatan kaki sama pentingnya dengan angka-angka utamanya.

• Terminal-Bench 4.0 (pengodean agentik) — Sonnet 5.5 70,6% vs Sonnet 5 10,3%. Itu lonjakan tujuh kali lipat pada baris yang paling banyak dikutip, dan itulah angka yang paling sering dijadikan pembuka dalam pemberitaan.

• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1% pada Xhigh dan 46,2% pada Max; Sonnet 5 42,4%; Claude Opus 5.5 54,4%; GPT-6 Sol 49,3%. Perhatikan inversinya: Sonnet 5.5 mencetak skor lebih rendah pada Max daripada pada Xhigh.

• CursorBench 4.0 — 55,5% untuk Sonnet 5.5 vs 34,1% untuk Sonnet 5 dan 57,8% untuk Opus 5.5. CursorBench 4.0 tidak melaporkan GPT-6 Sol secara publik.

• GDPval v2.1 (pekerjaan pengetahuan) Sonnet 5.5 220, Sonnet 5 1449, Opus 5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 pada empat model yang sama.

• Ujian Terakhir Umat Manusia (dengan alat) — 64,5% / 54,9% / 67,7%.

• OSWorld 2.1 (penggunaan komputer, kredit parsial) — 80,1% / 57,0% / 81,8%.

• Chartography (pengenalan bagan visual, tanpa alat) — 61,6% / 15,6% / 64,4% / 53,6%.

Tiga catatan kaki sebaiknya ikut bersama baris-baris itu, bukan berada di bawahnya. Pertama, angka Opus 5.5 sebesar 66,4% pada Terminal-Bench 4.0 dilaporkan pada effort Xhigh, konfigurasi dengan skor tertinggi Opus 5.5. Kedua, inversi FrontierCode Max dijelaskan: pada Max, Sonnet 5.5 lebih sering menjalankan skill tinjauan kode Claude Code, yang memecah tinjauan ke banyak subagen, dan dalam dua kasus hal itu menghasilkan timeout atau suntingan di luar cakupan tugas — FrontierCode memberi penalti pada perubahan di luar cakupan bahkan ketika perubahan itu baik. Ketiga, dan paling tidak nyaman bagi vendor, Artificial Analysis menjalankan GDPval-AA dan AA-Briefcase pada deployment pra-rilis Sonnet 5.5 yang menurut Anthropic memiliki bug yang menurunkan kualitas respons terhadap permintaan output terstruktur. Anthropic memperkirakan efeknya kecil dan membuat Sonnet 5.5 tampak lebih rendah dari seharusnya, serta mengatakan bug itu sudah diperbaiki. Anthropic juga mencatat bahwa OpenAI baru-baru ini memperbaiki bug pemahaman gambar di GPT-6 Sol, jadi angka GPT-6 Sol di baris-baris itu mungkin belum mencerminkan model saat ini.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

Apa yang dikatakan oleh uji independen tentang model yang sama

Artificial Analysis telah mengukur Sonnet 5.5, dan halamannya menyebutkan konfigurasi persisnya: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". Pada revisi indeks yang sama, 216 model dalam kelas:

• Claude Sonnet 5.5 — Indeks Kecerdasan 56, peringkat #3 dari 216. Biaya $7.60 per tugas indeks. Model ini menghasilkan 410 juta token keluaran selama proses indeks, dibandingkan dengan median 88 juta.

• Claude Sonnet 5 — Indeks 38, berada di peringkat #58 dari 216, di halaman tersendiri yang berlabel "(Penalaran Adaptif, Upaya Maksimal)". Biaya $5,09 per tugas. 370 juta token keluaran.

• Claude Opus 5.5 — Indeks 58, peringkat #1 dari 216. $5,98 per tugas. 95,3 token keluaran per detik.

• GPT-6 Sol — Indeks 48, peringkat #20 dari 216, pada harga daftar $2/$10. $1,06 per tugas, 89,8 token output per detik.

Kesenjangan Intelligence Index — 56 berbanding 38, delapan belas poin — adalah konfirmasi independen terkuat dalam tulisan ini, dan itulah angka yang seharusnya benar-benar dibawa pulang oleh pembaca. Angka biaya adalah yang perlu diberi catatan, dan perlu dinyatakan secara tepat: kedua titik adalah konfigurasi upaya maksimal, dan upaya maksimal pada model yang bernalar lebih lama adalah posisi yang sengaja mahal. Sonnet 5.5 membakar 410M token pada proses indeks ketika Sonnet 5 membakar 370M, dan keduanya jauh di atas median 88M. Model yang berpikir lebih lama pada pengaturan tertinggi memakan biaya lebih besar pada pengaturan tertinggi. Yang dibantah oleh angka tersebut bukanlah "lebih murah per tugas", melainkan setiap pembacaan angka itu sebagai properti model alih-alih properti pengaturan.

Artificial Analysis belum menerbitkan angka kecepatan output untuk Sonnet 5.5 — halamannya menampilkan N/A untuk token output per detik, dibandingkan 78,7 untuk Sonnet 5 dan 95,3 untuk Opus 5.5. Jadi bagian "30%+ lebih cepat" dari klaim Anthropic hanya dilaporkan vendor untuk saat ini. Anggap saja sebagai indikatif sampai pihak ketiga mengukurnya.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

Dari mana penghematannya sebenarnya berasal, dan bagaimana cara mendapatkannya

Jika Anda menerima mekanismenya, instruksi migrasinya akan menulis dirinya sendiri, dan Anthropic telah menerbitkannya:

• Mulai dari high secara default, bukan dari apa pun yang dikatakan konfigurasi Sonnet 5 Anda. Panduan Anthropic adalah high kecuali beban kerja Anda bersifat agentic atau sensitif terhadap latensi.

• Pengodean agentik dan penggunaan alat multi-langkah — mulai dari sedang untuk tugas yang terdefinisi dengan baik, lalu naikkan ke tinggi untuk tugas yang lebih sulit atau lebih panjang.

• Chat dan pekerjaan lain yang sensitif terhadap latensi — mulailah dari sedang atau rendah. Inilah rentang tempat klaim "sepersepuluh dari biaya" berada.

Ada penjelasan yang koheren mengapa pengaturan yang lebih rendah berhasil, dan itu bukan pemasaran. Penguji awal Anthropic melaporkan bahwa Sonnet 5.5 mengelompokkan panggilan alat lebih banyak daripada Sonnet 5, sehingga menghasilkan lebih sedikit langkah per tugas. Catatan CodeRabbit dalam pengumuman itu luar biasa spesifik untuk kutipan peluncuran: "kecenderungan Sonnet 5 untuk terlalu sering menggunakan penelusuran web dan penggunaan tokennya yang tinggi sama-sama hilang pada model baru ini." Sonnet 5.5 juga mempertahankan tokenizer yang sama dengan Sonnet 5, jadi teks yang identik memakan token yang identik — pengurangannya adalah lebih sedikit giliran dan lebih sedikit panggilan berulang, bukan kosakata yang lebih murah. Itu juga berarti jumlah token di log Anda tetap sebanding selama peningkatan, yang membuat pengukuran sebelum dan sesudah menjadi mudah.

Enam perubahan yang merusak atau mengubah kode Sonnet 5

Inilah bagian dari rilis yang memakan waktu engineering, dan di sinilah panduan migrasi lebih berharga daripada grafik benchmark. Lima dari enam mengembalikan hard error; yang keenam gagal secara senyap.

• thinking: {"type": "disabled"} kini mengembalikan 400. Penggantinya adalah thinking: {"type": "between_tools"}, yang menonaktifkan thinking di awal dan merupakan pengaturan thinking terendah pada model ini. Ini berfungsi pada effort low, medium, dan high, tidak memerlukan header beta, dan tersedia di setiap platform yang menyediakan Sonnet 5.5. Pada effort xhigh atau max, between_tools sendiri mengembalikan 400 — gunakan adaptive thinking (hilangkan field-nya, atau kirim {"type": "adaptive"}) jika Anda memerlukan tingkat tersebut. Dengan between_tools, Anda juga tidak dapat mengubah effort di tengah percakapan.

• Penggunaan tool secara paksa tidak didukung. tool_choice yang diatur ke {"type": "any"} atau {"type": "tool", "name": "..."} akan mengembalikan 400 dengan pesan "tool_choice: type 'tool' dan 'any' are not supported for this model." Pemeriksaan yang sama juga berlaku untuk endpoint penghitungan token. Pengganti untuk input yang valid secara skema adalah tool_choice: {"type": "auto"} ditambah strict: true, atau memindahkan skema ke structured outputs.

• Blok thinking terikat pada model dan percakapan. Sonnet 5.5 membaca blok thinking dari Sonnet 5, Opus 4.8, Haiku 4.5, dan versi sebelumnya — bukan dari Opus 5, Opus 5.5, atau model Fable atau Mythos mana pun. Tidak ada model lain yang membaca blok Sonnet 5.5. Pindahkan percakapan dari Sonnet 5 ke 5.5 dan penalarannya tetap ada; pindahkan dari Sonnet 5.5 ke apa pun yang lain dan giliran berikutnya berjalan tanpa blok itu. Secara terpisah, API kini memeriksa apakah system prompt, daftar tool, atau pesan sebelumnya berubah sejak blok thinking dihasilkan, dan pada akun yang dibuat pada atau setelah 31 Agustus 2026 API mengembalikan 400 jika memang berubah. Pertahankan percakapan tetap append-only, atau kirim header beta thinking-binding-controls-2026-08-01 dengan prefix_mismatch_behavior: "drop_block".

• computer_20251124 ditolak pada Claude API dan Google Cloud. Penggunaan komputer di sana memerlukan toolset computer_toolset_20260801. Amazon Bedrock masih menerima tool versi lama — sebuah perbedaan platform yang layak diperhatikan jika Anda menjalankan agen yang sama di keduanya.

• Beberapa pasangan penasihat sudah tidak ada. Eksekutor Sonnet 5.5 menerima Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5, atau Sonnet 5.5 sendiri sebagai penasihat. Penasihat Opus 4.8, Opus 4.7, dan Sonnet 5, yang berfungsi dengan eksekutor Sonnet 5, mengembalikan 400 dengan eksekutor Sonnet 5.5. Setiap penasihat yang diterima Sonnet 5.5 mengembalikan nasihat yang terenkripsi, sehingga klien Anda tidak dapat membaca teks nasihat tersebut.

• Teks di antara pemanggilan alat sekarang tiba di dalam blok pemikiran — dan pada tampilan default: "omitted", teks tersebut kosong. Ini yang senyap. Catatan yang lebih panjang dari satu atau dua kalimat di antara pemanggilan alat kembali sebagai blok pemikiran pembaruan progres alih-alih sebagai teks. Aplikasi yang mengalirkan narasi itu kepada penggunanya menjadi senyap di antara pemanggilan alat, tanpa error dan tanpa apa pun di log. Perbaikannya adalah dengan menyetel thinking.display agar teks dikembalikan, atau beralih ke between_tools, yang dalam hal itu teks kembali sebagai teks biasa.

Dua hal lagi yang disentuh oleh migrasi, keduanya bukan error. Pemantauan terhadap penolakan: Sonnet 5.5 mengembalikan stop_reason: "refusal" dengan objek stop_details yang menyebutkan salah satu dari lima area kebijakan — cyber, bio, frontier_llm, reasoning_extraction, general_harms — dan fallback sisi server Anthropic akan mencoba ulang penolakan cyber dan frontier_llm pada Sonnet 5 tetapi tidak ketiga area lainnya. Dan postur keamanan benar-benar berubah: Sonnet 5.5 adalah model Sonnet pertama yang dirilis dengan pengamanan siber dan fallback seperti kelas Opus, yang berarti permintaan keamanan siber berisiko lebih tinggi secara terlihat beralih ke Sonnet 5, dan Sonnet pertama dengan pengklasifikasi terhadap reasoning extraction. Jika proposisi nilai produk Anda adalah alat keamanan, uji batas tersebut sebelum Anda merilis penggantian model.

Harga, dan apa yang benar-benar ada di rute kami hari ini

Kartu tarif tidak berubah dari Sonnet 5 dan bentuk lengkapnya yang dipublikasikan cukup singkat untuk dinyatakan secara gamblang:

• Masukan — $2,00 per juta token. Keluaran — $10,00 per juta token. Keduanya identik dengan Sonnet 5, dikonfirmasi di halaman model Anthropic untuk Sonnet 5.5.

• Pembacaan cache — $0,20 per juta, diskon 90% untuk input; penulisan cache 5 menit $2,50 per juta; penulisan cache 1 jam $4,00 per juta. Prompt minimum yang dapat di-cache adalah 512 token pada Sonnet 5.5, turun dari 1.024 pada Sonnet 5.

• Batch — diskon 50% untuk kedua arah, jadi $1,00 / $5,00 per juta. Pada API Message Batches, output dapat mencapai 300K token dengan header beta output-300k-2026-03-24.

• Dibandingkan dengan Opus 5.5 — Sonnet 5.5 tepat setengahnya: $2/$10 versus $4/$20, dengan penulisan cache separuh dan pembacaan cache identik di $0,20. Itulah migrasi yang menguntungkan, dan Anthropic mengatakannya secara terang-terangan: kedua model paling baik saling melengkapi ketika Sonnet berjalan pada upaya yang lebih rendah, dan Opus "tetap jelas lebih kuat dalam pekerjaan rumit dan terbuka yang membutuhkan pertimbangan berkelanjutan."

• Konteks dan keluaran — konteks 1 juta token, keluaran maksimum 128K, penalaran adaptif aktif secara default, tingkat upaya default tinggi, batas pengetahuan andal Juni 2026, retensi data nol tersedia, penghentian tidak lebih awal dari 28 September 2027.

Satu catatan ketersediaan yang lebih baik kami nyatakan secara eksplisit daripada hanya kami isyaratkan: Claude Sonnet 5.5 tidak ada dalam katalog model kami per 29 September 2026. Pendahulunya, anthropic/claude-sonnet-5, dan saudara kandungnya yang lebih besar, anthropic/claude-opus-5.5, keduanya ada, dan tarifnya di sisi kami adalah tarif milik penyedia sendiri — $2.00 masuk, $10.00 keluar, $0.20 cache read, $2.50 cache write untuk Sonnet 5, tanpa tambahan markup, sehingga perubahan harga vendor langsung berlaku di sini pada hari yang sama saat diberlakukan, bukan pada siklus penagihan berikutnya. Properti terakhir itulah yang membuat pembacaan kartu tarif berguna, bukan sekadar hiasan.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

Apa yang dapat Anda lakukan dengan ini hari ini

Urutan yang jujur bagi tim yang sudah menjalankan Claude Sonnet 5 di produksi terdiri dari tiga langkah, dan tidak satu pun di antaranya adalah "ganti string model lalu lihat grafiknya."

Pertama, jalankan ulang penyisiran upaya. Jika Anda membawa pengaturan tinggi atau maksimum dari Sonnet 5 karena itulah yang dibutuhkan standar kualitas Anda, kini Anda membayar untuk penalaran yang tidak perlu lagi Anda beli. Angka biaya per tugas independen mengatakan bagian teratas tangga menjadi lebih mahal, bukan lebih murah, dan klaim biaya vendor sendiri semuanya menggambarkan bagian tengahnya. Kedua, perbaiki dua jalur kesalahan sebelum deploy — thinking yang dinonaktifkan dan penggunaan alat yang dipaksakan — karena keduanya gagal secara mencolok dan segera, itu kabar baiknya. Ketiga, awasi jalur narasi, karena gagal secara diam-diam.

Jika model tersebut belum ada di rute yang Anda gunakan, cara berisiko rendah untuk mengevaluasinya adalah menjalankannya berdampingan, bukan sebagai pengganti: pertahankan Sonnet 5 tersemat sebagai fallback pada kunci yang sama sehingga penolakan, timeout, atau evaluasi yang buruk mengirimkan permintaan ke model yang sudah Anda percayai, dan failover otomatis menutup loop tanpa integrasi kedua. Itulah keseluruhan argumen untuk mengevaluasi model yang belum terbukti di belakang satu endpoint, bukan di depan pengguna Anda — dan itu berlaku dua kali lipat di sini, karena kategori penolakan Sonnet 5.5 baru dan kalibrasi effort-nya secara eksplisit tidak sama dengan pendahulunya. Saat Anda siap memindahkan default, daftar di satu kunci mencapai lebih dari 200 model, yang menjadikan perbandingannya sebagai perubahan konfigurasi, bukan kontrak kedua.

Apa yang harus ditonton

Tiga hal akan menjawab pertanyaan-pertanyaan terbuka dalam tulisan ini, dan belum satu pun dari ketiganya terjadi.

Pengukuran kecepatan keluaran yang independen adalah yang pertama. Anthropic mengklaim 30%+ lebih cepat daripada Sonnet 5; Artificial Analysis belum menerbitkan angka untuk Sonnet 5.5, dan klaim itu sangat berperan dalam argumen biaya, karena model yang lebih cepat menyelesaikan tugas yang sama dalam waktu aktual yang lebih singkat dan sering kali dengan token yang lebih sedikit. Claude Haiku 5.5 adalah yang kedua — Anthropic mengatakan model ini hadir "dalam beberapa minggu mendatang" dan akan berada di bawah Sonnet 5.5, yang mengubah perhitungan untuk segmen chat bervolume tinggi, di mana tingkat effort sedang dan rendah sudah membuat Sonnet 5.5 kompetitif. Yang ketiga adalah tahap koreksi: Artificial Analysis menjalankan GDPval-AA dan AA-Briefcase pada build pra-rilis dengan bug output terstruktur, Anthropic memperkirakan skor tersebut meremehkan kemampuan model, dan kedua angka itu belum dijalankan ulang. Jika angka-angka itu naik, kesenjangan pekerjaan berbasis pengetahuan dengan Opus 5.5 semakin menyempit dan argumen "setengah harga" makin kuat.

Hingga saat itu, ringkasan yang dapat dipertahankan lebih sempit daripada pengumuman dan lebih berguna daripada bagan tolok ukur. Claude Sonnet 5.5 adalah peningkatan kecerdasan sebesar delapan belas poin dibandingkan Sonnet 5 pada indeks independen, dengan tarif yang dipublikasikan sama, dengan penghematan nyata dan terukur yang tersedia bagi siapa pun yang menuruni tangga upaya — dan penalti nyata dan terukur bagi siapa pun yang tidak melakukannya.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari