Menghasilkan kartu judul hero untuk Claude Sonnet 5.5 vs Claude Sonnet 5, dengan subjudul 'Harga identik, tagihan berbeda', menampilkan $2,00 dan $10,00 per juta token di kedua sisi dengan angka biaya per tugas yang berbeda di bawahnya, serta logo OrcaRouter yang dikompositkan di sudut kanan bawah.
Guides & Insights

Claude Sonnet 5.5 vs Claude Sonnet 5: Harga Identik, Tagihan Berbeda

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua model dari vendor yang sama, tier yang sama, nama yang sama, dan — pada setiap baris kartu tarif yang diterbitkan — harga yang sama. Claude Sonnet 5 diluncurkan pada 30 Juni 2026 dengan harga $2,00 per juta token input dan $10,00 per juta token output. Claude Sonnet 5.5 mencapai ketersediaan umum pada 28 September 2026 dengan harga $2,00 dan $10,00, dengan pembacaan cache sebesar $0,20 dan penulisan cache lima menit sebesar $2,50 pada keduanya. Tidak ada yang berubah dari harganya. Yang berubah adalah segala hal yang tidak diukur oleh daftar harga, dan hasilnya adalah salah satu dari dua model ini jauh lebih murah untuk dioperasikan daripada yang lain meskipun biaya per tokennya persis sama. Tajuk utama Anthropic sendiri untuk rilis tersebut menyiratkan hal itu tanpa benar-benar mengatakannya: biaya hingga 30% lebih rendah untuk sebagian besar pekerjaan, pada kartu tarif yang tidak berubah. Satu-satunya cara agar kedua kalimat itu benar adalah jika model yang lebih baru menyelesaikan pekerjaan yang sama dengan lebih sedikit token, seperti yang ditunjukkan benchmark dan yang dikonfirmasi oleh angka per tugas yang independen.

Apakah Claude Sonnet 5.5 lebih mahal daripada Claude Sonnet 5?

Tidak — dan pertanyaan itu tetap layak ditanggapi dengan serius, karena sangat banyak migrasi yang berjalan salah karena menganggap kartu tarif tetap sebagai tagihan tetap.

Per token, kedua model identik: $2,00 masuk, $10,00 keluar, $0,20 untuk membaca token yang di-cache, $2,50 untuk menulisnya. Tidak ada lapisan tarif berjenjang dan tidak ada biaya tambahan untuk konteks panjang. Apa pun model yang lebih baru itu, ini bukan kenaikan harga yang dibungkus sebagai generasi baru.

Untuk setiap tugas yang diselesaikan, gambarannya berbalik bergantung pada beban kerja siapa yang Anda gambarkan. Artificial Analysis melaporkan biaya $5,09 per tugas untuk Claude Sonnet 5 dan $7,60 per tugas untuk Claude Sonnet 5.5 pada suite Intelligence Index v4.3 yang sama — model yang lebih baru 49% lebih mahal untuk menyelesaikan satu tugas, pada tarif yang identik. Laporan yang sama mencatat Sonnet 5.5 mengeluarkan 410 juta token di seluruh suite, sedangkan Sonnet 5 mengeluarkan 370 juta, keduanya dibandingkan dengan median 88 juta untuk bidang yang dipantau. Pada prompt terbuka milik evaluator, model yang lebih baru hanya menulis lebih banyak, dan pada harga yang sama, lebih banyak token berarti tagihan yang lebih besar.

Klaim Anthropic yang 30% lebih murah adalah klaim vendor tentang beban kerja yang dipilihnya sendiri. Angka pihak ketiga $7,60 versus $5,09 adalah pengukuran pada kumpulan yang berbeda. Keduanya tidak salah; ketidaksepakatan itulah inti ceritanya, dan faktor penentunya adalah apakah tugas-tugas Anda membatasi outputnya sendiri.

Apa yang sebenarnya berpindah di antara kedua generasi tersebut

Kartu tarif bersifat statis; modelnya tidak. Jika disusun sebagai satu daftar, selisihnya besar dan sebagian besar searah.

• Terminal-Bench 4.0 — 70,6% untuk Claude Sonnet 5.5 versus 10,3% untuk Claude Sonnet 5, lompatan satu generasi terbesar yang pernah diterbitkan Anthropic pada tes ini

• CursorBench 4.0 — 55,5% dibanding 34,1%

• Chartography, tanpa alat — 61,6% dibandingkan 15,6%

• GDPval-AA v2.1 — 1844 melawan 1449

• AA-Briefcase v1.1 — 1811 melawan 1359

• Humanity's Last Exam, dengan alat — 64,5% dibandingkan 54,9%

• OSWorld 2.1, penyelesaian sebagian — 80,1% dibandingkan 57,0%

• Artificial Analysis Intelligence Index v4.3 — 56 berbanding 38, selisih delapan belas poin pada skala pihak ketiga yang diukur dalam konfigurasi "Adaptive Reasoning, Max Effort" yang sama

Bentuk daftar itu bukanlah kemajuan yang seragam. Chartography yang bergerak dari 15,6% ke 61,6% dan Terminal-Bench dari 10,3% ke 70,6% tampak seperti kemampuan yang sebelumnya tidak ada dan kini ada, bukan kemampuan yang meningkat. Humanity's Last Exam yang naik sepuluh poin dan OSWorld dua puluh tiga poin pada harga yang tidak berubah adalah pola generasi yang menutup celah spesifik, bukan generasi yang menjadi lebih pintar secara umum. Celah indeks delapan belas poin adalah rata-rata aritmetika dari itu: nyata, besar, dan terkonsentrasi pada penggunaan alat, eksekusi kode, dan pekerjaan visual.

Satu catatan kaki penting bagi siapa pun yang membaca tabel vendor dengan cermat. Anthropic menyatakan bahwa pada FrontierCode, konfigurasi upaya Max mendapat skor lebih rendah daripada Xhigh, dan menandai bahwa pengujian GDPval-AA dan AA-Briefcase dijalankan pada deployment pra-rilis yang membawa bug structured-outputs. Angka-angka di atas masih yang terbaik yang tersedia, tetapi anggap saja sebagai snapshot dari satu deployment, bukan properti permanen dari model tersebut.

Mengapa harganya sama dan tagihannya tidak

Tiga mekanisme, dalam urutan menurun berdasarkan seberapa besar dampaknya terhadap invoice nyata.

Pertama adalah disiplin panjang keluaran. Sonnet 5.5 adalah agen yang lebih cakap, yang berarti ia melakukan lebih banyak sebelum menjawab, dan pada rangkaian uji tanpa batasan panjang, ia menulis sekitar 11% lebih banyak daripada Sonnet 5 dengan biaya per token yang sama. Pada beban kerja yang membatasi keluaran — ekstraksi ke dalam skema tetap, klasifikasi, ringkasan yang dibatasi — 11% itu tidak pernah terwujud dan klaim 30% menjadi kredibel, karena keunggulannya adalah mencapai jawaban dalam lebih sedikit giliran, bukan dalam lebih sedikit token per giliran.

Yang kedua adalah perilaku cache, dan itulah alasannya harga pembacaan cache yang tidak berubah tidak berarti biaya cache yang tidak berubah. Pembacaan dan penulisan cache diberi harga yang identik pada kedua model, sehingga setiap perubahan volume token yang di-cache langsung terbawa ke tagihan. Model yang memerlukan lebih sedikit giliran untuk menyelesaikan tugas agentik membaca prefiksnya lebih sedikit kali. Itu adalah penghematan tanpa pergerakan harga sama sekali di baliknya, dan tidak terlihat dalam setiap tabel perbandingan yang hanya mencantumkan baris kartu tarif.

Yang ketiga adalah hal yang paling sering salah ditangani banyak tim pada hari migrasi: default effort. Claude Sonnet 5.5 mengonfigurasi penalaran melalui parameter effort dengan pengaturan low, medium, high, xhigh, dan max, yang secara default bernilai high di Claude Platform dan medium di dalam aplikasi Claude. Jika Anda bermigrasi dari deployment Sonnet 5 yang sebelumnya menetapkan anggaran penalaran, default baru ini mungkin memiliki kedalaman yang berbeda dari yang Anda bayar. Ukur terlebih dahulu sebelum mengasumsikan adanya penghematan atau peningkatan.

Ada juga konsekuensi perilaku yang perlu ditandai sebelum peluncuran, bukan sesudahnya. Anthropic menyatakan bahwa Claude Sonnet 5.5 adalah Sonnet pertama yang diluncurkan dengan pengamanan siber dan fallback yang setara dengan model-model kelas atasnya, sehingga permintaan keamanan siber berisiko lebih tinggi secara terlihat akan beralih ke Sonnet sebelumnya. Log Anda akan menunjukkan model yang tidak Anda minta. Terkait hal itu, jika Anda menjalankan Sonnet dengan thinking dinonaktifkan, Anda harus beralih ke perilaku between-tools — perubahan kode, bukan flag.

Di OrcaRouter, anthropic/claude-sonnet-5 dapat dirutekan hari ini dengan satu kredensial pada harga daftar penyedia dengan markup 0%, bersama Claude Opus 5.5, Claude Opus 5, DeepSeek V4 Pro, dan Gemini 3.1 Pro Preview. Claude Sonnet 5.5 sendiri belum menjadi rute di platform kami, jadi bentuk praktis dari perbandingan ini saat ini adalah bahwa tim yang sudah menjalankan Sonnet 5 dapat mengukur selisihnya pada hari ia terdaftar tanpa menyentuh kunci API, dan dapat melakukan failover antar tingkat sementara itu dengan mengubah satu string.

Pertanyaan yang orang ajukan sebelum beralih

Bisakah saya menjalankan keduanya sekaligus dan membandingkannya pada trafik saya sendiri? Belum bisa melalui satu kredensial OrcaRouter, karena Claude Sonnet 5.5 bukan rute yang terdaftar. Solusinya adalah menjalankan model yang lebih baru di API milik Anthropic sendiri dan model yang lebih lama melalui kami, lalu membandingkan token per tugas yang diselesaikan alih-alih biaya per token, karena itulah angka yang sebenarnya membedakan kedua model tersebut.

Apakah harga yang tidak berubah berarti Anthropic tidak mengenakan biaya untuk kemampuan baru itu? Ini berarti harga daftar dipertahankan sementara modelnya membaik, yang merupakan pola yang sama dengan dua generasi Sonnet sebelumnya. Apakah hal itu akan berlanjut adalah pertanyaan komersial, bukan pertanyaan teknis, dan jendela penghentian yang dipublikasikan — tidak lebih awal dari September 2027 — adalah satu-satunya komitmen yang melekat.

Angka mana yang harus saya percaya, 30% dari Anthropic atau 49% dari pihak ketiga?Tidak ada, sebagai klaim umum. Angka Anthropic menggambarkan beban kerja ketika model mencapai jawaban dalam lebih sedikit giliran; angka Artificial Analysis menggambarkan rangkaian indeks tanpa batasan yang verbositasnya bebas bertambah. Pilih angka yang menyerupai kumpulan prompt Anda, dan jika Anda tidak dapat menentukan yang mana, ambiguitas itu sendiri adalah jawabannya — ukurlah.

Intinya

Claude Sonnet 5.5 bukanlah kenaikan harga, tetapi juga tidak otomatis merupakan penghematan. Anthropic mempertahankan setiap baris pada daftar tarif tetap dan memindahkan model di bawahnya, yang berarti seluruh dasar ekonominya bergantung pada token per tugas yang diselesaikan — angka yang 30% lebih baik pada beban kerja yang dipilih vendor dan 49% lebih buruk pada rangkaian yang dipilih evaluator independen. Jika tugas Anda membatasi outputnya sendiri, beralihlah dan ambil keuntungannya. Jika tidak, harga tetap bukan alasan untuk melewatkan pengukuran, karena Anda bisa membayar 50% lebih banyak per tugas untuk model yang secara jelas lebih baik dalam pekerjaan itu.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Sonnet 5 across eight rows. Both columns carry the identical rate card: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output. The rows that differ are AA Intelligence Index v4.3 score 56 for Claude Sonnet 5.5 against 38 for Claude Sonnet 5, $7.60 per task on the index run against $5.09, and Terminal-Bench 4.0 (vendor) 70.6% against 10.3%. The card heading reads "Identical rate cards, different bills: Claude Sonnet 5.5 against Claude Sonnet 5", and a footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Every price line is a tie by design: the two models share one rate card and differ only in what they emit to finish the same task."Screenshot of the OrcaRouter model page for Anthropic Claude Sonnet 5 (anthropic/claude-sonnet-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.24-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-06-30" line, and the $2.00 input and $10.00 output prices per million tokens.Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.