Kartu judul hero yang dihasilkan untuk Claude Sonnet 5.5 vs DeepSeek V4 Pro, dengan subjudul 'Dua puluh poin indeks dan pembacaan cache $0,022', menampilkan $2,00 dan $10,00 per juta token dibandingkan $0,66 dan $1,98, dengan logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Claude Sonnet 5.5 vs DeepSeek V4 Pro: 20 Poin Indeks, dan Pembacaan Cache Seharga $0.022

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Letakkan kedua kartu tarif itu berdampingan dan perbandingannya tampak sudah selesai sebelum dimulai. Claude Sonnet 5.5, tersedia secara umum sejak 28 September 2026, berbiaya $2,00 per juta token masukan dan $10,00 per juta token keluaran. DeepSeek V4 Pro, dirilis 24 April 2026, berbiaya $0,66 dan $1,98. Keluaran adalah baris yang penting dalam kerja agen, dan $10,00 dibandingkan $1,98 adalah selisih lima banding satu — satu dolar dibandingkan dua puluh sen per seratus ribu token. Lalu lihat sisi kemampuan, tempat Artificial Analysis menempatkan Claude Sonnet 5.5 pada 56 di Intelligence Index v4.3 dan DeepSeek V4 Pro pada 36, selisih dua puluh poin pada perangkat uji yang sama. Itulah inti ketegangannya: model Deep​Seek berada pada seperlima harga keluaran dan sekitar dua pertiga kemampuan yang terukur, dan kedua fakta itu tidak bermuara pada satu rekomendasi tunggal tanpa mengetahui apa yang sebenarnya dilakukan beban kerja Anda dengan sebuah token.

Apa setiap model itu, secara tepat

Penamaan adalah hal pertama yang salah dalam perbandingan ini, jadi perbaiki di sini. DeepSeek V4 Pro seperti yang kami cantumkan adalah deepseek/deepseek-v4-pro, dirilis 24 April 2026, model dengan konteks 1.048.576 token dengan output maksimum 384.000 token dan input hanya teks. Artificial Analysis melacak snapshot yang diberi label DeepSeek V4 Pro 0813 — build 13 Agustus — dan angka yang dikutip di bawah berasal dari baris itu. Sisi Sonnet adalah dari Anthropic anthropic/claude-sonnet-5.5, input teks, gambar, dan file, konteks 1M, output maksimum 128K. Jika Anda membandingkan halaman vendor dengan halaman evaluator dan angkanya tidak cocok, periksa sufiks build sebelum menyimpulkan bahwa salah satunya salah.

DeepSeek V4 Pro hanya mendukung input teks. Claude Sonnet 5.5 juga menerima gambar dan file. Itu adalah perbedaan struktural pertama dan bukan perbedaan yang marginal: pipeline apa pun yang menyerap screenshot, PDF, atau diagram tidak bisa begitu saja menukar satu dengan yang lain, karena salah satunya tidak bisa melihat.

Kartu tarif, baris demi baris

• Input — $0,66 per juta untuk DeepSeek V4 Pro dibandingkan dengan $2,00 untuk Claude Sonnet 5.5; DeepSeek 67% lebih murah

• Output — $1,98 per juta dibandingkan dengan $10,00; DeepSeek 80% lebih murah, selisih tunggal terbesar dalam perbandingan ini

• Pembacaan cache — $0,022 per juta dibandingkan $0,20; DeepSeek 89% lebih murah pada jalur yang mendominasi loop agen yang panjang

• Penulisan cache — $2.50 per juta untuk jendela lima menit pada Claude Sonnet 5.5; baris katalog DeepSeek V4 Pro tidak memuat baris penulisan cache terpisah

• Konteks — 1,048,576 token dibandingkan 1,000,000; DeepSeek sedikit lebih panjang, perbedaan yang tidak memiliki konsekuensi praktis

• Output maksimum — 384.000 token dibandingkan 128.000; DeepSeek menang dengan faktor tiga pada batas atas yang membatasi generasi massal

• Modalitas input — hanya teks versus teks, gambar, dan file

• Penalaran — keduanya menggunakan upaya penalaran yang dapat dikonfigurasi, bukan anggaran pemikiran tetap, sehingga kedalaman menjadi parameter permintaan pada masing-masing

Ada detail penjadwalan di sisi DeepSeek yang akan disembunyikan oleh perbandingan daftar tarif. Baris katalog kami memiliki jendela penetapan harga berbasis waktu: antara pukul 01:00 dan 04:00 UTC, dan lagi antara pukul 06:00 dan 10:00 UTC, tarif yang tercantum dikalikan dua. Pada jam-jam tersebut, V4 Pro memerlukan biaya input $1.32 dan output $3.96 — masih lebih murah daripada Claude Sonnet 5.5, masing-masing sebesar 34% dan 60%, tetapi tidak lagi sebesar margin yang disiratkan oleh angka utama. Beban kerja batch yang dapat dijadwalkan layak dijadwalkan, dan beban kerja yang tidak dapat dijadwalkan layak diberi harga pada tarif puncak, bukan tarif rata-rata. Ini juga jenis hal yang hanya muncul jika Anda membaca katalog, bukan halaman pemasaran, yang menjadi argumen untuk menempatkan setiap model kandidat di balik satu endpoint, bukan tiga akun vendor.

Dua angka kapabilitas, salah satunya tidak independen

Di sisi pihak ketiga, peringkatnya tidak ambigu. Artificial Analysis memberi skor Claude Sonnet 5.5 sebesar 56 dan DeepSeek V4 Pro sebesar 36 pada Intelligence Index v4.3, keduanya dalam konfigurasi penalaran dengan upaya maksimum. Evaluator yang sama menempatkan Claude Opus 5 pada 51 dan Gemini 3.1 Pro Preview pada 30, sehingga skor 36 milik V4 Pro menempatkannya di bawah model andalan Anthropic sebelumnya dan di atas tier Pro Google — posisi yang terhormat bagi model dengan harga seperlima, dan jauh dari puncak.

Pembalikan biaya-per-tugas juga muncul di sini, dan dalam pertarungan ini arahnya berlawanan dengan yang sebelumnya. DeepSeek V4 Pro membutuhkan biaya $0.67 untuk dievaluasi pada suite indeks. Claude Sonnet 5.5 membutuhkan biaya $7.60. Itu bukan salah ketik dan bukan artefak pembulatan: model Anthropic yang lebih baru mengeluarkan 410 juta token di seluruh suite, dibandingkan dengan median 88 juta, dan verbositas model DeepSeek jauh dari cukup untuk menutup selisih harga sebesar itu. Pada tugas terbuka yang tidak dibatasi, model yang lebih murah ternyata satu orde besaran lebih murah dalam praktik, bukan hanya pada daftar tarif.

Angka-angka dari vendor perlu ditangani dengan lebih hati-hati. DeepSeek menerbitkan angka τ²-Bench sebesar 96.2 untuk V4 Pro, yang merupakan angka kuat, tetapi angka itu dilaporkan oleh vendor dan τ²-Bench sejak itu telah dihapus dari indeks Artificial Analysis pada revisi v4.3-nya — jadi ini adalah angka yang tidak dapat ditempatkan secara independen pada skala yang sama dengan apa pun yang diterbitkan Anthropic. Tabel peluncuran Anthropic sendiri untuk Claude Sonnet 5.5 juga punya catatan kaveatnya sendiri, termasuk catatan kaki bahwa pengaturan Max effort mendapat skor lebih rendah daripada Xhigh pada FrontierCode dan catatan bahwa dua dari benchmark tersebut dijalankan pada deployment pra-rilis dengan bug structured-outputs. Jika Anda menempatkan tabel kedua vendor secara berdampingan, Anda memiliki dua dokumen pemasaran, bukan peringkat. Satu-satunya angka dalam artikel ini yang berada pada satu sumbu adalah dua skor indeks dan dua biaya per tugas, karena satu evaluator menghasilkan keempatnya.

Mengapa batas atas keluaran lebih penting daripada harga

Angka dalam perbandingan ini yang paling sedikit diperhatikan adalah angka yang mengubah arsitektur: 384.000 token keluaran dibandingkan 128.000.

Batas output bukanlah fitur kenyamanan. Ini menentukan apakah suatu tugas merupakan satu panggilan atau sebuah rantai. Menghasilkan file sumber berukuran besar, mengeluarkan dokumen lengkap, memproduksi laporan terstruktur yang panjang, menerjemahkan bab buku — apa pun yang artefaknya lebih besar dari 128.000 token — tidak dapat dilakukan dalam satu panggilan ke Claude Sonnet 5.5, dan harus dipecah menjadi urutan dengan state yang dibawa antar panggilan. Dekomposisi berarti lebih banyak token masukan yang dikirim ulang pada setiap langkah, lebih banyak pembacaan cache, lebih banyak kode orkestrasi, dan kelas kegagalan baru di mana sambungan antar potongan menjadi tempat kesalahan berada. Model dengan harga lima kali lipat yang menghilangkan seluruh lapisan orkestrasi bisa lebih murah dalam jam rekayasa sebelum lebih murah dalam token, dan sebaliknya, tugas yang muat dalam satu panggilan adalah tugas di mana batas output tidak pernah masuk ke dalam perhitungan sama sekali.

Jadi pertanyaan batas atas lebih dulu daripada pertanyaan harga. Jika artefak terpanjang Anda muat di bawah 128.000 token, abaikan bagian ini dan bandingkan berdasarkan biaya per tugas yang diselesaikan. Jika tidak, hitung biaya pipeline yang harus Anda bangun, bukan hanya tokennya.

Biaya beralih dan masalah fallback

Migrasi ke arah mana pun sebagian besar berkaitan dengan prompting, bukan kode, dengan satu pengecualian yang perlu dianggarkan.

Kedua model mengonfigurasi penalaran melalui parameter effort, tetapi itu adalah parameter dari vendor yang berbeda, dengan tingkat dan default yang berbeda. Prompt yang disetel untuk pengaturan Anthropic dengan effort tinggi tidak berpindah ke pengaturan effort DeepSeek sebagai pertukaran yang setara; prompt itu berpindah sebagai pengukuran ulang. Perkirakan menghabiskan satu hari per beban kerja untuk membangun kembali kualitas sebelum Anda memercayai proyeksi biaya, di kedua arah perpindahan.

Pengecualiannya adalah visi. Claude Sonnet 5.5 membaca gambar dan berkas; DeepSeek V4 Pro hanya membaca teks. Bagian mana pun dari pipeline Anda yang memberikan model tangkapan layar, halaman hasil pindai, atau bagan yang dirender tidak memiliki padanan di DeepSeek, jadi migrasi penuh hanya tersedia untuk subset trafik Anda yang berbentuk teks. Itu adalah garis pemisah yang harus ditarik sejak awal, karena biasanya ini berarti jawabannya bukan satu model, melainkan sebuah pemisahan.

Keduanya dapat dirutekan di OrcaRouter saat ini — deepseek/deepseek-v4-pro dan anthropic/claude-sonnet-5 keduanya merupakan entri katalog yang aktif, dihargai sesuai daftar harga penyedia dengan markup 0%, pada satu kredensial. Hal itu paling penting justru dalam perbandingan semacam ini, di mana faktor penentunya bukanlah model mana yang lebih baik secara abstrak, melainkan model mana yang seharusnya menangani permintaan tertentu. Pemisahan yang mengarahkan pekerjaan massal teks-saja ke model murah dan pekerjaan visi ke model mahal adalah aturan perutean, dan itu jauh lebih mudah diungkapkan ketika kedua endpoint merespons kunci yang sama dan kebijakan failover yang sama. Claude Sonnet 5.5 sendiri belum menjadi rute di platform kami, jadi versi hari ini dari pemisahan tersebut memasangkan model Anthropic dengan DeepSeek V4 Pro alih-alih menggantikannya.

Keputusan itu, dinyatakan sebagai aturan.

Kirim ke Claude Sonnet 5.5 ketika tugasnya perlu melihat — gambar, PDF, tangkapan layar, output yang dirender — ketika artefaknya lebih panjang dari satu halaman prosa dan Anda ingin model terdepan menulisnya, atau ketika selisih indeks dua puluh poin adalah perbedaan antara draf yang harus ditulis ulang oleh manusia dan draf yang bisa mereka rilis.

Kirimkan ke DeepSeek V4 Pro ketika beban kerjanya berupa teks masuk, teks keluar, bervolume tinggi, dan toleran terhadap batas atas kualitas penalaran yang lebih rendah: klasifikasi, ekstraksi, peringkasan, penulisan ulang massal, transformasi kode dengan spesifikasi yang jelas, dan apa pun yang jika tidak, Anda akan membayar sepuluh dolar per juta token keluaran untuk memindahkan kata-kata. Diskon baca cache 89% membuat loop agen konteks panjang pada model ini murah secara struktural dengan cara yang tidak dimiliki oleh apa pun lain dalam perbandingan.

Verdikt jujurnya: ini bukanlah perlombaan kapabilitas yang sedang kalah dijalani DeepSeek, melainkan keputusan alokasi sumber daya yang salah diarahkan oleh sebagian besar tim, yaitu ke arah membeli kapabilitas yang tidak mereka gunakan. Jika lalu lintas Anda berupa teks dan standar kualitas Anda adalah "cukup baik untuk ditinjau" alih-alih "cukup baik untuk dikirim tanpa dibaca," V4 Pro dengan 20% dari harga output dan pembacaan cache $0,022 adalah default yang tepat, dan dua puluh poin indeks itu adalah pajak yang saat ini Anda sukarela bayar.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari