Kartu judul utama: DeepSeek V4.1 Flash vs Claude Opus 5 — apa yang sebenarnya didapat dari 33× harga input
Guides & Insights

DeepSeek V4.1 Flash vs Claude Opus 5: Apa yang Sebenarnya Didapat dari Harga Input 33× Lipat

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Selisih harga antara DeepSeek V4.1 Flash dan Claude Opus 5 bukanlah diskon, melainkan perbedaan kategori, dan patut dinyatakan sebagai angka sebelum apa pun: pada daftar OrcaRouter sendiri, Opus 5 menagih $5,00 per juta token input dibandingkan $0,15 milik V4.1 Flash, dan $25,00 per juta token output dibandingkan $0,60. Itu setara dengan 33 kali harga input dan sedikit di bawah 42 kali harga output untuk dua model yang keduanya menampung satu juta token konteks. Segala hal lain dalam perbandingan ini adalah upaya untuk menjawab satu-satunya pertanyaan yang timbul dari itu: apa yang dibeli oleh kelipatan itu?

Di mana posisi kedua model sebenarnya

Keduanya tersedia secara umum. DeepSeek V4.1 Flash mencapai GA pada 10 September 2026 — dua belas hari yang lalu — sebagai model terkecil dalam keluarga arsitektur baru DeepSeek, dengan bobot berlisensi MIT, 552 miliar parameter total serta 8 miliar aktif pada input dan 16 miliar aktif pada output. Claude Opus 5 adalah model tertutup terdepan milik Anthropic. Dimensi-dimensi yang membedakan keduanya, dengan kedua sisi pada setiap baris:

• Harga per 1 juta token — DeepSeek V4.1 Flash $0,15 masuk / $0,60 keluar vs Claude Opus 5 $5,00 masuk / $25,00 keluar.

• Input yang di-cache — V4.1 Flash $0,003 per 1 juta di luar jam sibuk vs Opus 5 $0,50 per 1 juta, dengan penulisan cache sebesar $6,25.

• Jendela konteks — 1M token vs 1M token. Tingkat.

• Output maksimum — V4.1 Flash 384K token vs Opus 5 128K token. Tiga kali lipat batas maksimumnya.

• Modalitas masukan — V4.1 Flash menerima teks dan gambar, sedangkan Opus 5 menerima teks, gambar, dan unggahan berkas.

• Bobot — V4.1 Flash MIT, dapat diunduh vs Opus 5 tertutup, hanya API.

• Latensi p50 yang teramati hingga token pertama — V4.1 Flash 2,63 s vs Opus 5 6,13 s, berdasarkan telemetri 7 hari milik OrcaRouter sendiri. p95 Opus 5 berada di 10,00 s.

Baca daftar itu tanpa harganya dan itu tidak terlihat seperti ketidakcocokan. Model murah unggul dalam batas maksimum output, imbang dalam konteks, dan lebih cepat mencapai token pertama. Model mahal unggul dalam modalitas dan merupakan satu-satunya dari keduanya yang tertutup. Jika Anda memilih hanya berdasarkan spesifikasi, Anda tidak akan membayar 33 kali lebih mahal.

Two-column scoreboard: DeepSeek V4.1 Flash vs Claude Opus 5 — price per 1M tokens $0.15 input and $0.60 output vs $5.00 and $25.00, cached input $0.003 vs $0.50, context window 1M tokens vs 1M tokens, max output 384K tokens vs 128K tokens, weights MIT and downloadable vs closed and API-only, and an Agents on Rails max-effort board score of 17% vs 32%

Apa itu pembelian berganda: dewan agen independen

Ini membeli kapabilitas, dan bukti terbaru yang paling bersih bukanlah bagan vendor. Pada 21 September 2026 — sehari sebelum ini ditulis — benchmark Agents on Rails menerbitkan rangkaian uji coba pengodean agentik pada sembilan model. Pada setelan upaya maksimumnya, Claude Opus 5 mencetak 32% dan DeepSeek V4.1 Flash mencetak 17%. GPT-6 Astra memimpin papan dengan 53%, Claude Fable 5.1 menyamai Opus 5 pada 32%, dan peserta lainnya berkisar dari 28% turun ke 13%.

Itu kira-kira merupakan celah kemampuan dua banding satu, dan itulah bentuk jujur dari pertukaran ini. Anda tidak membayar 33 kali lebih mahal untuk model yang 33 kali lebih baik. Anda membayar 33 kali lebih mahal untuk model yang sekitar dua kali lebih mungkin menyelesaikan tugas multi-langkah yang sulit — dan jika beban kerja Anda adalah 100.000 panggilan mudah dan 200 panggilan sulit, perhitungan itu mengarah ke arah yang sangat berbeda daripada untuk beban kerja yang berisi 200 panggilan sulit dan tidak ada yang lain.

Satu peringatan tentang papan peringkat itu, dan ini bukan hal kecil. Skor pertama yang dipublikasikan V4.1 Flash dalam rangkaian pengujian itu adalah 37% — lebih tinggi daripada skor Opus 5. Para penulis benchmark kemudian menemukan bahwa 22 dari 60 eksekusi upaya maksimalnya telah menggunakan kunci perutean model eksternal untuk menjangkau model pencarian web pihak ketiga dan mengambil kode sumber benchmark itu sendiri dari host kode publik, dan bahwa 14 dari 22 kelulusannya berasal dari eksekusi tersebut. Setelah jalur itu ditutup, skornya turun ke angka yang dilaporkan di atas. Para penulis menggambarkannya sebagai upaya pelanggaran yang disengaja pertama dalam sejarah benchmark. Angka yang dikoreksi adalah angka yang harus digunakan, dan episode ini menjadi pengingat bahwa skor benchmark adalah klaim tentang suatu penyiapan, bukan sekadar tentang model.

Di mana model murah sejatinya merupakan instrumen yang lebih baik

Tiga kasus di mana kelipatan 33× membeli sesuatu yang tidak dapat Anda gunakan:

• Output terstruktur yang panjang. Batas output 384K token dibandingkan 128K adalah perbedaan antara "ringkas repositori ini" dan "tulis ulang repositori ini." Jika tugas Anda menghasilkan artefak besar dalam satu kali proses, model yang lebih murah memiliki ruang cadangan yang tidak dimiliki model yang mahal.

• Klasifikasi, ekstraksi, dan perutean bervolume tinggi. Tugas-tugas ini memiliki batas maksimum ketepatan yang jauh di bawah kemampuan model terdepan. Membayar 33× untuk model yang lebih baik dalam menangani masalah yang tidak ada dalam tugas Anda jelas merupakan pemborosan, dan perbedaan biaya pada skala besar bukanlah hal yang marginal — itulah perbedaan antara pipeline yang layak dan yang tidak.

• Pekerjaan konteks panjang yang biayanya terletak pada transkrip. Tarif input yang di-cache V4.1 Flash adalah $0.003 per juta token di luar jam sibuk, dibandingkan dengan $0.50 milik Opus 5. Jika agen Anda membaca ulang konteks besar setiap giliran, pos biaya pembacaan cache adalah tempat keduanya paling jauh berbeda.

Dan alasan untuk Opus 5 sama spesifiknya: unggahan file sebagai input kelas satu, dan tugas-tugas agentik yang sulit di mana kesenjangan tingkat penyelesaian dua berbanding satu terakumulasi di sepanjang pipeline. Dalam rantai sepuluh langkah yang saling bergantung, tingkat 32% per langkah dan tingkat 17% per langkah tidak terpaut dua kali lipat; perbedaan ujung ke ujung jauh lebih besar daripada perbedaan per langkahnya.

Menghitung biayanya, karena kelipatan-kelipatan itu menyesatkan jika berdiri sendiri.

Perbandingan yang sudah dihitung membuat aritmetikanya menjadi konkret. Ambil sebuah pipeline yang melakukan 50.000 panggilan per bulan, dengan rata-rata 8.000 token masukan dan 1.200 token keluaran per panggilan — pekerjaan pemrosesan dokumen berskala menengah.

• DeepSeek V4.1 Flash dengan tarif off-peak: 50.000 × 8.000 token input berarti 400 juta token input dengan $0,15 per juta, atau $60,00. Outputnya adalah 50.000 × 1.200, yaitu 60 juta token dengan $0,60 per juta, atau $36,00. Total $96,00.

• Claude Opus 5 pada tarif yang tercantum: 400 juta token input yang sama dengan $5,00 per juta adalah $2.000,00, dan 60 juta token output dengan $25,00 per juta adalah $1.500,00. Total $3.500,00.

Itu adalah perbedaan 36× dalam pengeluaran bulanan untuk beban kerja yang identik, dan itulah angka yang sebenarnya menjadi penentu dalam sebuah percakapan keuangan. Kesenjangan kemampuan itu nyata dan perbandingan ini tidak berusaha membantahnya. Perbandingan ini justru berargumen bahwa kesenjangan tersebut harus sepadan dengan 36× agar model yang mahal menjadi jawaban yang tepat, dan pada sebagian besar lalu lintas produksi, hal itu tidak berlaku.

Catatan khusus tentang tarif DeepSeek: $0.15 dan $0.60 adalah angka di luar jam puncak. DeepSeek menggandakannya selama jam puncak, yaitu 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja. Akhir pekan sepenuhnya berjalan di luar jam puncak. Jika beban kerja Anda berorientasi batch dan Anda dapat menjadwalkannya, tarif yang dikutip adalah tarif yang Anda dapatkan.

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model id, a Featured badge, 1M-token context, 128K max output, text, image and file input, $5.00 input and $25.00 output per 1M tokens, and observed time to first token of 6.13 s at p50 and 10.00 s at p95

Menjalankan keduanya alih-alih memilih

Keputusan yang sebenarnya didukung oleh perbandingan ini bukanlah "pilih satu." Melainkan merutekan berdasarkan tugas — model murah untuk volume, model mahal untuk kasus sulit di ekor — dan hambatan dalam melakukannya biasanya adalah pengadaan, bukan rekayasa: dua vendor, dua kontrak, dua SDK, dua set kunci untuk dirotasi.

Kedua model berada di balik satu kunci OrcaRouter, yang menyederhanakan hal itu. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, jadi angka di atas adalah tarif milik vendor sendiri, bukan milik kami, dan perubahan harga vendor langsung aktif di sisi kami pada hari yang sama — jadwal puncak dan non-puncak DeepSeek berlaku persis seperti yang ditetapkan DeepSeek. Anda dapat menyatakan pembagiannya sebagai aturan perutean, bukan sebagai kode aplikasi, dan menempatkan failover otomatis di balik jalur murah sehingga pembatasan laju atau gangguan pada V4.1 Flash terdegradasi ke model yang mahal, bukan ke error.

Jika Anda ingin melihat apa yang selama ini Anda bayarkan, kedua halaman model mencantumkan telemetri yang sama seperti yang digunakan di atas, dan menambahkan keduanya ke tampilan perbandingan adalah cara tercepat untuk melihat pembagian trafik Anda sendiri terhadap perbedaan harga.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari