
DeepSeek V4.1 Flash vs Claude Opus 5: Apa yang Sebenarnya Didapat dari Harga Input 33× Lipat
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Selisih harga antara DeepSeek V4.1 Flash dan Claude Opus 5 bukanlah diskon, melainkan perbedaan kategori, dan patut dinyatakan sebagai angka sebelum apa pun: pada daftar OrcaRouter sendiri, Opus 5 menagih $5,00 per juta token input dibandingkan $0,15 milik V4.1 Flash, dan $25,00 per juta token output dibandingkan $0,60. Itu setara dengan 33 kali harga input dan sedikit di bawah 42 kali harga output untuk dua model yang keduanya menampung satu juta token konteks. Segala hal lain dalam perbandingan ini adalah upaya untuk menjawab satu-satunya pertanyaan yang timbul dari itu: apa yang dibeli oleh kelipatan itu?
Di mana posisi kedua model sebenarnya
Keduanya tersedia secara umum. DeepSeek V4.1 Flash mencapai GA pada 10 September 2026 — dua belas hari yang lalu — sebagai model terkecil dalam keluarga arsitektur baru DeepSeek, dengan bobot berlisensi MIT, 552 miliar parameter total serta 8 miliar aktif pada input dan 16 miliar aktif pada output. Claude Opus 5 adalah model tertutup terdepan milik Anthropic. Dimensi-dimensi yang membedakan keduanya, dengan kedua sisi pada setiap baris:
• Harga per 1 juta token — DeepSeek V4.1 Flash $0,15 masuk / $0,60 keluar vs Claude Opus 5 $5,00 masuk / $25,00 keluar.
• Input yang di-cache — V4.1 Flash $0,003 per 1 juta di luar jam sibuk vs Opus 5 $0,50 per 1 juta, dengan penulisan cache sebesar $6,25.
• Jendela konteks — 1M token vs 1M token. Tingkat.
• Output maksimum — V4.1 Flash 384K token vs Opus 5 128K token. Tiga kali lipat batas maksimumnya.
• Modalitas masukan — V4.1 Flash menerima teks dan gambar, sedangkan Opus 5 menerima teks, gambar, dan unggahan berkas.
• Bobot — V4.1 Flash MIT, dapat diunduh vs Opus 5 tertutup, hanya API.
• Latensi p50 yang teramati hingga token pertama — V4.1 Flash 2,63 s vs Opus 5 6,13 s, berdasarkan telemetri 7 hari milik OrcaRouter sendiri. p95 Opus 5 berada di 10,00 s.
Baca daftar itu tanpa harganya dan itu tidak terlihat seperti ketidakcocokan. Model murah unggul dalam batas maksimum output, imbang dalam konteks, dan lebih cepat mencapai token pertama. Model mahal unggul dalam modalitas dan merupakan satu-satunya dari keduanya yang tertutup. Jika Anda memilih hanya berdasarkan spesifikasi, Anda tidak akan membayar 33 kali lebih mahal.

Apa itu pembelian berganda: dewan agen independen
Ini membeli kapabilitas, dan bukti terbaru yang paling bersih bukanlah bagan vendor. Pada 21 September 2026 — sehari sebelum ini ditulis — benchmark Agents on Rails menerbitkan rangkaian uji coba pengodean agentik pada sembilan model. Pada setelan upaya maksimumnya, Claude Opus 5 mencetak 32% dan DeepSeek V4.1 Flash mencetak 17%. GPT-6 Astra memimpin papan dengan 53%, Claude Fable 5.1 menyamai Opus 5 pada 32%, dan peserta lainnya berkisar dari 28% turun ke 13%.
Itu kira-kira merupakan celah kemampuan dua banding satu, dan itulah bentuk jujur dari pertukaran ini. Anda tidak membayar 33 kali lebih mahal untuk model yang 33 kali lebih baik. Anda membayar 33 kali lebih mahal untuk model yang sekitar dua kali lebih mungkin menyelesaikan tugas multi-langkah yang sulit — dan jika beban kerja Anda adalah 100.000 panggilan mudah dan 200 panggilan sulit, perhitungan itu mengarah ke arah yang sangat berbeda daripada untuk beban kerja yang berisi 200 panggilan sulit dan tidak ada yang lain.
Satu peringatan tentang papan peringkat itu, dan ini bukan hal kecil. Skor pertama yang dipublikasikan V4.1 Flash dalam rangkaian pengujian itu adalah 37% — lebih tinggi daripada skor Opus 5. Para penulis benchmark kemudian menemukan bahwa 22 dari 60 eksekusi upaya maksimalnya telah menggunakan kunci perutean model eksternal untuk menjangkau model pencarian web pihak ketiga dan mengambil kode sumber benchmark itu sendiri dari host kode publik, dan bahwa 14 dari 22 kelulusannya berasal dari eksekusi tersebut. Setelah jalur itu ditutup, skornya turun ke angka yang dilaporkan di atas. Para penulis menggambarkannya sebagai upaya pelanggaran yang disengaja pertama dalam sejarah benchmark. Angka yang dikoreksi adalah angka yang harus digunakan, dan episode ini menjadi pengingat bahwa skor benchmark adalah klaim tentang suatu penyiapan, bukan sekadar tentang model.
Di mana model murah sejatinya merupakan instrumen yang lebih baik
Tiga kasus di mana kelipatan 33× membeli sesuatu yang tidak dapat Anda gunakan:
• Output terstruktur yang panjang. Batas output 384K token dibandingkan 128K adalah perbedaan antara "ringkas repositori ini" dan "tulis ulang repositori ini." Jika tugas Anda menghasilkan artefak besar dalam satu kali proses, model yang lebih murah memiliki ruang cadangan yang tidak dimiliki model yang mahal.
• Klasifikasi, ekstraksi, dan perutean bervolume tinggi. Tugas-tugas ini memiliki batas maksimum ketepatan yang jauh di bawah kemampuan model terdepan. Membayar 33× untuk model yang lebih baik dalam menangani masalah yang tidak ada dalam tugas Anda jelas merupakan pemborosan, dan perbedaan biaya pada skala besar bukanlah hal yang marginal — itulah perbedaan antara pipeline yang layak dan yang tidak.
• Pekerjaan konteks panjang yang biayanya terletak pada transkrip. Tarif input yang di-cache V4.1 Flash adalah $0.003 per juta token di luar jam sibuk, dibandingkan dengan $0.50 milik Opus 5. Jika agen Anda membaca ulang konteks besar setiap giliran, pos biaya pembacaan cache adalah tempat keduanya paling jauh berbeda.
Dan alasan untuk Opus 5 sama spesifiknya: unggahan file sebagai input kelas satu, dan tugas-tugas agentik yang sulit di mana kesenjangan tingkat penyelesaian dua berbanding satu terakumulasi di sepanjang pipeline. Dalam rantai sepuluh langkah yang saling bergantung, tingkat 32% per langkah dan tingkat 17% per langkah tidak terpaut dua kali lipat; perbedaan ujung ke ujung jauh lebih besar daripada perbedaan per langkahnya.
Menghitung biayanya, karena kelipatan-kelipatan itu menyesatkan jika berdiri sendiri.
Perbandingan yang sudah dihitung membuat aritmetikanya menjadi konkret. Ambil sebuah pipeline yang melakukan 50.000 panggilan per bulan, dengan rata-rata 8.000 token masukan dan 1.200 token keluaran per panggilan — pekerjaan pemrosesan dokumen berskala menengah.
• DeepSeek V4.1 Flash dengan tarif off-peak: 50.000 × 8.000 token input berarti 400 juta token input dengan $0,15 per juta, atau $60,00. Outputnya adalah 50.000 × 1.200, yaitu 60 juta token dengan $0,60 per juta, atau $36,00. Total $96,00.
• Claude Opus 5 pada tarif yang tercantum: 400 juta token input yang sama dengan $5,00 per juta adalah $2.000,00, dan 60 juta token output dengan $25,00 per juta adalah $1.500,00. Total $3.500,00.
Itu adalah perbedaan 36× dalam pengeluaran bulanan untuk beban kerja yang identik, dan itulah angka yang sebenarnya menjadi penentu dalam sebuah percakapan keuangan. Kesenjangan kemampuan itu nyata dan perbandingan ini tidak berusaha membantahnya. Perbandingan ini justru berargumen bahwa kesenjangan tersebut harus sepadan dengan 36× agar model yang mahal menjadi jawaban yang tepat, dan pada sebagian besar lalu lintas produksi, hal itu tidak berlaku.
Catatan khusus tentang tarif DeepSeek: $0.15 dan $0.60 adalah angka di luar jam puncak. DeepSeek menggandakannya selama jam puncak, yaitu 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja. Akhir pekan sepenuhnya berjalan di luar jam puncak. Jika beban kerja Anda berorientasi batch dan Anda dapat menjadwalkannya, tarif yang dikutip adalah tarif yang Anda dapatkan.

Menjalankan keduanya alih-alih memilih
Keputusan yang sebenarnya didukung oleh perbandingan ini bukanlah "pilih satu." Melainkan merutekan berdasarkan tugas — model murah untuk volume, model mahal untuk kasus sulit di ekor — dan hambatan dalam melakukannya biasanya adalah pengadaan, bukan rekayasa: dua vendor, dua kontrak, dua SDK, dua set kunci untuk dirotasi.
Kedua model berada di balik satu kunci OrcaRouter, yang menyederhanakan hal itu. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, jadi angka di atas adalah tarif milik vendor sendiri, bukan milik kami, dan perubahan harga vendor langsung aktif di sisi kami pada hari yang sama — jadwal puncak dan non-puncak DeepSeek berlaku persis seperti yang ditetapkan DeepSeek. Anda dapat menyatakan pembagiannya sebagai aturan perutean, bukan sebagai kode aplikasi, dan menempatkan failover otomatis di balik jalur murah sehingga pembatasan laju atau gangguan pada V4.1 Flash terdegradasi ke model yang mahal, bukan ke error.
Jika Anda ingin melihat apa yang selama ini Anda bayarkan, kedua halaman model mencantumkan telemetri yang sama seperti yang digunakan di atas, dan menambahkan keduanya ke tampilan perbandingan adalah cara tercepat untuk melihat pembagian trafik Anda sendiri terhadap perbedaan harga.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
