
Harga DeepSeek V4.1 Flash: Daftar Tarif Lengkap, dan Angka Cache-Hit yang Menentukan Tagihan Anda
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
DeepSeek V4.1 Flash telah tersedia secara umum sejak 2026-09-10, dan hingga hari ini daftar tarif yang dipublikasikannya adalah yang termurah di tingkat teratas pasar model: $0,15 per juta token masukan, $0,60 per juta keluaran, dan $0,003 per juta untuk cache hit. Ketiga angka tersebut adalah kolom di luar jam sibuk. Selama jendela jam sibuk hari kerja DeepSeek, semuanya menjadi dua kali lipat, termasuk cache hit. Perbandingan yang penting bukanlah dengan flagship tua DeepSeek sendiri — DeepSeek-V4-Pro-0813 mencantumkan harga $0,66 / $1,98 per juta di luar jam sibuk, sehingga Flash memotong harga saudaranya sendiri sekitar 4x pada masukan — melainkan dengan tingkat frontier tertutup yang benar-benar dijadikan patokan harga oleh pembeli: GPT-5.6 Sol, Claude Opus 5, dan Gemini 3.8 Flash, yang masing-masing mengenakan biaya satu urutan besaran lebih banyak per token.
Satu koreksi sebelum angkanya, karena kebocoran yang mendahului peluncuran ini masih beredar. Angka-angka yang tersebar sebelum GA menggambarkan pemotongan harga yang akan berlaku "besok." Harga-harganya memang nyata; penyampaiannya tidak. V4.1 Flash dirilis pada 2026-09-10 dengan tarif ini sudah berlaku, dan log perubahan DeepSeek sendiri mencatat pengurangan itu sebagai bagian dari rilis, bukan sebagai pemotongan yang menyusul. Semua yang di bawah ini dibaca dari halaman harga live DeepSeek hari ini, 2026-09-16.
Kartu tarif lengkap, per 2026-09-16
DeepSeek menerbitkan satu lembar yang mencakup SKU saat ini, dengan setiap item baris dibagi ke dalam kolom peak dan off-peak. Untuk id model deepseek-flash, yang melayani DeepSeek-V4.1-Flash, tarif yang dipublikasikan adalah:
• Input, cache miss — $0.15 per 1 juta token di luar jam sibuk; $0.30 per 1 juta pada jam sibuk
• Input, cache hit — $0,003 per 1 juta token di luar jam sibuk; $0,006 per 1 juta pada jam sibuk
• Output — $0,60 per 1 juta token di luar jam sibuk; $1,20 per 1 juta pada jam sibuk
• Jendela konteks — 1 juta token, dengan output maksimum 384K
• Batas konkurensi — 2.500 permintaan bersamaan pada SKU Flash
• ID model lama — deepseek-v4-flash dan deepseek-v4-flash-vision-exp sudah tidak digunakan lagi sebagai produk terpisah, tetapi tetap diarahkan ke V4.1 Flash dan ditagih dengan harga Flash
Selisih antara dua baris pertama adalah inti dari lembar ini. Sebuah cache hit berbiaya 50x lebih murah daripada cache miss di luar jam sibuk — diskon 98%, yang juga merupakan cara Artificial Analysis menggambarkannya dalam model biayanya. Tidak ada hal lain di kartu ini yang menggeser tagihan sejauh itu.


Puncak bukanlah kesalahan pembulatan, dan waktunya diatur untuk Beijing
Jendela puncak DeepSeek adalah Senin sampai Jumat, 01.00–04.00 UTC dan 06.00–10.00 UTC. Semua di luar jendela tersebut — termasuk seluruh jam akhir pekan — ditagih dengan tarif setengah. Penggandaan berlaku untuk ketiga lini, jadi cache miss pada jam puncak berbiaya $0,30 dan output puncak berbiaya $1,20.
Ke mana jendela-jendela waktu itu jatuh sepenuhnya bergantung pada di mana Anda berada. Di Beijing, jendelanya adalah 09.00–12.00 dan 14.00–18.00 — dua blok kerja, dan itulah intinya. Di Berlin, pada bulan September, jendela kedua adalah 08.00–12.00 CEST: seluruh pagi tim Eropa adalah puncak. Di New York, jendela yang sama adalah 02.00–06.00 EDT. Tim yang berbasis di AS yang menjalankan jam kerja normal praktis tidak pernah ditagih pada tarif puncak, dan tim UE membayar dua kali lipat setiap pagi sebelum makan siang. Jika Anda memilih kapan menjalankan tugas batch, itu adalah keputusan senilai $0,15 per juta token dan tidak memerlukan biaya apa pun untuk dibuat.
Apa dampak nyata penetapan harga cache-hit terhadap tagihan agen
Cache hit bersifat otomatis di DeepSeek — dokumen menyatakan caching disk diaktifkan secara default untuk semua pengguna tanpa perubahan kode — jadi diskonnya bukan sesuatu yang harus Anda rancang arsitekturnya. Ini juga bersifat upaya terbaik, bukan jaminan: DeepSeek menyatakan tidak ada TTL tetap, cache yang tidak digunakan akan dibersihkan "biasanya dalam beberapa jam hingga beberapa hari," dan sistem tidak menjanjikan tingkat hit 100%. Sebaiknya baca dari respons prompt_cache_hit_tokens dan prompt_cache_miss_tokens field sebelum Anda memodelkan apa pun berdasarkan ini.
Aritmetika lebih penting daripada kata sifat. Ambil agen pengodean dengan prefiks stabil 40.000 token — prompt sistem, skema alat, konteks repo — jalankan selama sesi 60 giliran, yang setiap gilirannya menambahkan sekitar 2.000 token keluaran alat dan model mengeluarkan sekitar 1.200 token. Total input sepanjang sesi adalah 5,94 juta token dan total output 72.000 token.
Ditagih tanpa cache sama sekali, di luar jam sibuk: input 5.94M dengan $0.15 adalah $0.891, ditambah output 72,000 dengan $0.60 adalah $0.043 — sekitar $0.93 untuk sesi ini.
Ditagih dengan prefiks yang di-cache, yang sebenarnya terjadi secara default: 5.782M dari token masukan tersebut datang sebagai cache hit dengan tarif $0.003 ($0.017), 158.000 datang sebagai cache miss dengan tarif $0.15 ($0.024), dan 72.000 token keluaran yang sama berbiaya $0.043. Sekitar $0.084 — sekitar 11 kali lebih murah. Porsi masukan turun dari 95% dari tagihan menjadi 49%, porsi yang di-cache saja sebesar 21%, dan token keluaran menjadi pos tunggal terbesar. Model yang sama, sesi yang sama, keluaran yang sama — satu-satunya yang berubah adalah apakah prefiksnya digunakan kembali.
Perhatikan apa yang tidak ada di lembar DeepSeek: item baris penulisan cache. Anthropic mengenakan 1,25x input dasar untuk mengisi cache 5 menit dan 2x untuk satu jam; kartu DeepSeek hanya mencantumkan hit dan miss, dan panduan caching-nya tidak menjabarkan biaya penulisan atau penyimpanan. Jika Anda membandingkan ekonomi caching antar vendor alih-alih tarif token utama, ketiadaan itu lebih bernilai daripada yang disiratkan oleh diskon hit 50x.
Itulah juga sebabnya detail pass-through pada DeepSeek V4.1 Flash di OrcaRouter penting di sini. Kami menagih dengan tarif daftar milik penyedia sendiri tanpa markup, jadi perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama alih-alih menunggu proses penetapan harga ulang — dan kolom cache-hit serta peak/off-peak yang Anda lihat di atas adalah kolom yang benar-benar menjadi dasar penagihan Anda, bukan perkiraan campuran dari kolom-kolom tersebut.

Dibandingkan dengan DeepSeek-V4-Pro-0813: selisih 4x, dan pensiun yang tidak terjadi
Perbandingan internal yang jelas adalah SKU unggulan, dan ini tidak sedramatis yang disiratkan oleh tarif utamanya. DeepSeek-V4-Pro-0813, id model deepseek-v4-pro, dipatok pada $0,66 per 1 jt input saat cache miss dan $1,98 per 1 jt output di luar jam sibuk, dua kali lipat pada jam sibuk menjadi $1,32 dan $3,96. Cache hit-nya berbiaya $0,022 di luar jam sibuk — lebih dari 7x milik Flash.
• Input cache-miss — $0,15 vs $0,66 di luar jam sibuk, jadi Flash 4,4x lebih murah
• Output — $0.60 vs $1.98 di luar jam sibuk, jadi Flash 3,3x lebih murah
• Input yang kena cache — $0.003 vs $0.022 di luar jam sibuk, jadi Flash 7,3x lebih murah
• Batas konteks dan output — identik pada 1M dan 384K di kedua SKU
• Konkurensi — 2.500 pada Flash versus 500 pada V4 Pro, perbedaan 5x yang sama sekali tidak muncul di daftar harga
Ada tiga hal tentang perbandingan ini yang mudah salah dipahami. Pertama, argumen penggunaan ulang lebih kuat pada model unggulan secara absolut meskipun Flash memiliki pengganda yang lebih besar: meng-cache satu juta token menghemat $0,638 pada V4 Pro dan $0,147 pada Flash, karena tingkat miss model unggulan jauh lebih tinggi sejak awal. Kedua, model yang semua orang perkirakan sudah tidak ada ternyata masih ada: DeepSeek mengumumkan akan berhenti melayani V4 Pro pada 2026-09-14 dan mengalihkan permintaan tersebut ke Flash, menuai reaksi keras dari para pengembang karena mengganti model backend di tengah alur kerja produksi, lalu membatalkan keputusan itu pada 2026-09-11. V4 Pro masih dilayani, dengan tarif penagihan yang tidak berubah. Ketiga, dan inilah jebakan yang dimasuki oleh pemberitaan soal kebocoran itu — tidak ada V4.1 Pro yang dirilis. DeepSeek-V4-Pro-0813 tetap menjadi SKU unggulan, dan vendor tersebut belum merilis penerus dengan nama itu. Siapa pun yang menghitung biaya migrasi ke "V4.1 Pro" sedang menghitung biaya untuk model yang tidak ada.
Dibandingkan dengan tier frontier tertutup
Dibandingkan dengan model-model tertutup yang benar-benar masuk daftar pendek pembeli, faktor pengalinya adalah sorotan utama. Semua angka di bawah ini berasal dari halaman harga resmi yang diterbitkan masing-masing vendor hari ini.
• GPT-5.6 Sol — terdaftar pada $5.00 per 1 juta token input dan $30.00 per 1 juta token output pada tier konteks pendek OpenAI, saat ini memberlakukan tarif promosi $4.00 / $20.00 yang menurut OpenAI tersedia setidaknya hingga 2026-11-21, dengan input yang di-cache sebesar $0.40. Dibandingkan dengan tarif promosi, DeepSeek V4.1 Flash 26.7x lebih murah untuk input dan 33.3x untuk output; dibandingkan dengan harga daftar, 33x dan 50x. Biaya cache hit Sol 133x lebih besar daripada milik Flash.
• Claude Opus 5 — $5,00 per 1 juta token input dan $25,00 per 1 juta token output, dengan cache hit sebesar $0,50 per 1 juta pada daftar harga resmi Anthropic. Itu 33 kali tarif input Flash, 42 kali tarif outputnya, dan 167 kali tarif cache-hit-nya. Penulisan cache 5 menit Anthropic menambahkan 1,25 kali lagi di atasnya; daftar harga DeepSeek tidak memiliki baris yang setara.
• Gemini 3.8 Flash — $0.75 per 1 juta input dan $3.75 per 1 juta output hingga 2026-12-31, dengan kedua tarif dijadwalkan berlipat ganda pada 2027-01-01, input yang di-cache sebesar $0.075, dan — inilah baris yang berulang di tagihan nyata — cache penyimpanan sebesar $0.50 per 1 juta token per jam. Flash 5x lebih murah pada input, 6.25x pada output, dan 25x pada cache hit dibandingkannya, dan DeepSeek tidak memungut biaya apa pun untuk menyimpan cache.
Konteks kapabilitas itulah yang menjaga ini tetap jujur. Pada Indeks Kecerdasan v4.3 milik Artificial Analysis, DeepSeek V4.1 Flash (reasoning, max effort) mendapat skor 40 dan berada di peringkat ke-6 dari 113 model, dengan $0,27 per tugas indeks dan 214,4 token keluaran per detik. Itu adalah posisi yang nyaris setara dengan frontier dengan harga 26x lebih rendah daripada tingkat yang dibandingkan dengannya — tetapi pengukuran yang sama menunjukkan bahwa ini adalah salah satu model paling verbose yang pernah diuji AA, menghasilkan 250M token keluaran selama menjalankan indeks, dibandingkan median 140M. Verbositas tidak mengubah harga per token dan memang mengubah tagihan. Model yang menulis 62% lebih banyak token daripada median tetap jauh lebih murah di sini, tetapi "murah per token" dan "murah per tugas" adalah klaim yang berbeda, dan hanya yang kedua yang Anda bayar.
Apakah ada paket gratis?
Tidak. Halaman harga DeepSeek sendiri tidak mendokumentasikan tier API gratis, tidak ada kuota bulanan gratis, dan tidak ada model gratis — penagihannya bersifat bayar sesuai pemakaian terhadap saldo yang diisi ulang atau diberikan, dengan saldo yang diberikan digunakan lebih dahulu. Aplikasi chat konsumen gratis; API di balik deepseek-flash tidak, dan tidak ada endpoint gratis untuknya di platform DeepSeek. Beberapa gateway pihak ketiga mengiklankan akses gratis atau uji coba ke model ini, dan kami akan memperlakukan semuanya sebagai permukaan prototipe, bukan backend produksi, karena ketentuan tersebut berubah tanpa pemberitahuan dan tidak ada satu pun yang membawa kartu tarif milik vendor itu sendiri.
Klaim efisiensi di balik harga
Harga itu bukan subsidi, setidaknya menurut DeepSeek sendiri. Kartu model dan laporan teknis vendor tersebut mendeskripsikan V4.1 Flash sebagai mixture-of-experts berparameter 552B dengan tata letak Causal Encoder-Decoder yang mengaktifkan sekitar 8B parameter per token selama prefill dan 16B selama decode — asimetris secara desain, murah untuk dibaca dan lebih mahal untuk ditulis. Dari sisi memori, DeepSeek melaporkan cache KV global sekitar 890 byte per token, kira-kira seperempat dari DeepSeek-V4-Flash, dan jejak cache persisten sekitar seperdelapan darinya pada beban kerja yang identik, dicapai dengan membuang status sliding-window dan memutar ulang 128 token terakhir saat cache hit. Ini adalah pengukuran yang dilaporkan vendor pada perangkat keras vendor sendiri, dan laporan teknisnya tidak mengklaim kesetaraan matematis dengan komputasi penuh untuk jalur replay.
Jumlah parameter adalah angka dalam rilis ini yang benar-benar belum pasti, dan ada baiknya kita tepat tentang alasannya. Prosa DeepSeek melaporkan 552B, dan itu adalah tulang punggung — bagian yang melakukan komputasi. Di sampingnya ada Engram, tabel pencarian memori kondisional yang menurut model card berukuran 196B parameter, diakses melalui pencarian token alih-alih dihitung secara langsung. Tambahkan keduanya dan Anda mendekati 748B, angka yang diperjuangkan oleh analisis komunitas yang banyak dibaca di r/LocalLLaMA dalam hitungan jam setelah bobot dirilis, dan yang panel file repositori Hugging Face sendiri dorong lebih tinggi lagi, menuju 763B. Tulisan-tulisan penerapan komunitas telah menghitung checkpoint sekitar 510 GB di 48 shard, dikirim dalam bentuk terkuantisasi secara native sebagai bobot dense FP8 dengan expert FP4.Anggap totalnya masih diperdebatkan dan angka tulang punggungnya sebagai laporan vendor. Jumlah parameter aktif adalah yang menentukan kecepatan; bobot residen adalah yang menentukan apakah model bisa berjalan sama sekali.
Self-hosting adalah alternatif nyata untuk harga ini, di bawah MIT
Bobotnya ada di deepseek-ai/DeepSeek-V4.1-Flash di bawah lisensi MIT, yang mengizinkan penggunaan komersial, modifikasi, dan redistribusi. Hal itu membuat daftar tarif API menjadi pilihan, bukan pungutan: dengan MIT, tidak ada apa pun dalam lisensi yang mencegah Anda menjalankan model ini sendiri dan membayar komputasi alih-alih token.
Yang tidak membuatnya menjadi murah untuk dilakukan. Checkpoint-nya kira-kira 510 GB bobot residen sebelum cache dan aktivasi, DeepSeek tidak menyatakan persyaratan GPU di mana pun dalam repositori, dan tulisan-tulisan penerapan komunitas menempatkan ambang praktis pada node multi-GPU, bukan workstation. Tiga stack penyajian merilis dukungan day-0 pada 2026-09-10 — vLLM, SGLang dengan Miles, dan adaptasi NeuWare berbasis vLLM dari Cambricon untuk akseleratornya sendiri — tetapi pada hari rilis vLLM dan SGLang merilis image pratinjau khusus alih-alih paket resmi, dan llama.cpp belum menggabungkan dukungan arsitektur V4.1. Hosting mandiri dengan perangkat keras konsumen bukanlah alternatif terhadap harga API saat ini; node 8-GPU sewaanlah alternatifnya. Jika volume Anda cukup besar untuk mengamortisasi hal itu, lisensinya mengizinkan Anda; jika tidak, $0,15 per juta token adalah jawaban yang lebih murah dan selisihnya tidak tipis.
Apa yang sebenarnya diminta kartu tarif untuk Anda putuskan
Tiga hal, dalam urutan seberapa besar uang yang mereka gerakkan. Pertahankan prefiks prompt yang stabil dan biarkan cache bekerja — ini otomatis, ini diskon 50x, dan pada loop agen 60 giliran ini mengubah sesi $0.93 menjadi $0.084. Jalankan lalu lintas batch Anda di luar 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja, yang bagi tim AS tidak berpengaruh dan bagi tim Eropa berarti memindahkan pekerjaan pagi ke sore. Dan jika Anda mematok harga ini terhadap flagship DeepSeek sendiri, ingatlah flagship masih dalam masa diskon — penonaktifan terjadwal dibatalkan pada 2026-09-11, kedua SKU berada di belakang satu kunci, dan peralihan di antara keduanya adalah perubahan model-id alih-alih migrasi.
Apa yang tidak diberitahukan oleh kartu tarif kepada Anda adalah apakah model tersebut cukup baik untuk beban kerja Anda, dan angka-angka untuk itu lebih baru serta lebih minim daripada lembar harga. Posisi indeks Artificial Analysis adalah pengukuran tunggal pada upaya penalaran maksimum, baris tolok ukur vendor dilaporkan oleh vendor, dan jumlah parameter masih diperdebatkan. Harga adalah bagian yang sudah mapan dari rilis ini. Tetapkan harga migrasi Anda berdasarkan itu, dan uji kemampuannya sebelum Anda berkomitmen padanya.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
