Kartu judul utama bertuliskan 'DeepSeek V4.1 Flash' dengan subjudul 'Model dasar baru yang memakai nomor versi .1', dua lencana pil bertuliskan 'GA - 10 SEP 2026' dan 'OPEN WEIGHTS - MIT', baris footer bertuliskan 'Arsitektur yang dilaporkan vendor; belum ada evaluasi independen', motif bilah kompresi di sebelah kiri, dan logo OrcaRouter yang dikompositkan di sudut kanan bawah.
Guides & Insights

DeepSeek V4.1 Flash: Model Dasar yang Benar-Benar Baru Memakai Nomor Rilis Titik

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

DeepSeek V4.1 Flash dirilis pada 10 September 2026: bobot terbuka dengan lisensi MIT, konteks satu juta token, arsitektur Causal Encoder-Decoder yang benar-benar baru, dan backbone mixture-of-experts dengan 552 miliar parameter yang oleh kartu model DeepSeek sendiri dikategorikan sebagai bagian dari "keluarga arsitektur baru" milik perusahaan. Jika pelacak yang menyorot penamaan tersebut benar, ini juga pertama kalinya DeepSeek menempelkan nomor versi .1 pada model dasar yang sepenuhnya baru — label yang biasanya menandakan penyetelan, bukan pembangunan ulang. DeepSeek V4.1 Pro, model unggulan yang kini tersirat dari nomor tersebut, masih belum ada.

Ketidakcocokan itu nilainya lebih dari sekadar perbedaan penamaan. Siapa pun yang membandingkan generasi DeepSeek berdasarkan nomor versi akan membaca "V4 Flash ke V4.1 Flash" sebagai langkah tambalan dan menyesuaikan perhatian mereka dengan itu. Arsitektur yang mendasarinya mengatakan hal yang sebaliknya, dan keputusan perusahaan sendiri untuk memensiunkan model unggulan berparameter 1,6 triliun demi model Flash mengatakan hal yang sebaliknya dengan lebih lantang lagi.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Released 10 Sep 2026 (web, app, API), Backbone 552B-parameter MoE, Architecture Causal Encoder-Decoder, Active per token 8B prefill / 16B decode, KV cache 890 bytes per token (FP4), and Price $0.15 in / $0.60 out per 1M, with a footer reading 'Figures per DeepSeek's model card and API docs; no independent evaluation has been published.'

Apa yang sebenarnya dirilis pada 10 September

Ini bukan bocoran dan bukan beta. Tes API dua hari yang dimulai pada 8 September dengan model ID deepseek-v4.1-flash-expires-on-0910 berakhir sesuai dengan yang dikatakan sufiksnya, dan perilisan resmi diluncurkan hari ini di aplikasi web DeepSeek, aplikasi seluler, dan API pihak pertama, dengan bobot dan laporan teknis yang diterbitkan di Hugging Face di bawah deepseek-ai/DeepSeek-V4.1-Flash.

Detail praktis lebih penting daripada seremoni:

• Nama model — panggil deepseek-flash. Nama lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp masih diterima, tetapi keduanya tidak lagi mengarah ke model yang dulu: keduanya sudah pensiun, dan permintaan yang menyebutnya dilayani oleh DeepSeek V4.1 Flash dan ditagih dengan tarif Flash.

• Yang ada di dalam kotak — parameter backbone 552B, jendela konteks 1M-token, output maksimum 384K, output JSON, pemanggilan fungsi, dan mode berpikir yang aktif secara default dengan pengaturan effort rendah, tinggi, dan maks.

• Lisensi — MIT, dengan bobot yang disertakan, folder inferensi, dan modul encoding terpisah di repositori. DeepSeek secara eksplisit mengundang komunitas open-source untuk membangun dukungan inferensi, yang merupakan sinyal standar bahwa pelayanan day-zero di runtime-runtime utama hanyalah masalah hari, bukan minggu.

.1 yang bukan rilis titik

Klaim yang memulai tulisan ini berasal dari teortaxesTex, seorang pengamat DeepSeek anonim namun banyak diikuti, dalam unggahan 10 September: bahwa ini adalah "pertama kalinya DeepSeek melabeli model dasar yang sepenuhnya baru dengan versi rilis .1," bahwa V4.1 "jauh lebih berbeda dari V4 daripada, misalnya, LLaMA 3 dari LLaMA 1," dan bahwa DeepSeek "tidak merasa ini layak disebut V5" — tanpa pengunggah mampu menjelaskan alasannya.

Perlakukan bagian kausal sebagai inferensi dan bagian struktural sebagai hal yang dapat diperiksa. Inferensi — mengapa DeepSeek memilih .1 daripada V5 — hanyalah pandangan seorang pengamat dan tidak lebih; tidak ada seorang pun di luar perusahaan yang menjelaskan keputusan tersebut, dan materi DeepSeek sendiri tidak pernah membahasnya. Bagian yang dapat diperiksa adalah arsitekturnya, dan itu tidak terlihat seperti rilis versi minor. Catatan perubahan DeepSeek menggambarkan V4.1 Flash sebagai "model terkecil dalam keluarga arsitektur baru kami," yang merupakan kalimat aneh untuk ditulis tentang pembaruan versi: pembaruan versi memperluas keluarga, bukan mendirikannya.

Ada biaya nyata atas ambiguitas ini, dan biaya itu ditanggung oleh pembeli, bukan oleh DeepSeek. Nomor versi adalah sinyal termurah yang dimiliki pengembang untuk "apakah ini generasi baru atau penyesuaian ulang, dan seberapa besar anggaran evaluasi saya yang layak untuknya?" DeepSeek kini membuat sinyal tersebut tidak dapat diandalkan dalam satu arah — model yang mendirikan keluarga arsitektur berada satu desimal dari model yang mengubah resep pasca-pelatihannya. Perusahaan itu bisa menyimpan penanda V5-nya sebagai cadangan. Setiap orang yang melakukan penilaian migrasi membayar atas kebingungan ini.

Apa yang dimaksud "arsitektur baru" dalam bobot

Kartu modelnya luar biasa spesifik, yang membuat klaim generasional mudah diuji tanpa satu pun tolok ukur. Empat hal yang menonjol.

A screenshot of the DeepSeek-V4.1-Flash model card on Hugging Face (captured September 10, 2026) showing the MIT licence tag, Image-Text-to-Text and safetensors tags, 485B parameters in the sidebar, and model-card text describing a multimodal Mixture-of-Experts with 552B backbone parameters, a Causal Encoder-Decoder architecture of a 20-layer causal encoder followed by a 20-layer decoder, activation of 8B parameters per token during prefill and 16B during decode, SWA Bounded Replay, Compressed Sparse Attention 2, and a KV cache footprint of 890 bytes per token.

• Aktivasi asimetris — pembagian Causal Encoder-Decoder adalah transformer 40 lapis yang disusun sebagai encoder kausal 20 lapis diikuti oleh decoder 20 lapis, di mana cache KV global decoder diproyeksikan dari hidden states akhir encoder, bukan diturunkan dari lapisan decoder itu sendiri. Inti dari desain ini adalah model hanya mengaktifkan 8B parameter per token selama prefill dan 16B selama decode. Beban kerja agen yang berat pada input — dokumen panjang, jejak alat yang panjang — mendapatkan separuh model yang murah; generasi mendapatkan separuh yang mahal.

• Kompresi cache KV, diukur per token — DeepSeek-V4.1-Flash menjalankan cache KV utama FP4 pada 890 byte per token, yang menurut kartu tersebut kira-kira seperempat dari DeepSeek V4 Flash. Liputan Tiongkok melangkah lebih jauh dengan membingkai kompresi tersebut terhadap model V4 generasi pertama sebagai pengurangan 437×; angka yang lebih besar itu adalah aritmetika bersumber vendor dengan baseline yang berbeda, jadi perlakukan itu sebagai klaim, bukan sebagai hasil pengukuran.

• SWA Bounded Replay — perhatian jendela geser (sliding-window attention) biasanya memaksa Anda untuk menyimpan status KV ke SSD untuk merekonstruksi konteks. Ini membangun ulang status KV SWA yang hilang dengan memutar ulang hanya jendela token terbaru, sehingga memangkas jejak KV persisten menjadi sekitar seperdelapan dari milik DeepSeek V4 Flash.

• Compressed Sparse Attention 2 — setiap lapisan perhatian berjalan dalam salah satu dari tiga mode statis (Full, Reindex, atau Reuse), berbagi status KV dan pengindeks antar lapisan, dengan pengindeks hierarkis jarang yang membatasi biaya lapisan yang lebih dalam secara independen dari panjang konteks.

Baca keempatnya bersama-sama dan gambaran strategisnya menjadi terbaca: ini adalah arsitektur yang mengutamakan sparsity dan efisiensi cache, dengan ukuran yang memungkinkan struktur yang sama untuk ditingkatkan skala-nya di kemudian hari. Penyebutan "keluarga arsitektur baru" melakukan pekerjaan nyata — itu adalah pernyataan bahwa akan ada lebih banyak yang akan datang.

The benchmarks: dilaporkan vendor, dan belum terbantahkan

DeepSeek menerbitkan satu set benchmark dengan rilis tersebut. Berdasarkan angka internal perusahaan, V4.1 Flash mencetak GPQA Diamond 90.9, peringkat Codeforces 3471, MathArena Apex 65.6, Terminal-Bench 2.1 sebesar 90.6, DeepSWE v1.1 sebesar 74.2, dan 63.9 pada HLE dengan tools — yang terakhir menyertakan catatan kaki yang membatasi angka baseline 36.8 pada subset teks murni dari benchmark tersebut.

Sebut apa adanya. Angka-angka itu dilaporkan oleh vendor, diterbitkan tanpa disertai evaluasi independen, dan itulah angka-angka yang digunakan DeepSeek untuk membenarkan penghentian produk unggulannya sendiri — yang menjadikannya angka-angka yang paling layak untuk diperiksa. Hingga peluncuran 10 September, Artificial Analysis belum menerbitkan pengukuran untuk DeepSeek V4.1 Flash, dan halaman model Hugging Face sendiri masih memuat catatan bahwa model tersebut "tidak digunakan oleh Penyedia Inferensi mana pun." Klaim utama dari rilis ini — bahwa model kelas Flash secara menyeluruh mengalahkan produk unggulan berparameter 1,6T dalam hal performa, biaya, kecepatan, dan total waktu pemrosesan — saat ini hanyalah klaim vendor tanpa audit eksternal.

Ada peringatan jujur di sisi lain juga. Pelaporan vendor yang sama menunjukkan V4.1 Flash memenangkan 13 dari 16 perbandingan melawan Kimi K3 dan 11 dari 13 melawan GLM-5.3, sementara masih tertinggal dari GPT-5.6 Sol dan Claude Opus 5 pada tugas-tugas Terminal-Bench 3.0 dan 4.0 yang lebih baru serta pada ProgramBench. Itu adalah bentuk yang koheren — terkuat pada pekerjaan pengkodean, terminal, dan otomatisasi agen yang menjadi basis optimasi arsitektur ini, lebih lemah pada tugas-tugas penalaran mutakhir — dan itulah bentuk yang akan dimiliki oleh langkah generasi yang nyata.

Harga, dan routing switch yang layak dijadwalkan.

Harga baru mulai berlaku sejak peluncuran, dan ini adalah kartu tarif Flash yang sama seperti sebelumnya, bukan pemotongan: pada deepseek-flash, input cache-hit adalah $0,003 per juta token di luar jam sibuk dan $0,006 pada jam sibuk, input cache-miss $0,15 dan $0,30, dan output $0,60 dan $1,20. Jam sibuk tepat dua kali lipat dari luar jam sibuk dan berlaku pukul 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja.

Pemotongan itu jatuh pada lalu lintas Pro sebagai gantinya. DeepSeek V4 Pro dibanderol dengan harga $0,022 dan $0,044 untuk input cache-hit, $0,66 dan $1,32 untuk input cache-miss, serta $1,98 dan $3,96 untuk output — sehingga merutekan permintaan berlabel Pro ke V4.1 Flash menurunkan biaya output mereka sekitar 70% sementara, menurut DeepSeek, meningkatkan kemampuan yang menjawabnya.

A screenshot of DeepSeek's official API Models & Pricing page (captured September 10, 2026) showing columns for deepseek-flash and deepseek-v4-pro, with model versions DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, both at 1M context length and 384K maximum output. Vision is marked supported for deepseek-flash and 'not supported' for deepseek-v4-pro. Pricing shows 1M cache-hit input tokens at $0.003 off-peak and $0.006 at peak for deepseek-flash versus $0.022 and $0.044 for deepseek-v4-pro, and 1M cache-miss input tokens at $0.15 off-peak and $0.3 at peak for deepseek-flash versus $0.66 and $1.32 for deepseek-v4-pro.

Pengalihan itu sudah dijadwalkan, bukan sekadar hipotesis. Setelah pukul 12:00 waktu Beijing pada 14 September 2026, permintaan yang menyebutkan deepseek-v4-pro akan dialihkan ke V4.1 Flash dan ditagih dengan harga Flash, dan tetap di sana hingga DeepSeek V4.1 Pro rilis. Jika integrasi Anda menuliskan nama model Pro secara hard-code, tidak ada yang rusak — Anda mendapatkan model yang berbeda dengan harga output sekitar sepertiganya, tanpa perubahan kode dan tanpa pemberitahuan selain entri changelog. Jika Anda merutekan berdasarkan tier kapabilitas daripada nama model, tanggal 14 September adalah tanggal untuk menguji ulang.

Apa artinya jika Anda menghubungi DeepSeek hari ini

OrcaRouter belum mendukung DeepSeek V4.1 Flash — per hari ini, halaman model untuk deepseek-v4.1-flash mengembalikan "model tidak ditemukan," dan kami lebih suka menyatakannya dengan jelas daripada memberi kesan sebaliknya. Ada dua hal yang menyusul. Pertama, pengalihan yang diumumkan DeepSeek adalah perilaku API pihak pertama, jadi peralihan 14 September terjadi di endpoint DeepSeek sendiri apa pun cara Anda mengaksesnya. Kedua, jika Anda menginginkan arsitektur baru saat ini, Anda harus menghubungi vendor secara langsung.

Yang kami lakukan adalah merutekan sisa lini DeepSeek pada satu kunci: DeepSeek V4 Flash dan DeepSeek V4 Pro, bersama 200+ model lainnya. Harga di sana adalah harga daftar penyedia DeepSeek yang diteruskan dengan markup 0%, yang merupakan bagian yang penting untuk rilis seperti ini — ketika vendor memotong tarif, pemotongan tersebut langsung berlaku di sisi kami pada hari yang sama, bukan setelah siklus penetapan ulang harga. Dan ketika V4.1 Flash benar-benar masuk dalam katalog, tarif setengah di luar jam sibuk di atas adalah tarifnya, bukan diskon yang kami negosiasikan.

Argumen perutean untuk model sebaru ini sebenarnya bukan soal harga. Ini soal seberapa besar jalur produksi Anda yang dipertaruhkan pada arsitektur minggu pertama tanpa tolok ukur independen dan tanpa serving pihak ketiga. Menempatkan model baru di balik tier yang dapat Anda alihkan — atau mengujinya pada kunci yang bukan kunci produksi Anda — adalah perbedaan antara evaluasi dan insiden.

Apa yang akan menyelesaikan pertanyaan penamaan

Tiga hal, dalam urutan menaik berdasarkan seberapa banyak yang akan mereka sampaikan kepada Anda.

Evaluasi independen terhadap DeepSeek V4.1 Flash akan menguji klaim arsitektur tersebut pada kerangka uji milik pihak lain. Itulah satu-satunya pengukuran yang mengubah tabel vendor menjadi fakta, dan kemungkinan besar itulah berita berikutnya.

DeepSeek V4.1 Pro akan menguji klaim keluarga tersebut. Pemberitahuan routing menyebutnya sebagai titik akhir dari jendela Pro-to-Flash, yang menjadikannya model pusat dari seluruh struktur rilis ini — dan model ini tetap menjadi yang paling sedikit dikonfirmasi oleh DeepSeek: tanpa kartu, tanpa jumlah parameter, tanpa tanggal, tanpa bobot, tanpa harga.

Dan yang berguna meskipun tidak menarik: apakah DeepSeek melakukan ini lagi. Label .1 kedua pada model dasar baru lainnya akan mengubah anomali menjadi konvensi, dan konvensi adalah sesuatu yang dapat direncanakan oleh pengembang. Satu model hanyalah sebuah keanehan. Penamaan tersebut baru menjadi menyesatkan dengan cara yang berguna setelah ada sebuah pola.

Untuk saat ini, pembacaan praktisnya terpisah dengan jelas berdasarkan siapa Anda. Jika Anda menggunakan DeepSeek V4 Pro, tandai tanggal 14 September di kalender dan jalankan ulang evaluasi Anda sebelum tanggal itu, karena model di balik nama itu akan berubah, baik Anda memintanya maupun tidak. Jika Anda menggunakan DeepSeek V4 Flash, Anda sedang dipindahkan, dengan harga yang sama, ke arsitektur yang dibuat DeepSeek untuk berskala. Dan jika Anda menunggu V5, jawaban yang jujur adalah bahwa DeepSeek tampaknya telah merilis generasi tersebut dan menolak menamainya — yang merupakan hal yang hanya bisa Anda lakukan sekali sebelum orang berhenti mempercayai angka itu.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari