
DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Vendor Sama, Generasi Berbeda
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hal yang menarik tentang membandingkan DeepSeek V4.1 Flash dengan DeepSeek V4 Pro adalah bahwa model yang lebih baru bukanlah model yang lebih besar. DeepSeek V4 Pro adalah model mixture-of-experts berparameter 1,6 triliun dengan 49 miliar parameter aktif, dan model ini masih dilayani. DeepSeek V4.1 Flash adalah MoE berparameter 552 miliar dengan 8 miliar aktif pada input dan 16 miliar aktif pada output, dan ini adalah model yang dibangun DeepSeek untuk menggantikannya. Keduanya ada dalam daftar harga penyedia yang sama, keduanya menerima konteks satu juta token, dan keduanya dirilis di bawah MIT. Memilih di antara keduanya bukanlah pertanyaan tentang ukuran. Ini adalah pertanyaan tentang arsitektur mana yang ingin Anda bayar, dan jawabannya berubah pada 10 September 2026.
Apa yang sebenarnya berbeda, secara berdampingan
• Parameter — V4.1 Flash total 552B / 8B aktif pada input dan 16B pada output vs V4 Pro total 1,6T / 49B aktif. V4 Pro kira-kira tiga kali total parameter dan enam kali jumlah aktif di sisi input.
• Arsitektur — V4.1 Flash adalah Causal Encoder-Decoder, arsitektur dasar baru dibandingkan desain V4 Pro sebelumnya. Inilah perbedaan substantif antara keduanya dan alasan ".1" bukan rilis poin.
• Harga per 1 juta token — V4.1 Flash $0.15 masuk / $0.60 keluar di luar jam sibuk vs V4 Pro $0.66 masuk / $1.98 keluar, pada daftar OrcaRouter.
• Input cache — V4.1 Flash $0,003 per 1 juta vs V4 Pro $0,024 per 1 juta.
• KV cache per token — V4.1 Flash 890 byte vs jejak memori V4 Pro yang lebih besar. Pada konteks satu juta token, inilah pos biaya yang menentukan apakah transkrip agen yang panjang tetap tersimpan di memori.
• Konteks dan keluaran — konteks 1M dan keluaran maksimum 384K pada keduanya. Level.
• Latensi teramati ke token pertama — V4.1 Flash 2,63 s p50 vs V4 Pro 3,58 s p50, pada telemetri 7 hari OrcaRouter, dengan p95 sebesar 10,00 s untuk V4 Pro.
• Modalitas masukan — V4.1 Flash menerima teks dan gambar, sedangkan V4 Pro hanya menerima teks dan mengeluarkan teks, pada daftar yang sama. Model yang lebih baru memiliki cakupan masukan yang lebih luas di antara keduanya sekaligus lebih murah biayanya.
Baca daftar itu tanpa pembingkaian dari vendor, dan polanya tidak biasa. Penerusnya lebih murah di setiap lini, lebih cepat mencapai token pertama, lebih lebar pada masukan, dan lebih kecil di setiap lini. Seperti itulah wujud perubahan arsitektur yang sungguh-sungguh ketika hadir, dan itulah sebabnya "mana yang lebih baik" punya jawaban singkat di sini dan jawaban yang lebih panjang di baliknya.

Lini masa V4 Pro, karena ini penting bagi siapa pun yang masih menjalankannya.
DeepSeek V4 Pro dijadwalkan akan dihentikan. API-nya akan dimatikan pada 14 September 2026 pukul 12.00 waktu Beijing, dengan lalu lintas dialihkan ke V4.1 Flash. Itu tidak terjadi. Pada 11 September, vendor membatalkan keputusan tersebut, dengan menyatakan bahwa "Sebagai respons terhadap permintaan pengguna, kami memutuskan untuk terus menyediakan layanan API untuk DeepSeek V4 Pro setelah 14 September 2026, dengan metode penagihan tetap tidak berubah."
Dua hal mengikuti dari itu, dan keduanya perlu dinyatakan secara tepat karena situasinya mengundang penafsiran berlebihan.
Pertama, V4 Pro tidak deprecated. Ini adalah model yang didukung dengan harga yang tidak berubah, dan model inilah yang menjadi tujuan pengalihan lalu lintas V4 Pro yang ada menurut pemberitahuan DeepSeek sendiri. Jika Anda memiliki jalur produksi yang dipatok ke model ini, tidak ada yang diambil dari Anda.
Yang kedua adalah bahwa DeepSeek V4.1 Pro tidak ada. Pemberitahuan penghentian merujuk pada lalu lintas V4 Pro yang dilayani oleh V4.1 Flash "sampai V4.1-Pro diluncurkan," yang telah memicu sejumlah spekulasi tentang saudara yang lebih besar. Per 22 September 2026 tidak ada API V4.1 Pro, tidak ada kartu model, tidak ada bobot, dan tidak ada pengumuman. Sebuah laporan pada 21 September 2026 menyebutkan model 2 triliun parameter yang diperkirakan hadir pada pertengahan hingga akhir Oktober, yang merupakan klaim dari satu sumber tentang produk yang belum diumumkan dan harus diperlakukan demikian. Siapa pun yang merencanakan kapasitas berdasarkan peluncuran V4.1 Pro sedang merencanakan berdasarkan rumor.
Yang mana yang sebenarnya harus dipanggil?
Kasus migrasinya lugas, dan itulah yang dilakukan DeepSeek sendiri dengan mengarahkan lalu lintas V4 Pro ke model baru. Berdasarkan angka-angka di atas, V4.1 Flash lebih murah, lebih cepat mencapai token pertama, dan lebih cepat dalam kondisi tunak, dengan KV cache per token yang lebih kecil. Jika beban kerja Anda adalah beban kerja V4 Pro yang tidak melakukan hal yang hanya dapat dilakukan oleh 49B parameter aktif, model yang lebih baru adalah instrumen yang lebih baik dari segi biaya dan latensi dan tidak ada trade-off yang perlu ditimbang.
Argumen untuk tetap menggunakan V4 Pro berkaitan dengan manfaat yang diberikan oleh jumlah parameter aktif yang jauh lebih besar pada penalaran sulit dan pekerjaan agentik berhorison panjang, dan itu adalah argumen yang harus Anda buat dengan evaluasi Anda sendiri, bukan dengan lembar spesifikasi. Penyebabnya adalah kedua model tidak dibandingkan pada papan publik yang sama dengan cara yang mengisolasi keduanya: DeepSeek V4.1 Flash muncul pada sweep Agents on Rails dari 21 September 2026 dengan 17% pada maximum effort, sementara V4 Pro tidak ada di papan itu. Tidak ada angka adu langsung yang bisa ditunjuk. Yang ada adalah argumen yang masuk akal dari arsitektur — parameter aktif enam kali lipat adalah kapasitas yang sangat besar untuk dilepaskan — dan itu adalah argumen, bukan pengukuran.
Dua catatan praktis bagi siapa pun yang memindahkan lalu lintas di antara keduanya. Pertama, jadwal jam sibuk berlaku untuk kedua model, jadi perbandingan biaya yang dijalankan pada waktu yang salah akan meleset dengan faktor dua; jam sibuk adalah 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja, dan akhir pekan sepenuhnya di luar jam sibuk. Kedua, kedua model berbagi jendela konteks dan batas keluaran, sehingga migrasi tidak mengubah anggaran prompt Anda — yang membuat peralihan ini luar biasa rendah risiko di sisi aplikasi.
Menjalankan keduanya melalui satu endpoint
Situasi ketika Anda benar-benar menginginkan keduanya adalah masa transisi, dan itu lebih umum daripada yang terdengar: sebuah tim yang ingin beralih ke V4.1 Flash tetapi memiliki satu pipeline yang perilakunya pada arsitektur baru belum diverifikasi. Menjalankan keduanya secara berdampingan melalui vendor yang terpisah berarti dua kontrak dan dua set kunci untuk sesuatu yang, pada tingkat model, merupakan satu penyedia.
Keduanya ada di OrcaRouter di bawah satu kunci, yang menyederhanakannya menjadi keputusan perutean. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, jadi angka di atas adalah tarif DeepSeek sendiri, bukan tarif kami, dan jadwal puncak serta non-puncak DeepSeek berlaku persis seperti yang didefinisikan DeepSeek — termasuk perubahan harga di tengah transisi, yang aktif di sisi kami pada hari yang sama. Anda dapat mengirim sebagian kecil lalu lintas ke model baru dan membandingkan output, atau merutekan berdasarkan jenis tugas, dan menempatkan failover otomatis di balik jalur baru sehingga jika V4.1 Flash melakukan sesuatu yang tidak terduga pada data Anda, permintaan akan mendarat di V4 Pro alih-alih di halaman error.
Mengingat vendor sudah pernah berubah pikiran sekali tentang model mana di antara ini yang akan dihentikan, menjaga keduanya tetap dapat dijangkau di balik satu integrasi adalah pilihan yang tidak mengharuskan Anda memprediksi pembalikan berikutnya.

Apa yang harus ditonton
• Apakah harga atau status penghentian V4 Pro berubah lagi. Pembalikan pada September secara eksplisit menyatakan bahwa penagihan tetap tidak berubah, dan itulah komitmen yang harus dituntut dari vendor.
• Apakah V4.1 Pro menjadi nyata. Sampai ada kartu model atau rilis bobot, kisah 2T-parameter adalah rumor dengan satu sumber.
• Evaluasi independen yang menjalankan kedua model pada papan yang sama. Sampai hal itu ada, perbandingan yang jujur antara keduanya adalah biaya, latensi, dan arsitektur, yang dapat diukur, ditambah perkiraan beralasan tentang kemampuan, yang tidak dapat diukur.
Sampai yang ketiga dari hal-hal itu tiba, ringkasan yang akurat adalah: DeepSeek V4.1 Flash adalah penerus DeepSeek V4 Pro yang lebih murah dan lebih cepat, V4 Pro masih didukung dengan harga yang tidak berubah, dan pertanyaan apakah arsitektur yang lebih baru mengorbankan kemampuan adalah pertanyaan yang belum dijawab oleh tolok ukur publik mana pun saat ini.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
