
Benchmark DeepSeek V4.1 Flash: Apa yang Dibuktikan dan Tidak Dibuktikan oleh 74.2
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 984 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
DeepSeek V4.1 Flash mencetak skor 74,2 pada DeepSWE v1.1, sepersepuluh poin di atas GPT-6 Astra, setengah poin di atas Gemini 3.8 Flash dan Claude Opus 5, dan angka itu telah dikutip sepanjang minggu sebagai tanda pergantian kekuasaan. Perlu ketelitian tentang apa sebenarnya ini. Modelnya sendiri bukan hal baru — DeepSeek V4.1 Flash mulai tersedia secara umum pada 10 September 2026, enam hari lalu — jadi tidak ada peluncuran di sini. Yang masuk dalam rentang waktu itu adalah lapisan pengukuran: entri indeks independen pertama, hasil arena independen pertama, dukungan penyajian day-0 di tiga stack, dan keputusan vendor untuk memensiunkan produk andalannya sendiri demi model ini. Halaman ini adalah rangkuman dari apa yang sebenarnya telah diukur, dengan sumber disebutkan untuk setiap angka, dan pernyataan terus terang tentang apa yang belum dapat dipastikan oleh siapa pun.
Angka DeepSWE, dan empat model yang berada dalam jarak setengah poin darinya
DeepSWE v1.1 adalah tolok ukur rekayasa perangkat lunak berhorizon panjang dari Datacurve — 113 tugas orisinal di 91 repositori sumber terbuka dan lima bahasa pemrograman, dibangun di sekitar perubahan multi-berkas dan kebenaran perilaku. Pada kartu model DeepSeek sendiri, tabel yang dilaporkan vendor berbunyi: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4.
Papan peringkat independen untuk tolok ukur yang sama tidak mereproduksi urutan tersebut, dan perbedaannya lebih penting daripada angka utamanya. Papan peringkat DeepSWE v1.1 Pass@1 milik Datacurve menempatkan Muse Spark 1.3 (FAIR) di peringkat pertama dengan 75.40, di atas DeepSeek V4.1 Flash pada 74.20. Di belakangnya: GPT-6 Astra pada 74.12 (ekstra tinggi) dan 74.10 (maks), Gemini 3.8 Flash pada 73.83 (tinggi), Claude Opus 5 pada 73.65 (maks).
Jadi 74,2 adalah entri nyata di papan peringkat pihak ketiga yang nyata, dan posisinya kedua, bukan pertama. Klaim yang beredar pada hari peluncuran — bahwa ini adalah yang tercanggih di DeepSWE — tidak bertahan saat dihadapkan pada papan peringkat yang memuat skor tersebut. Muse Spark 1.3 unggul 1,2 poin.
Sekarang bagian yang dilewati. Empat model terdepan berada dalam jarak 0,55 poin satu sama lain pada benchmark ini: 74,20, 74,12, 73,83, 73,65. Itu adalah rentang yang lebih sempit daripada derau pengukuran. Variasi antar-run yang dipublikasikan pada DeepSWE berada pada kisaran 1,4 hingga 3,2 poin — tiga hingga enam kali ukuran seluruh sebaran empat teratas. Keunggulan 0,2 poin atas GPT-6 Astra bukanlah suatu temuan; itulah yang tampak seperti seri ketika Anda mencetaknya hingga dua angka desimal.
Sensitivitas scaffold adalah alasan kedua untuk tidak berpegang teguh pada angka itu, dan di sini dokumentasi vendor sendiri menyediakan buktinya. DeepSeek melaporkan DeepSWE di delapan scaffold dalam materi rilis yang sama. Angka 74,2 dicapai pada mini-SWE. Model yang sama memperoleh 72,6 pada DSH Minimal, 70,5 pada DSH Standard, 69,8 pada Claude Code, 67,6 pada DSH PTC, 66,2 pada Pi, 65,6 pada Codex, dan 65,5 pada OpenCode. Itu adalah rentang 8,7 poin pada satu model dan satu benchmark, yang murni disebabkan oleh harness yang membungkusnya. Siapa pun yang membandingkan angka DeepSeek yang dihasilkan pada mini-SWE dengan angka pesaing yang dihasilkan pada loop agen yang berbeda sedang membandingkan scaffold, bukan model.
Di mana indeks independen sebenarnya menempatkannya
Artificial Analysis menjalankan rangkaian pengujian tetap pada pengaturan effort yang dinyatakan, yang menjadikan Intelligence Index-nya sebagai pemeriksaan eksternal paling bersih yang tersedia. Pada halaman model untuk DeepSeek V4.1 Flash, pada effort maksimum reasoning, indeksnya menunjukkan 40 — berperingkat #6 dari 113 model di kelas itu, dibandingkan dengan median kelas sebesar 18. Para rival tertutup berada di atasnya: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. Flagship DeepSeek sendiri sebelumnya, V4-Pro-0813, berada di bawah pada 36.
Baca kedua papan skor secara berdampingan dan ketidaksepakatan itu bersifat struktural, bukan kesalahan. Pada tolok ukur pilihan DeepSeek, dengan perancah yang tepat, model itu menyamai yang terdepan. Pada rangkaian eksternal tetap yang dirata-ratakan di seluruh penalaran, pengodean, matematika, dan kerja agentik, ia tertinggal sebelas poin dari Claude Opus 5 dan satu poin dari Gemini 3.8 Flash. Keduanya bisa benar. Tabel vendor adalah argumen; indeks adalah rata-rata.
Halaman indeks juga memuat dua angka yang penting untuk keputusan perutean dan jarang menjadi berita utama. DeepSeek V4.1 Flash berjalan pada 214,4 token keluaran per detik pada upaya maksimal — cepat. Model ini juga menghasilkan 250 juta token keluaran saat menyelesaikan Intelligence Index, dibandingkan dengan median 140 juta, yang ditandai Artificial Analysis sebagai sangat bertele-tele. Verbositas bukan masalah kualitas; itu adalah tagihan. Model yang berpikir dengan 79% lebih banyak token daripada model sejenisnya mengembalikan sebagian keunggulan harganya pada setiap panggilan penalaran yang panjang.

ProgramBench: skor model tunggal dan skor multi-agen bukanlah pengukuran yang sama
Inilah angka yang paling mungkin salah dibaca, sehingga perlu dipisahkan dengan hati-hati.
• Model tunggal, konfigurasi standar — DeepSeek V4.1 Flash memperoleh skor 20,3 pada ProgramBench (Almost@1), menurut kartu model DeepSeek sendiri. Itu di bawah GPT-5.6 Sol pada 23,0 dan jauh di bawah Claude Opus 5 pada 37,0, serta hanya sedikit di atas GLM-5.3 pada 19,0 dan Kimi K3 pada 17,5. Dilaporkan vendor, dan itu tidak menyanjung model tersebut.
• Konfigurasi tim multi-agen — laporan teknis DeepSeek, DeepSeek-V4.1-Flash: Mendorong Batas Kompresi KV Cache, menjabarkan resep awal Agent Swarm RL yang di dalamnya agen pemimpin mengoordinasikan rekan-rekan tim melalui papan tugas bersama. Pada subset ProgramBench 172 tugas dengan keyakinan tinggi — tugas yang solusi referensinya lulus pada 95% atau lebih — konfigurasi multi-agen naik dari 13,59% pada tenggat satu jam ke puncak 30,04% pada delapan jam, sementara baseline satu agen bergerak dari 12,79% ke 20,39%.
Angka 30,04% adalah sumber klaim "30%", dan itu bukan skor model tunggal. Itu adalah tim agen yang diberi waktu delapan jam, diukur pada subset tersaring, dalam evaluasi awal milik vendor sendiri. Perbandingan yang ditimbulkannya — "jauh di atas Sol tunggal, hampir 2x Kimi K3" — secara aritmetika adil terhadap Sol 23,0 dan K3 17,5, dan itu juga merupakan perbandingan antara konfigurasi multi-agen dan baseline model tunggal pada kumpulan tugas yang berbeda. Laporan yang sama menunjukkan efeknya pada FrontierSWE v2: multi-agen mencapai 32,90% pada dua puluh jam versus 28,20% agen tunggal. Kesenjangannya nyata, menyempit seiring perpanjangan tenggat, dan biaya token untuk mendapatkannya tidak kecil — satu tulisan langsung melaporkan lebih dari 10x token dan runtime yang mendekati empat jam.
Jumlah parameter belum final, jadi anggap setiap perbandingan ukuran sebagai sementara.
Catatan rilis DeepSeek menjelaskan “MoE dengan 552B parameter”. Itu adalah angka dari vendor, dan itulah yang diulang oleh sebagian besar liputan. Itu juga bukan keseluruhan artefak.
Kartu model DeepSeek sendiri mendokumentasikan komponen kedua di samping tulang punggung transformer: "memori kondisional Engram (196B parameter, diakses secara sparse melalui pencarian berbasis token)." Jumlahkan keduanya dan Anda mendapatkan 748B. Itulah aritmetika di balik tafsiran komunitas yang beredar di r/LocalLLaMA dalam hitungan jam setelah rilis, dan indeks safetensors milik kartu model itu sendiri mencantumkan 763B parameter di seluruh jenis tensor-nya. Angka FP8 sekitar 510 GB berasal dari garis analisis yang sama: apa yang sebenarnya Anda unduh dan simpan di memori.
Rekonsiliasinya adalah bahwa angka-angka ini menghitung hal yang berbeda. 552B adalah tulang punggung komputasional — parameter yang dilalui sebuah token. 196B adalah tabel pencarian yang diakses pada lapisan tertentu yang mengembalikan informasi yang tersimpan alih-alih menghitungnya. 8B dan 16B, angka aktivasi yang dikutip DeepSeek, masing-masing adalah irisan per token yang aktif selama prefill dan decode. Keempat angka tersebut menggambarkan model yang sama.
Tak satu pun dari itu membuat perbandingan ini aman. Setiap klaim dalam bentuk "model ini menyamai model frontier dengan ukuran hanya sebagian kecilnya" bertumpu pada tajuk utama vendor yang mengecualikan seperlima dari artefak. Sampai seseorang menerbitkan penghitungan parameter yang dapat direproduksi, argumen berbasis ukuran harus menyertakan kaveat tersebut secara inline.
ARC-AGI: tidak ada hasil untuk model ini
Tidak ada skor ARC-AGI-2 atau ARC-AGI-1 untuk DeepSeek V4.1 Flash. Halaman hasil terverifikasi ARC Prize tidak memuat entri untuk checkpoint ini, dan tabel benchmark milik DeepSeek sendiri tidak memiliki baris ARC. Satu-satunya hasil DeepSeek yang diverifikasi ARC Prize adalah untuk checkpoint V4 Flash 0731 yang lebih lama — 61,4% pada ARC-AGI-2 semi-private dengan upaya penalaran maksimum dan 89,0% pada ARC-AGI-1, masing-masing $0,04 dan $0,02 per tugas. Itu adalah angka pendahulunya pada model yang berbeda, dan mengutipnya sebagai hasil V4.1 Flash akan keliru. Jika ARC-AGI penting bagi evaluasi Anda, model ini saat ini belum diberi skor.
Apa lagi yang mendarat di dalam jendela?
Tiga hal berubah bagi pembaca yang memutuskan apakah akan mencoba model ini, dan tak satu pun darinya adalah rilis model itu sendiri.
• Hasil arena independen. OpenDesign Arena menguji tiga belas model melalui tugas desain yang identik — aplikasi web, dasbor, layar seluler, halaman landing. DeepSeek V4.1 Flash mencetak 81,2 dari 100 berbanding 82,7 milik GPT-6 Astra, dengan biaya $0,023 per desain yang selesai berbanding $1,61, dan selesai dalam 5,3 menit berbanding 11,1. Tingkat pengiriman — keluaran yang dapat digunakan tanpa revisi — adalah 57,7% berbanding 60% milik Astra. Ini adalah salah satu pengukuran pertama yang benar-benar independen terhadap model tersebut, dan pengukuran ini secara khusus menilai keluaran desain, bukan penalaran umum atau pengodean.
• Dukungan serving Day-0 pada tiga stack. vLLM menerbitkan image day-0 (2026-09-09) yang divalidasi pada perangkat keras NVIDIA dan AMD. SGLang dan Miles menerbitkan dukungan inferensi dan RL day-0 pada 2026-09-10, termasuk jalur host-offload Engram yang meningkatkan kapasitas cache KV sebesar 36% pada 4x GB300 dan optimisasi bounded-replay yang meningkatkan throughput prefill sebesar 1,56x pada 8x H200. Cambricon mengumumkan adaptasi Day-0 pada stack vLLM pada hari yang sama. Bagi model yang nilai jualnya adalah kompresi cache KV yang agresif — seperempat jejak HBM generasi sebelumnya, seperdelapan SSD-nya — dapat dijalankan pada stack standar sejak hari pertama adalah perbedaan antara hasil laboratorium dan sesuatu yang dapat Anda deploy.
• Vendor itu menghentikan produk andalannya sendiri. DeepSeek menghentikan V4-Pro secara bertahap. Mulai 04:00 UTC pada 2026-09-14, setiap permintaan yang menyebut "deepseek-v4-pro" dialihkan ke V4.1 Flash dan ditagih dengan tarif Flash, dan hal ini berlanjut hingga V4.1 Pro diluncurkan. DeepSeek V4.1 Pro belum dirilis — model itu adalah model masa depan, dan pengalihan ini adalah solusi sementara yang mencegah integrasi yang di-pin menjadi rusak. Yang juga dihentikan: "deepseek-v4-flash" dan "deepseek-v4-flash-vision-exp", keduanya untuk sementara dialihkan ke V4.1 Flash demi kompatibilitas. Jika Anda memiliki ID model yang di-pin di produksi, pengalihan itulah satu fakta operasional di halaman ini yang tidak bisa Anda abaikan.
Apa dampak harga terhadap keputusan
Penetapan harga adalah titik di mana model ini berhenti menjadi sekadar cerita tolok ukur. Menurut tarif yang diterbitkan DeepSeek sendiri, berlaku efektif 04:00 UTC 2026-09-10, dengan jam sibuk didefinisikan sebagai 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja, dan semua waktu lainnya di luar jam sibuk.
• Luar jam sibuk, per juta token — $0,003 cache hit, $0,15 cache miss, $0,60 output.
• Puncak, per juta token — $0.006 cache hit, $0.30 cache miss, $1.20 output.
• Input yang di-cache, dibandingkan dengan model tertutup terdepan — tiga persepuluh sen per juta versus sekitar lima puluh sen. Bagi agen yang berulang kali mengakses repositori yang sama, tier itu menyumbang sebagian besar token.
• Diukur pada katalog kami sendiri — $0,15 untuk input dan $0,60 untuk output per juta, median 784 ms waktu ke token pertama, 211 token per detik selama tujuh hari terakhir.
Artificial Analysis mencantumkan model yang sama pada $0.30 untuk input dan $1.20 untuk output dengan diskon cache 98% serta harga gabungan $0.18 per juta — itu adalah tingkat puncak, dan kedua angka tersebut adalah harga yang sama pada jam berbeda dalam sehari. Perbedaan ini layak diinternalisasi sebelum Anda membandingkan vendor: model dengan skema dua tingkat berdasarkan waktu tidak dapat dibandingkan hanya berdasarkan satu tarif utama.
Itulah sebabnya penetapan harga pass-through lebih penting daripada biasanya di sini. OrcaRouter merutekan DeepSeek V4.1 Flash bersama seluruh katalognya dengan margin 0% — harga daftar dari penyedia, tanpa perubahan, sehingga tier peak dan off-peak DeepSeek tiba di sisi kami persis seperti yang dipublikasikan DeepSeek, dan perubahan harga vendor langsung berlaku pada hari yang sama. Pada model yang tarifnya berlipat dua selama empat jam setiap pagi di hari kerja, platform yang meratakan tier-tier tersebut justru menyembunyikan satu-satunya angka yang Anda butuhkan.


Apa yang belum ditetapkan oleh siapa pun
Kesenjangan dalam cerita ini bukanlah tolok ukur yang hilang. Melainkan bahwa tidak ada adu langsung yang kredibel antara DeepSeek V4.1 Flash dan rival-rival yang disebutkan namanya pada harness bersama, yang dijalankan oleh pihak yang tidak memiliki kepentingan terhadap hasilnya. Setiap angka di halaman ini adalah salah satu dari tiga hal: dilaporkan vendor, dihasilkan pihak ketiga pada konfigurasi berbeda, atau rata-rata dari rangkaian tetap yang tidak dirancang untuk mengisolasi pertandingan ini. Tidak ada uji coba di mana DeepSeek V4.1 Flash dan GPT-6 Astra dievaluasi pada tugas yang sama, scaffold yang sama, pengaturan effort yang sama, dan dipublikasikan dengan variansinya.
Tiga hal spesifik akan mengubah keadaan, dan tidak satu pun dari hal-hal itu ada saat ini.
• Perbandingan DeepSWE yang dikendalikan scaffold. Sebaran 8,7 poin di antara scaffold milik DeepSeek sendiri lebih besar daripada selisih mana pun antara empat model teratas di papan peringkat. Selama yang terdepan belum diukur pada satu harness, urutan di bagian atas tabel itu tidak bermakna.
• Reproduksi independen dari hasil tim agen ProgramBench. Angka 30,04% berasal dari laporan teknis vendor pada subset 172 tugas yang difilter, dalam konfigurasi awal, dengan biaya token yang belum dikarakterisasi untuk anggaran produksi.
• ARC-AGI. Tidak ada skor sama sekali untuk checkpoint ini.
Konsekuensi praktisnya adalah klaim yang lebih sempit daripada yang didukung oleh judul-judul berita. DeepSeek V4.1 Flash secara terukur berada dalam batas noise dari frontier pada satu benchmark pengkodean berhorizon panjang, benar-benar kompetitif pada tugas desain independen dengan biaya sekitar 1,4% dari biaya, dan tertinggal sekitar sepuluh poin pada indeks agregat. Itu cukup untuk membenarkan menjalankannya terhadap beban kerja Anda sendiri dan membiarkan evaluasi Anda menyelesaikan pertanyaan itu. Itu tidak cukup untuk membenarkan penulisan ulang tabel perutean produksi berdasarkan 0,2 poin — dan fakta bahwa kedua pernyataan itu benar adalah keseluruhan temuannya.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
