Kartu judul hero bertuliskan DeepSeek V4.1 Flash di OpenCode, di atas overline Playbook agen coding - September 2026 dan subjudul tentang tiga integrasi yang diverifikasi hari ini serta tombol effort yang menentukan apakah selesai, dengan empat chip bertuliskan OpenCode Go $10/bulan, off-peak $0.15 / $0.60 per 1M, preset effort rendah 50, tinggi 75, maks 100, dan AA Intelligence Index 40, serta footer yang mencatat bahwa preset effort dilaporkan komunitas.
Guides & Insights

DeepSeek V4.1 Flash di OpenCode: Konfigurasi, Biaya, dan Dial Upaya yang Tidak Disebutkan Siapa Pun

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

DeepSeek V4.1 Flash telah berada di OpenCode Go sejak 10 September, dan pengali yang disematkan OpenCode padanya memiliki tanggal berakhir resmi: 20 September. Itu empat hari dari sekarang. Bagian yang menarik bukanlah tenggat waktunya — melainkan bahwa pengaturan yang menentukan apakah model ini menyenangkan untuk dipakai coding tidak ada di setiap panduan penyiapan di halaman pertama hasil pencarian, dan setidaknya di dua harness, pengaturan itu dihilangkan secara diam-diam. Ini adalah panduan untuk mengarahkan agen coding ke DeepSeek V4.1 Flash: id model yang tepat, tiga integrasi yang diverifikasi hari ini, kontrol reasoning-effort yang dilaporkan komunitas, dan mode kegagalan overthinking dengan mitigasi yang benar-benar berhasil.

Apa yang sebenarnya Anda arahkan pada agen Anda

DeepSeek V4.1 Flash dirilis pada 2026-09-10 — catatan rilis di dokumentasi API DeepSeek sendiri bertanggal hari itu, dan ini adalah model terkecil dalam keluarga arsitektur baru vendor tersebut. DeepSeek melaporkan tulang punggung mixture-of-experts berparameter 552B yang dibangun di atas apa yang disebutnya desain Causal Encoder–Decoder, yang mengaktifkan sekitar 8B parameter per token selama prefill dan 16B selama decode. Model ini menerima teks dan gambar sebagai masukan dan mengembalikan teks, melayani jendela konteks hingga satu juta token, dan akan menghasilkan hingga 384.000 token dalam satu respons — batas konteks dan keluaran keduanya berasal dari halaman model OrcaRouter sendiri untuk model ini, yang mencantumkan 1.048.576 dan 384.000.

Benchmark vendor, dari bagan di halaman rilis DeepSeek dan karenanya dilaporkan vendor serta tidak diaudit: 30,0 pada Terminal-Bench 3.0, 74,2 pada DeepSWE v1.1, 88,1 pada CyberGym, 54,8 pada Automation-Bench, dan 90,9 pada GPQA Diamond. Penilaian independen lebih tipis tetapi ada — Artificial Analysis, yang dibaca langsung hari ini, menempatkan DeepSeek V4.1 Flash pada 40 di Intelligence Index-nya, peringkat ke-6 dari 113 di kelas pembandingnya. Satu baris dari halaman yang sama lebih penting bagi pembaca agen coding daripada peringkatnya: Artificial Analysis melabeli model itu sangat verbose, setelah menghabiskan 250M token output untuk menyelesaikan uji Intelligence Index-nya dibandingkan median 140M. Kami akan kembali ke hal itu.

Dua fakta penamaan menghemat waktu debugging yang nyata. ID model API kanonis DeepSeek sekarang adalah code>deepseek-flash/code>. String lama code>deepseek-v4-flash/code> dan code>deepseek-v4-flash-vision-exp/code> masih diterima, tetapi model di baliknya telah dihentikan dan permintaan dilayani oleh V4.1 Flash dengan harga Flash. Secara terpisah, DeepSeek V4 Pro tidak hilang: dokumentasi DeepSeek menyatakan layanan API V4 Pro berlanjut setelah 2026-09-14 dengan penagihan yang tidak berubah. Jika Anda diberi tahu bahwa model unggulan telah dimatikan, itu bukan yang dikatakan dokumentasi vendor sendiri.

Single-column scoreboard titled DeepSeek V4.1 Flash in coding agents, with six rows reading Released 2026-09-10, Context window 1,048,576, Max output 384,000, Price per 1M $0.15 / $0.60 off-peak, Peak price per 1M $0.30 / $1.20, and AA Intelligence Index 40, #6 of 113, over a footer citing DeepSeek and OpenCode Go documentation for price and limits and Artificial Analysis for the index.

OpenCode: dua jalur masuk, dan ID yang benar-benar perlu diketik

Ada dua cara untuk menempatkan DeepSeek V4.1 Flash di balik OpenCode, dan keduanya memiliki ekonomi yang berbeda.

Rute langganan adalah OpenCode Go, paket $10/bulan yang digambarkan OpenCode sebagai kumpulan terkurasi model coding terbuka yang telah diuji dan di-benchmark. Penyiapan terdiri dari empat langkah dan tidak ada file konfigurasi yang perlu diedit manual: masuk ke OpenCode Zen, berlangganan Go, salin kunci API, lalu jalankan code>/connect/code> di TUI, pilih OpenCode Go, dan tempel kuncinya. Setelah itu code>/models/code> menampilkan apa yang tersedia. Referensi model dalam konfigurasi berbentuk code>opencode-go/<model-id>/code>.

ID model yang mana? Keduanya. Daftar model milik gateway Go sendiri, yang diambil hari ini dari code>https://opencode.ai/zen/go/v1/models/code>, mengembalikan code>deepseek-flash/code> dan code>deepseek-v4.1-flash/code> sebagai dua entri yang berbeda, bersama dengan code>deepseek-v4-flash/code> dan code>deepseek-v4-pro/code> versi lama. Salah satu dari dua yang pertama mengarah ke model yang Anda inginkan; code>deepseek-flash/code> adalah nama kanonis dan pilihan yang lebih aman untuk apa pun yang ingin Anda biarkan tetap berjalan.

Rute langsung melewati langganan sepenuhnya: jalankan code>/connect/code>, cari DeepSeek, dan tempelkan kunci platform DeepSeek. Anda kemudian ditagih oleh DeepSeek dengan harga daftar alih-alih menarik dari jatah Go. DeepSeek mempublikasikan harga daftar sebesar $0,15 per 1 juta token input dan $0,60 per 1 juta token output pada off-peak, dengan pembacaan cache sebesar $0,003 per 1 juta — dan tepat dua kali lipatnya selama jam sibuk. Baik dokumentasi OpenCode Go maupun halaman model OrcaRouter, yang dibaca hari ini, sepakat pada angka-angka tersebut.

Yang ditambahkan OpenCode Go adalah struktur kuota, dan di sini angka-angkanya layak dibaca dengan cermat karena itulah alasan tenggat waktu menjadi penting. Dokumentasi OpenCode sendiri mencantumkan DeepSeek V4.1 Flash dengan batas bulanan $15, yang saat ini dikalikan 4× menjadi $60 di bawah promosi yang ditandai OpenCode "Berakhir 20 Sep". Perkiraan jumlah permintaan dipublikasikan dalam dua kolom: 6.500 per 5 jam / 16.250 per minggu / 32.500 per bulan pada tarif standar, atau 26.000 / 65.000 / 130.000 dengan pengali 4× diterapkan. Bentuk kuotanya konsisten di semua model — batas 5 jam adalah 20% dari angka bulanan, batas mingguan adalah 50%, dan batas bulanan adalah keseluruhannya.

Itu adalah angka-angka yang dipublikasikan OpenCode, yang dibaca dari dokumentasi Go-nya hari ini. Promosi itu adalah hak mereka untuk mengakhiri, dan sudah ada tanggalnya.

Screenshot of the OpenCode Go documentation pricing table showing the DeepSeek V4.1 Flash off-peak row at $0.15 input, $0.60 output and $0.003 cached read per 1M tokens with a monthly limit of $15 raised to $60 under a 4x promotion ending Sep 20, the DeepSeek V4.1 Flash peak row at $0.30 input, $1.20 output and $0.006 cached read with the same $15 to $60 limit, and a footnote stating peak hours are 01:00-04:00 and 06:00-10:00 UTC Monday through Friday with all other hours including weekends off-peak.

Command Code: masih live, dan laporan bug yang perlu diketahui

Katalog Command Code sendiri masih mencantumkan model itu per hari ini, dengan id code>deepseek-v4-1-flash/code>, dengan jendela konteks 1 juta token dan struktur ekonomi pass-through yang sama: $0.15 / $0.60 di luar jam sibuk, $0.30 / $1.20 pada jam sibuk, $0.003 pembacaan cache. Harga yang sama di antara dua harness independen bukanlah kebetulan — keduanya meneruskan harga daftar DeepSeek alih-alih menetapkan harganya sendiri.

Mekanismenya sederhana. Pasang dengan code>npm i -g command-code/code>, jalankan dari direktori proyek Anda, autentikasi dengan code>/login/code>, dan gunakan code>/connect/code> jika Anda ingin membawa kunci penyedia Anda sendiri. code>/model <id>/code> menerapkan perubahan model secara langsung, sedangkan code>/model/code> tanpa argumen membuka pemilih, dan code>/effort/code> mengatur upaya penalaran untuk model saat ini — flag yang paling penting di sini.

Satu laporan bug komunitas patut dicatat di kepala Anda sebelum Anda men-debug lapisan yang salah. Sebuah issue terbuka terhadap lapisan routing pihak ketiga menjelaskan cache replay penalaran yang tidak pernah aktif untuk code>command-code/deepseek-v4.1-flash/code> id, karena pola yang dicocokkan oleh lapisan routing mengharapkan code>v4./code> atau code>v4-/code> segmen dan stringnya adalah code>v4.1/code>. Gejala yang dilaporkan adalah error 400 upstream yang mengeluh bahwa konten penalaran yang dihasilkan dalam mode thinking harus dikirim kembali ke API. Itu adalah laporan bug komunitas tentang matcher sisi klien, bukan panduan vendor dan bukan masalah dengan model — tetapi justru hal semacam itulah yang tampak seperti kesalahan model pada jam 2 pagi.

Claude Code, Codex, dan klien-klien yang telah divalidasi oleh OpenCode sendiri

OpenCode Go bukan hanya untuk OpenCode, dan dokumentasi mereka menyatakannya secara eksplisit: layanan ini dirancang untuk OpenCode dan agen coding lain yang menghasilkan pola permintaan serupa, dengan daftar klien yang telah divalidasi agar berfungsi yang dipublikasikan. Daftar tersebut saat ini mencantumkan Hermes, Claude Code, Codex, ZCode, dan Pi — dan untuk Claude Code catatannya adalah bahwa ia "mengenali header sesi nativenya. Tidak diperlukan pembungkus header kustom." Ada dua persyaratan yang menyertainya: identifikasi klien Anda dengan user agent-nya sendiri alih-alih nama SDK generik, dan kirim pengenal sesi yang stabil di code>x-opencode-session/code> header pada setiap percakapan, yang memungkinkan perutean dan cache prompt mereka bekerja. Untuk Hermes, build yang tervalidasi itu penting — perbaikan header digabungkan setelah v0.21.0, jadi rilis itu saja tidak membawanya.

Ada juga rute tanpa langganan sama sekali, menggunakan endpoint DeepSeek yang kompatibel dengan Anthropic secara langsung. Atur code>ANTHROPIC_BASE_URL/code> ke code>https://api.deepseek.com/anthropic/code>, code>ANTHROPIC_AUTH_TOKEN/code> ke kunci DeepSeek Anda, dan arahkan variabel model ke model tersebut. Nama model Claude dipetakan ulang saat masuk: apa pun yang dimulai dengan code>claude-opus/code> akan diarahkan ke DeepSeek V4 Pro dan ditagih dengan harga V4 Pro, sedangkan code>claude-sonnet/code> dan code>claude-haiku/code> nama akan diarahkan ke model Flash. Akhiran code>[1m]/code> pada string model meminta varian konteks satu juta token. Panduan DeepSeek sendiri untuk penyiapan ini juga mengatur code>CLAUDE_CODE_EFFORT_LEVEL=max/code> dan menetapkan jendela auto-compact ke 786432 token.

Variabel terakhir itulah tempat perbaikan dari komunitas berada. Proksi solusi sementara ada karena build Claude Code terbaru mengirim code>thinking: {"type": "disabled"}/code> pada permintaan subagen sementara code>CLAUDE_CODE_EFFORT_LEVEL=max/code> menambahkan parameter reasoning-effort, dan endpoint format Anthropic milik DeepSeek menolak pasangan tersebut dengan pesan tentang opsi thinking yang tidak dapat dinonaktifkan saat reasoning effort diatur. Solusi sementara yang dilaporkan bersifat sempit — hilangkan parameter effort hanya dari permintaan subagen, biarkan agen utama tidak tersentuh. Anggap ini sebagai temuan komunitas tentang ketidakcocokan kontrak klien/server, dan perkirakan batas versi persisnya akan bergeser.

Tombol upaya: 1–100, dan mengapa "rendah" berarti 50

Semua yang ada di bagian ini adalah temuan komunitas, bukan panduan vendor. DeepSeek tidak menerbitkan pemetaan preset ke angka yang dapat kami verifikasi, dan angka-angka di bawah ini berasal dari tulisan praktisi serta dokumentasi harness pihak ketiga. Angka-angka itu cukup konsisten di berbagai sumber sehingga berguna, tetapi cukup belum terkonfirmasi sehingga Anda sebaiknya mengujinya pada pekerjaan Anda sendiri.

DeepSeek V4.1 Flash dilatih dengan skalar upaya penalaran kontinu dari 1 hingga 100. Ini bukan batas token — ini menggeser posisi model pada kurva yang dipelajari oleh proses pelatihan, di mana upaya yang lebih rendah memberikan lebih banyak tekanan untuk bersikap ringkas dan upaya yang lebih tinggi membuat penalaran tambahan menjadi lebih murah. Tiga preset publik dipetakan ke skala tersebut:

• Rendah — 50, jalur terpendek, dan preset yang membuat kontrol ini terkenal karena murahnya.

• Tinggi — 75, dan tingkat yang sebagian besar sumber komunitas gambarkan sebagai batas atas yang wajar untuk pekerjaan agen.

• Max — 100, di mana penalti terhadap panjang penalaran dihilangkan sepenuhnya.

Apa yang diperoleh dari dial itu nyata, tetapi manfaatnya berkurang tajam. Satu penyapuan benchmark komunitas melaporkan bahwa menaikkan effort dari 25 ke 100 menggeser Terminal-Bench 2.1 dari 82.4 ke 90.6 sekaligus secara keseluruhan membuat token output menjadi sekitar 2.5× lipat. Laporan-laporan mengerucut pada effort di kisaran 60 hingga 80 yang meraih sebagian besar akurasi yang tersedia dengan kurang dari setengah anggaran token, sementara max menambahkan 1.6–1.8× lebih lanjut pada trajektori agen demi keuntungan marginal.

Default adalah bagian yang tidak disepakati siapa pun. Sebagian dokumentasi harness dan laporan praktisi menyebutkan bahwa effort yang tidak diatur akan menghasilkan high; sebagian lain menggambarkan default server sebagai sekadar tidak diketahui. Yang didokumentasikan, bukan diperdebatkan, adalah bahwa dua integrasi harness ditemukan gagal mengirim parameter itu sama sekali — profil penyedia OpenCode Go dan profil DeepSeek native sama-sama melewatkan pengiriman code>reasoning_effort/code> untuk code>deepseek-flash/code> slug, karena penjaga pencocokan mereka mengharapkan awalan code>deepseek-v…/code> yang tidak dimiliki id kanonis. Dalam kedua kasus, setelan yang dipilih pengguna secara diam-diam digantikan oleh default penyedia. Jika klien Anda menampilkan kontrol effort, itu bukan bukti bahwa nilainya benar-benar terkirim. Catat satu body permintaan dan periksa.

Satu keanehan lagi dari laporan yang sama: endpoint OpenCode Go menerima code>low/code>, code>medium/code>, code>high/code> dan code>max/code>, tetapi menolak effort berupa bilangan bulat — nilai 80 dilaporkan mengembalikan HTTP 400. Skala 1–100 ada di model, tetapi tidak diekspos sebagai angka mentah di semua tempat, sehingga "atur effort ke 65" mungkin tidak dapat dinyatakan di klien Anda.

Mode kegagalan berpikir berlebihan, dan apa yang sebenarnya memperbaikinya

Ini adalah mode kegagalan yang menentukan apakah Anda mempertahankan model itu dalam alur kerja Anda. Laporan komunitas menggambarkan DeepSeek V4.1 Flash terus bernalar setelah pekerjaan selesai: memperdebatkan ulang poin yang sudah dijawabnya dengan benar, menceritakan koreksi atas asumsinya sendiri yang salah, dan menghasilkan rantai penalaran panjang dengan kepadatan informasi rendah. Seorang praktisi melaporkan keluaran penalaran terus berlanjut lebih dari satu jam dalam sesi CLI coding. Yang lain melaporkan sama sekali tidak bisa membuatnya menyelesaikan proses benchmark yang panjang.

Catatan sumber untuk laporan kedua itu, karena ini jenis klaim yang bisa dicuci asal-usulnya. Klaim itu berasal dari utas komunitas tentang menjalankan model secara andal, dan Reddit memblokir pengambil data kami, jadi kami tidak bisa membaca utas itu secara langsung — kami meneruskan laporan tersebut, bukan mengutip halaman yang kami buka. Yang bisa kami verifikasi secara independen adalah bentuk masalahnya, dan di sana bukti dari luar luar biasa bersih: Artificial Analysis, di halamannya sendiri, menandai model itu sebagai sangat bertele-tele, menghabiskan 250M token keluaran untuk menyelesaikan satu eksekusi yang diselesaikan model pembanding mediannya dalam 140M. Itu sekitar 1,8×, diukur oleh pihak ketiga, pada set tugas tetap. Laporan forum dan metrik independen tersebut menggambarkan perilaku yang sama.

Mitigasi yang muncul dari laporan-laporan itu, semuanya bersumber dari komunitas:

• Patok effort pada high atau lebih rendah dan jangan biarkan nilainya terus naik. Perbaikan paling eksplisit yang terlihat di lapangan adalah plugin routing yang ditulis khusus untuk menghentikan eskalasi effort: kedalaman turn tidak berkontribusi apa pun terhadap skor eskalasi, hanya hasil tool yang gagal atau percobaan ulang yang identik yang dihitung, eskalasi dibatasi, dan max bersifat opt-in serta secara default diturunkan. Jika harness Anda membiarkan agen menaikkan effort-nya sendiri saat sebuah run menjadi lebih panjang, itulah mekanisme yang perlu dimatikan.

• Jangan jalankan max sebagai pengaturan default. Beberapa praktisi melaporkan max terus berputar alih-alih konvergen pada pekerjaan rutin, dan beralih kembali ke high menyelesaikannya.

• Batasi code>max_tokens/code> pada jalur interaktif. Plafon keluaran 384.000 token adalah batas, bukan target, dan loop yang tidak akan berhenti itu mahal pada plafon tersebut.

• Verifikasi bahwa parameternya benar-benar dikirim. Mengingat ada dua harness yang ditemukan diam-diam menghilangkannya, "Saya menyetelnya ke high" dan "high sampai ke API" adalah klaim yang berbeda.

• Harness lebih penting daripada yang Anda duga. Praktisi yang menjalankan bobot yang sama melaporkan perilaku yang sangat berbeda di berbagai shell — model yang sama yang berdebat dengan dirinya sendiri dan menenggelamkan sinyal dalam satu harness tidak memunculkan keluhan seperti itu dalam harness lain. Itu adalah observasi komunitas tentang perilaku harness, bukan klaim vendor tentang model, tetapi itu adalah nasihat yang paling sering diulang dalam laporan-laporan.

Berapa biaya sebenarnya dari loop coding pada tarif ini

Harga daftar DeepSeek adalah $0,15 per 1 juta token masukan dan $0,60 per 1 juta token keluaran di luar jam sibuk — keluaran empat kali masukan, yang merupakan hal pertama yang perlu diinternalisasi tentang agen yang menghasilkan penalaran sekaligus kode.

Ambil satu giliran agen yang realistis: 60.000 token konteks (prompt sistem, skema alat, potongan repo, riwayat percakapan) masuk, dan 3.000 token penalaran plus patch sebagai keluaran. Itu berarti 60.000 × $0,15/1 juta = $0,009 masuk, plus 3.000 × $0,60/1 juta = $0,0018 keluar, jadi sekitar 1,1 sen per giliran. Dua ratus giliran seperti itu dalam satu hari kerja kira-kira $2,16, atau sekitar $47 selama sebulan hari kerja pada tarif di luar jam sibuk. Itulah perhitungan yang membuat jatah bulanan $15 dengan promo 4× di atasnya tampak murah hati — dan perhitungan yang membuat verbositas menjadi hal yang perlu diperhatikan.

Karena di sinilah letak leverage yang tersembunyi dalam angka Artificial Analysis itu. Model yang memakai 1,8× token output median pada kumpulan tugas tetap berarti loop yang dibatasi output biayanya 1,8× dari yang disiratkan harga token semata. Dan tombol effort adalah kontrol untuk tepat hal itu. Laporan komunitas menempatkan peralihan dari max turun ke high pada kira-kira separuh token output — ayunan yang jauh lebih besar daripada apa pun yang akan dilakukan jadwal peak/off-peak kepadamu. Pengaturan effort adalah tuas besarnya; jadwal adalah yang gratis.

Yang perlu diketahui sebelum Anda menjadwalkan apa pun: jam sibuk adalah 01:00–04:00 dan 06:00–10:00 UTC, Senin sampai Jumat, dan semua waktu lainnya termasuk akhir pekan adalah di luar jam sibuk. Tim Eropa yang bekerja 09:00–18:00 CET tidak pernah menyentuh jam sibuk. Tim di Beijing yang bekerja pada jam lokal yang sama masuk jam sibuk dari 09:00–12:00 dan 14:00–18:00 — tujuh dari sembilan jam kerja dengan harga dua kali lipat. Model yang sama, kode yang sama, tagihan dua kali lipat, sepenuhnya ditentukan oleh zona waktu.

Penghematan gratis lainnya adalah tarif baca cache, $0,003 per 1 juta token dibandingkan $0,15 untuk input baru — seperlima puluh. Prompt agen coding sebagian besar berupa prefiks yang stabil: instruksi sistem, definisi alat, bagian-bagian repo yang tidak berubah. Letakkan materi stabil di bagian depan dan biarkan konten variabel mengikutinya, lalu cache di sisi penyedia yang mengurus sisanya. Apakah input cache yang didiskon berlaku, dan dengan syarat apa, ditentukan oleh DeepSeek, bukan oleh klien, jadi pastikan hal itu di dokumentasi terkini sebelum Anda menyusun anggaran berdasarkan itu — halaman model kami sendiri untuk code>deepseek/deepseek-v4.1-flash/code> mengatakan hal yang sama, bahwa tarif input cache mengikuti ketentuan penyedia.

Jika Anda lebih memilih untuk tidak menambahkan langganan kedua guna mengevaluasi model ini, id yang sama tersedia melalui satu endpoint yang kompatibel dengan OpenAI di depan seluruh katalog kami, dengan tarif penyedia dan markup 0% — jadi perubahan harga di sisi DeepSeek langsung berlaku di sini pada hari yang sama, bukan pada penetapan harga ulang berikutnya. Hal itu paling penting untuk situasi yang persis digambarkan artikel ini: model dengan kecenderungan yang terdokumentasi untuk terus berjalan, pada jalur yang belum selesai Anda evaluasi. Rantai fallback berarti giliran yang salah akan mendarat ke model lain sebelum respons dimulai, alih-alih menggagalkan permintaan.

552B, 748B, atau 763B — pertanyaan tentang ukuran ini benar-benar terbuka

Jangan mengulang jumlah parameter untuk model ini sebagai sesuatu yang sudah pasti, karena tiga angka berbeda sedang beredar dan tidak satu pun di antaranya benar-benar salah.

Kartu model DeepSeek sendiri mendeskripsikan model dengan "552B parameter tulang punggung", dan itu adalah angka yang dilaporkan vendor — itu juga angka yang tercantum di panel spesifikasi pada halaman model kami sendiri. Kartu yang sama secara terpisah mencantumkan modul "memori kondisional Engram" dengan 196B parameter, "diakses secara sparse melalui pencarian berbasis token." Jumlahkan keduanya dan Anda mendapatkan 748B, yang merupakan aritmetika yang disimpulkan analisis komunitas dalam hitungan jam setelah rilis. Dan metadata berkas di repositori model yang sama mencantumkan ukuran model 763B parameter, yang merupakan angka ketiga lagi.

Perselisihan yang tampak ini bersifat definisional, bukan sebuah kontradiksi. Parameter Engram yang di-lookup memakan memori tetapi hampir tidak memerlukan aritmetika per token, sedangkan parameter backbone yang dikomputasi memakan waktu pada setiap token — itulah tepatnya mengapa vendor melaporkannya secara terpisah dan mengapa membandingkan angka-angka utama dari dua model dengan arsitektur berbeda tidak memberi tahu Anda banyak hal.

Yang tidak diperdebatkan secara serius adalah jumlah parameter aktif: kira-kira 8B per token selama prefill dan 16B selama decode, yang merupakan angka yang sebenarnya menentukan biaya inferensi. Bobotnya terbuka di bawah lisensi MIT jika Anda ingin memeriksa sendiri semua ini. Anggap 552B sebagai laporan vendor, 748B sebagai total komunitas yang kredibel, dan klaim apa pun bahwa pertanyaan tentang ukuran sudah selesai sebagai terlalu dini.

Screenshot of DeepSeek's own API documentation release page for DeepSeek-V4.1-Flash, dated 2026-09-10, showing the headline claim of a 552B-parameter MoE on a new Causal Encoder-Decoder architecture with 8B active parameters for input and 16B for output, a bar chart comparing DeepSeek V4.1 Flash against Kimi K3, GLM-5.3, Opus 5 and GPT-5.6 Sol on Terminal-Bench 3.0, DeepSWE v1.1, CyberGym and Automation-Bench, and the start of a vendor benchmark table with GPQA Diamond at 90.9 and HLE at 36.8.

Apa yang harus dilakukan sebelum tanggal 20

Jika Anda akan mencoba DeepSeek V4.1 Flash di agen pengkodean, urutan yang paling sedikit membuang waktu adalah: pilih harness terlebih dahulu, lalu tetapkan effort, lalu ukur.

Pada harness, ringkasan jujur dari verifikasi hari ini adalah bahwa ketiga rute berfungsi dan berbeda dalam apa yang mereka minta dari Anda. OpenCode Go adalah langganan $10/bulan dengan pengganda promosi yang berakhir pada 20 September, dan penyiapannya adalah code>/connect/code> ditambah code>/models/code> tanpa file yang perlu diedit. Command Code mencantumkan model secara langsung di katalognya sendiri, beralih dengan code>/model <id>/code>, dan mengekspos effort sebagai perintah kelas satu. Claude Code mencapainya baik melalui jalur klien tervalidasi OpenCode Go — yang tidak memerlukan pembungkus header khusus — atau secara langsung terhadap endpoint berformat Anthropic milik DeepSeek, tempat konflik effort subagen merupakan titik kasar yang diketahui.

Untuk effort, atur secara eksplisit dan atur agak rendah: high, atau default model jika ternyata high adalah nilainya, dan bukan max. Lalu pastikan itu sudah keluar dari mesin Anda, karena ditemukan dua harness yang membuangnya.

Dalam hal pengukuran, perhatikan token keluaran alih-alih waktu jam dinding. Verbositas adalah biayanya, pengatur upaya adalah kendalinya, dan jadwal puncak adalah kecelakaan zona waktu yang bisa Anda hindari secara gratis.

Dan mengenai klaim ukuran yang akan Anda lihat dikutipkan kepada Anda minggu ini — 552B, 748B, 763B — tanggapan yang berguna adalah bahwa vendor melaporkan backbone-nya, komunitas menambahkan modul memori, dan metadata repositori mengatakan hal yang berbeda lagi. Siapa pun yang menyajikan salah satunya sebagai jawaban yang sudah pasti telah memilih sebuah angka alih-alih memeriksanya.