DeepSeek V4 Flash 0731 adalah rilis resmi hasil pasca-pelatihan ulang dari model mixture-of-experts efisien DeepSeek V4 Flash — 284B total / 13B parameter aktif, identik dalam arsitektur dan ukuran dengan rilis V4 Flash April, dengan pasca-pelatihan yang dikerjakan ulang dari awal. Model ini melayani jendela konteks 1M token dengan hingga 384K token keluaran, mendukung mode berpikir dan non-berpikir (berpikir aktif secara default) plus keluaran JSON dan panggilan alat, dan secara native mendukung Responses API dengan adaptasi yang ditargetkan untuk agen pengkodean ala Codex. Revisi 0731 merupakan lompatan besar dalam kemampuan agen, mengungguli bahkan DeepSeek V4 Pro Preview pada benchmark agen yang dipublikasikan DeepSeek — 82,7 di Terminal Bench 2.1, 76,7 di Cybergym, 70,3 di Toolathlon Verified, 54,4 di DeepSWE, dan 54,2 di NL2Repo. Pada API pihak pertama DeepSeek, revisi ini adalah yang kini dilayani oleh id model deepseek-v4-flash; identifier ber tanggal mencantumkan revisi yang sama untuk pemanggil yang mereferensikannya berdasarkan tanggal. Ini adalah pilihan kuat untuk agen pengkodean, beban kerja terminal dan penggunaan alat, serta pipeline agen bervolume tinggi dengan biaya tingkat flash.
DeepSeek V4 Flash 0731 adalah model bahasa khusus teks dari penyedia deepseek, tersedia melalui OrcaRouter dengan ID model deepseek/deepseek-v4-flash-0731. Spesifikasi utamanya adalah jendela konteks…
Input dibatasi hanya teks. Jendela konteksnya adalah 1.048.576 token, dan output maksimum adalah 384.000 token per respons. Itu adalah ruang kerja yang besar: Anda dapat membaca sekitar satu juta token konten sebelum membuat, dan Anda dapat meminta hingga 384.000 token output dalam satu panggilan. Kartu model mencantumkan keduanya sebagai dua batas terpisah; tidak menyebutkan batas gabungan untuk permintaan yang menggunakan keduanya mendekati maksimum. Dalam praktiknya, untuk tetap berada dalam batas, hitung token Anda sebelum mengirim dan atur max_tokens di bawah batas output. Batasan hanya-teks juga berarti Anda harus mengonversi PDF, spreadsheet, dan dokumen lain menjadi teks biasa terlebih dahulu. Tokenisasi tidak ditentukan dalam fakta yang tersedia, jadi uji konten yang representatif untuk melihat seberapa besar prompt Anda nantinya. Jika permintaan Anda melebihi 1.048.576 token masukan, panggilan API akan gagal; hal yang sama berlaku untuk output di atas 384.000 token.
Berdasarkan spesifikasi yang tercantum, model ini paling cocok untuk tugas-tugas yang menggabungkan input teks panjang, output teks panjang, dan penalaran agentik yang berorientasi terminal. Skor 82.7 pada Terminal Bench 2.1 menjadi bukti keunggulan dalam penyelesaian tugas baris perintah, di mana model membaca output shell dan menentukan perintah berikutnya. Konteks 1,048,576 token mendukung analisis seluruh repositori, peninjauan kode multi-file, dokumen hukum atau teknis yang panjang, serta riwayat obrolan yang ekstensif. Output 384,000 token mendukung pembuatan dokumen terstruktur yang panjang, dataset sintetis, atau analisis langkah demi langkah dalam satu kali proses. Harga per token sebesar $0.15 untuk input dan $0.29 untuk output per juta token membuat pemrosesan teks bervolume tinggi dapat diprediksi secara finansial. Model ini kurang tepat ketika Anda membutuhkan pemahaman gambar, transkripsi audio, atau latensi yang sangat rendah, yang semuanya tidak tercakup oleh fakta yang diberikan. Jika tugas Anda sesuai dengan profil teks-saja, konteks-besar, dan output-besar, ini adalah kandidat yang wajar untuk dievaluasi melalui OrcaRouter.
Model tidak dapat menerima input non-teks; tidak ada modalitas visi, audio, atau video dalam entri katalognya. Model ini juga tidak memiliki jaminan latensi atau streaming yang dipublikasikan dalam fakta yang tersedia. Anda sebaiknya memilih model yang lebih murah ketika beban kerja Anda tidak memerlukan batas konteks atau keluaran yang besar. Misalnya, percakapan chatbot pendek yang menggunakan beberapa ribu token tetap akan ditagih dengan tarif per token yang sama, tetapi mungkin lebih baik dilayani oleh model dengan konteks yang lebih kecil dan harga per juta token yang lebih rendah. Fakta yang tersedia tidak mencantumkan harga untuk alternatif, jadi bandingkan tarif per-1M-token dalam katalog OrcaRouter. Jika tugas Anda adalah klasifikasi sederhana atau peringkasan teks pendek, model yang lebih murah mungkin sudah memadai. Jika tugas Anda memerlukan konteks 1M penuh atau keluaran 384K, atau mendapat manfaat dari kekuatan Terminal Bench 2.1 dalam pekerjaan baris perintah, maka harga model ini adalah dasar yang relevan untuk evaluasi.
Setiap input harus berupa teks. PDF, gambar, spreadsheet, dan file audio perlu dikonversi menjadi teks biasa atau ditranskripsi sebelum dapat dikirim. Itu adalah langkah prapemrosesan yang diperlukan, tetapi juga menyederhanakan format permintaan: kolom konten standar bergaya OpenAI yang berisi string adalah semua yang Anda perlukan. Konteks 1.048.576 token berarti Anda dapat mengirim tubuh teks hasil konversi yang panjang dalam satu permintaan; output 384.000 token berarti Anda dapat menerima teks yang sangat panjang kembali. Jumlah token adalah perhatian operasional utama, karena total tagihan bergantung pada token input dan output. OrcaRouter melaporkan penggunaan dalam respons yang kompatibel dengan OpenAI, sehingga Anda dapat memantau kedua angka tersebut. Jika Anda bekerja dengan bahasa atau kode yang melakukan tokenisasi secara tidak efisien, konteks efektif Anda akan menyusut karena jumlah token, bukan karakter, adalah batas yang mengikat. Tidak ada detail tokenizer yang disediakan, jadi jalankan pengujian cepat dengan konten Anda sendiri untuk mengetahui panjang token yang umum.
Terminal Bench 2.1 mengevaluasi kemampuan model untuk bekerja di lingkungan terminal: memahami keluaran perintah, menavigasi direktori, mengeksekusi perintah, dan menyelesaikan tugas administrasi sistem atau rekayasa perangkat lunak yang realistis melalui shell. Skor utama untuk DeepSeek V4 Flash 0731 adalah 82.7, pada skala di mana semakin tinggi semakin baik. Ini adalah satu-satunya hasil benchmark yang disediakan dalam fakta yang tersedia. Skor ini merupakan sinyal yang berguna jika Anda berencana membangun loop agen yang mengeluarkan perintah shell, karena benchmark ini dirancang untuk menguji kemampuan semacam itu. Ini bukan ukuran pengetahuan umum, penulisan kreatif, matematika, atau kompetensi multibahasa. Tidak ada baseline perbandingan atau angka benchmark lain yang disediakan, jadi 82.7 harus diinterpretasikan dalam konteks: bukti kuat untuk tugas terkait terminal, dan tidak ada bukti untuk domain lain. Skor benchmark bergantung pada distribusi tugas yang tepat, jadi tugas terminal Anda sendiri mungkin mendapat skor berbeda; validasi dengan evaluasi Anda sendiri sebelum digunakan dalam produksi.
Fakta yang tersedia untuk DeepSeek V4 Flash 0731 tidak mencakup token per detik, waktu hingga token pertama, latensi p95, atau throughput. Nama Flash mengisyaratkan varian yang lebih ringan, tetapi fakta yang diberikan tidak mengukur kecepatan. Yang termasuk dalam fakta tersebut adalah jendela konteks besar yaitu 1.048.576 token dan batas output besar yaitu 384,000 token. Input dan output yang lebih panjang secara inheren mengonsumsi lebih banyak komputasi, sehingga latensi pada permintaan konteks penuh kemungkinan akan lebih tinggi daripada pada prompt pendek, bahkan untuk model yang cepat. Harga $0,15/$0,29 per juta token menggambarkan biaya, bukan kecepatan. Untuk membuat keputusan yang tepat, jalankan uji beban Anda sendiri terhadap API OrcaRouter dengan prompt representatif seukuran yang ingin Anda gunakan, dan bandingkan waktu hingga token pertama serta durasi total dengan model lain dalam katalog. Jangan mengekstrapolasi latensi dari skor tolok ukur, yang tidak mengukur waktu respons.
Keterbatasan utama terlihat dari fakta-fakta yang tercantum. Model ini hanya mendukung teks, sehingga input multimodal apa pun berada di luar cakupan. Bukti tolok ukur terbatas pada satu skor, yaitu 82,7 pada Terminal Bench 2.1, yang mencakup penyelesaian tugas berbasis terminal, bukan penalaran umum atau pengetahuan. Tidak ada metrik latensi, ketersediaan, atau tingkat kesalahan yang dipublikasikan, sehingga performa saat dibebani tidak diketahui. Batas konteks dan keluaran memang besar tetapi terbatas: 1.048.576 token input dan 384.000 token output per permintaan. Permintaan yang melebihi batas tersebut tidak akan berhasil. Tidak ada diskon cache prompt yang terdokumentasi dalam fakta yang diberikan, sehingga prefiks yang berulang ditagih sebagai token input biasa. Harga per token memang rendah, tetapi biaya absolut meningkat linear seiring ukuran konteks. Jika aplikasi Anda membutuhkan visi, latensi rendah, atau throughput sangat tinggi, model ini mungkin bukan pilihan yang tepat; verifikasi kebutuhan tersebut secara terpisah sebelum berkomitmen.
Biaya dihitung per token, dengan satu tarif untuk input dan satu untuk output. Token input dikenai biaya $0.15 per 1,000,000 token; token output dikenai biaya $0.29 per 1,000,000 token. OrcaRouter menagihnya sesuai tarif penyedia dengan markup nol, artinya tidak ada persentase platform tambahan yang ditambahkan di atas tarif deepseek. Biaya satu permintaan kira-kira adalah (token input dikali $0.15) dibagi 1,000,000, ditambah (token output dikali $0.29) dibagi 1,000,000. Sebagai contoh, input penuh 1,048,576 token memakan biaya sekitar $0.1573, dan output dengan panjang maksimum 384,000 token memakan biaya sekitar $0.1114, jika kedua batas tersebut digunakan dalam transaksi terpisah. Fakta yang tersedia tidak menyebutkan diskon harga untuk input yang di-cache, jadi asumsikan setiap token input ditagih dengan tarif standar. Karena penetapan harga bersifat linear, estimasi biaya batch menjadi mudah setelah Anda mengetahui ukuran prompt rata-rata dan panjang output.
Trade-off utama adalah antara ukuran konteks dan harga. Dengan harga $0,15 per 1 juta token input, sebuah prompt yang menggunakan konteks penuh 1.048.576 token menghabiskan biaya sekitar $0,157 hanya untuk biaya input. Jika tugas Anda hanya membutuhkan beberapa ribu token konteks, Anda membayar untuk kapasitas yang tidak terpakai, dalam arti bahwa model dengan konteks lebih kecil dan harga per token lebih rendah mungkin lebih murah, tergantung pada tarifnya. Tarif output $0,29 per 1 juta token berarti output yang panjang tidak terlalu mahal secara individual, tetapi beban kerja yang menghasilkan gigabyte teks akan mengakumulasi biaya. Tidak ada diskon batch, reservasi, atau diskon cache yang tercantum dalam fakta yang diberikan. Penagihan tanpa markup dari OrcaRouter berarti harga yang Anda lihat adalah harga penyedia; tagihan akhir Anda hanyalah fungsi dari token yang dikirim dan diterima. Untuk pekerjaan batch skala besar, perkirakan total token input dan output, kalikan dengan kedua tarif tersebut, dan bandingkan dengan alternatif di katalog.
OrcaRouter secara eksplisit menagih DeepSeek V4 Flash 0731 sesuai tarif penyedia tanpa markup. $0.15 per 1 juta token input dan $0.29 per 1 juta token output adalah tarif penyedia, bukan versi yang dikenai markup. Fakta yang diberikan tidak menjelaskan prompt caching untuk model ini. Tidak ada tingkat harga untuk input yang di-cache yang tercantum, dan tidak ada pernyataan bahwa OrcaRouter secara otomatis menyimpan cache prompt atas nama Anda. Jika penyedia yang mendasarinya menawarkan caching, persyaratan tersebut tidak termasuk dalam informasi yang diberikan untuk entri katalog ini, jadi Anda harus memeriksa dokumentasi OrcaRouter saat ini sebelum berasumsi ada diskon. Respons API, karena mengikuti format chat completions OpenAI, menyertakan informasi penggunaan yang memungkinkan Anda memverifikasi token input dan output yang ditagih. Untuk tujuan audit, catat objek penggunaan dari setiap respons dan bandingkan dengan perkiraan jumlah token Anda. Kontrol biaya apa pun harus berasal dari pilihan prompt dan parameter Anda sendiri.
Kirim permintaan chat completion standar ke API OrcaRouter yang kompatibel dengan OpenAI. URL dasarnya adalah https://api.orcarouter.ai/v1, dan ID modelnya adalah deepseek/deepseek-v4-flash-0731. Atur kolom model ke string yang persis itu, dan letakkan kunci API OrcaRouter Anda di header Authorization sebagai bearer token. Buat array messages dengan konten teks; model tidak akan menerima konten gambar atau audio. Respons diformat seperti chat completion OpenAI dan menyertakan pesan yang dihasilkan serta objek usage. Karena ID model menyertakan prefiks penyedia, pertahankan persis seperti yang ditampilkan. Fakta yang tersedia tidak memerlukan header non-standar atau pengaturan transport khusus. Anda dapat menggunakan SDK OpenAI, curl, atau klien HTTP apa pun yang mendukung JSON. Mulailah dengan permintaan kecil, verifikasi bahwa usage yang dikembalikan sesuai dengan jumlah token input dan output yang diharapkan, lalu tingkatkan skala.
Karena endpoint-nya kompatibel dengan OpenAI, parameter chat completion yang umum tersedia: model, messages, temperature, top_p, max_tokens atau max_completion_tokens, stop, stream, dan opsi serupa yang didukung oleh SDK yang Anda gunakan. Fakta yang tersedia tidak merinci parameter mana yang didukung OrcaRouter untuk model spesifik ini, jadi Anda harus menguji apa pun selain model dan messages. Batasan krusialnya adalah milik model itu sendiri: 1.048.576 token masukan dan 384.000 token keluaran. Jaga max_tokens tetap di bawah batas keluaran agar permintaan tidak gagal. Untuk pemanggilan tool atau fungsi, fakta tidak menyatakan dukungannya; uji definisi tool minimal sebelum membangun agen. Untuk kontrol format keluaran, tidak ada penyebutan mode JSON atau jaminan keluaran terstruktur; validasi sendiri teks yang dihasilkan jika Anda memerlukan struktur yang andal. Streaming umumnya didukung pada endpoint yang kompatibel dengan OpenAI, tetapi fakta tidak mengonfirmasinya untuk model ini, jadi konsultasikan referensi API OrcaRouter.
Migration pada dasarnya adalah konfigurasi: ubah base URL menjadi https://api.orcarouter.ai/v1, ganti API key dengan key OrcaRouter Anda, dan ganti nama model dengan deepseek/deepseek-v4-flash-0731. Kode yang sudah membangun pesan, menangani respons chat completion, dan membaca data penggunaan akan tetap berfungsi selama mengikuti konvensi OpenAI. Ada dua perbedaan yang perlu diperhatikan. Pertama, model ini hanya mendukung teks, jadi hapus semua field image_url atau audio dari permintaan Anda. Kedua, batas konteks dan output sangat besar; sesuaikan pengaturan max_tokens Anda agar mematuhi batas output 384.000 token dan bersiaplah untuk respons yang kadang panjang. Jika kode Anda menyertakan percobaan ulang pada error 429 atau 5xx, pertahankan; fakta tersebut tidak mengubah ekspektasi penanganan error. Jalankan smoke test dengan prompt kecil, pastikan penagihan muncul pada $0,15/$0,29 per juta token, lalu pindahkan traffic secara bertahap.
URL dasar untuk API OrcaRouter adalah https://api.orcarouter.ai/v1. Semua permintaan ke endpoint ini harus menggunakan HTTPS. Autentikasi dilakukan dengan kunci API, yang dikirim sebagai token bearer standar di header Authorization. Fakta yang tersedia tidak mencantumkan metode autentikasi alternatif. ID model adalah deepseek/deepseek-v4-flash-0731, yang mencakup nama penyedia dan akhiran snapshot 0731; kirimkan persis seperti yang tertulis. Di sebagian besar SDK yang kompatibel dengan OpenAI, Anda mengonfigurasi klien dengan base_url dan api_key, lalu menetapkan nama model pada setiap panggilan. Respons akan menyertakan jumlah token yang relevan untuk penagihan dalam objek usage. Fakta tidak menyebutkan batas kecepatan (rate limit), perilaku percobaan ulang, atau panduan waktu tunggu, jadi periksa dokumentasi OrcaRouter untuk detail operasional tersebut. Simpan kunci API Anda dengan aman; kunci tersebut menentukan akses ke setiap akun model di proyek OrcaRouter Anda. Jika Anda menggunakan proxy atau gateway, arahkan ke URL dasar OrcaRouter dan pertahankan ID model lengkap.
Fakta yang diberikan hanya mencakup cuplikan spesifik ini, sehingga perbandingan numerik baris-demi-baris dengan entri DeepSeek lainnya tidak mungkin dilakukan dari data yang ada. Yang kita ketahui tentang DeepSeek V4 Flash 0731 adalah konteks 1,048,576 token, batas output 384,000 token, input hanya teks, harga $0.15/$0.29 per 1 juta token, dan skor Terminal Bench 2.1 sebesar 82.7. Model DeepSeek lainnya dalam katalog OrcaRouter mungkin berbeda pada salah satu aspek ini. Saat memutuskan, bandingkan spesifikasi yang penting: berapa banyak token yang sebenarnya digunakan oleh prompt Anda, berapa banyak token yang dibutuhkan output Anda, apakah Anda memerlukan input multimodal, dan harga per 1 juta token dari kandidat tersebut. Label Flash menyiratkan varian yang lebih ramping dibandingkan rilis DeepSeek lainnya, tetapi satu-satunya indikator kinerja objektif dalam fakta tersebut adalah skor Terminal Bench. Gunakan halaman daftar katalog OrcaRouter untuk spesifikasi berdampingan dan harga terkini sebelum memilih.
Dengan konteks 1,048,576 token, model ini berada di tingkatan konteks panjang. Model dengan konteks lebih kecil mungkin terbatas pada beberapa ratus ribu token atau kurang, sehingga memaksa Anda untuk memecah dokumen, menyematkan potongan-potongan, atau menggunakan pengambilan. Keunggulan model ini adalah Anda dapat menempatkan korpus yang sangat besar dalam satu prompt dan membiarkan model memproses semuanya dalam satu kali lintasan. Kekurangannya adalah biaya per permintaan: setiap token input dikenai biaya, sehingga konteks yang besar melipatgandakan biaya input. Fakta-fakta tidak mencantumkan model apa pun dengan jendela konteks yang lebih besar, jadi satu-satunya pernyataan yang aman adalah tentang batasan model ini sendiri. Dalam memilih, perkirakan ukuran prompt Anda yang sebenarnya. Jika tugas Anda biasanya menggunakan kurang dari 100K token, konteks penuh mungkin tidak relevan dan model yang lebih murah dan lebih kecil mungkin lebih disukai. Jika Anda secara rutin melebihi batas konteks umum, jendela 1M token model ini adalah fitur penentu.
Pilih DeepSeek V4 Flash 0731 ketika tugasnya hanya berupa teks dan Anda dapat memanfaatkan spesifikasinya. Konteks 1,048,576 token layak dipilih ketika Anda perlu membaca seluruh repositori, kumpulan dokumen, atau transkrip panjang dalam satu kali proses. Batas output 384,000 token layak dipilih ketika Anda membutuhkan jawaban yang sangat panjang tanpa beberapa kali bolak-balik. Skor 82.7 Terminal Bench 2.1 layak dipilih untuk otomatisasi terminal dan alur kerja CLI agenik. Harga $0.15/$0.29 per 1 juta token layak dipilih untuk pemrosesan teks batch bervolume tinggi yang biaya per tokennya dominan. Jangan pilih model ini ketika Anda membutuhkan gambar atau audio, ketika kebutuhan konteks Anda sangat kecil dan ada model yang lebih murah, atau ketika Anda tidak dapat menerima karakteristik latensi yang tidak diketahui. Fakta yang tersedia tidak memberikan jaminan latensi, sehingga tim yang sensitif terhadap performa harus melakukan benchmark dengan prompt nyata terlebih dahulu. Dalam setiap kasus, konfirmasi ID model dan penagihan di OrcaRouter sebelum melakukan penskalaan.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Input / 1M token | $0.147 |
| Output / 1M token | $0.295 |
| Baca cache / 1M | $0.020 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/deepseek/deepseek-v4-flash-0731Buka @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731