DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
BaruUnggulan
VisiAlatJSONPenalaran
oleh DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash adalah model terkecil dalam keluarga arsitektur baru DeepSeek, dirilis pada 10 September 2026, dengan pemahaman visual multimodal native — penerus produksi dari V4 Flash dan eksperimen V4 Flash Vision. Arsitektur baru ini menargetkan batas atas kemampuan yang lebih tinggi, inferensi yang lebih cepat, dan throughput yang lebih tinggi, dan DeepSeek melaporkan bahwa V4.1 Flash secara komprehensif melampaui V4 Pro dalam hal performa, biaya, kecepatan, dan total waktu tugas. Model ini menerima teks dan gambar dengan keluaran teks, melayani jendela konteks 1M token dengan hingga 384K token keluaran, serta mendukung mode berpikir (default, dengan effort yang dapat dipilih: low / high / max) dan mode non-berpikir di seluruh API Chat Completions, Responses, dan API yang kompatibel dengan Anthropic, bersama dengan keluaran JSON, panggilan tool, dan penyelesaian prefiks chat; FIM hanya berfungsi dalam mode non-berpikir saja. Bobot model terbuka di Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Tolok ukur resmi pada saat rilis: 90.6 pada Terminal-Bench 2.1, 74.2 pada DeepSWE v1.1, 65.4 pada NL2Repo-Bench, 90.9 pada GPQA Diamond, 63.9 pada HLE dengan tool, dan hasil agen visi native yang kuat (89.6 BabyVision, 78.9 Chartography dengan tool). Harga juga dipangkas bersamaan dengan rilis: $0.15/M input (cache miss), $0.60/M output, dan $0.003/M untuk cache hits dengan tarif di luar jam sibuk, menjadi dua kali lipat selama jam sibuk hari kerja (01:00-04:00 dan 06:00-10:00 UTC); semua jam lainnya termasuk akhir pekan berada di luar jam sibuk.

ctx1M token
Output maks384K
Masukantext + image
Keluarantext
p50 TTFT409 ms
INPUT$0.15/ 1M token
OUTPUT$0.60/ 1M token
p50 TTFT409 ms7h
p95 TTFT1.53 s7h
LALU LINTAS253.5Mtoken / 7h

DeepSeek V4.1 Flash adalah model DeepSeek yang tersedia melalui OrcaRouter, gateway API yang kompatibel dengan OpenAI. Model ini menerima input teks dan gambar, memiliki jendela konteks 1.048.576…

Apa itu DeepSeek V4.1 Flash?

Untuk siapa DeepSeek V4.1 Flash dibuat?

Mengapa jendela konteks 1.048.576 token itu penting?

Contoh kode

Panggil dari SDK apa pun

Kompatibel OpenAI — pakai SDK Anda yang sekarang

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parameter yang didukung

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Harga

Harga
Input / 1M token · Di luar jam sibuk$0.150
Output / 1M token · Di luar jam sibuk$0.600
Baca cache / 1M · Di luar jam sibuk$0.0030
Jam sibuk01:00–04:00, 06:00–10:00 ×2 (UTC)
Input / 1M token · ×2$0.300
Output / 1M token · ×2$1.20
Baca cache / 1M · ×2$0.0060
Mata uangUSD

Kalkulator biaya

Token / bulan10MM
Porsi input70%%
Perkiraan / bulan $2.85 · Dengan cache prompt $2.34

Perkiraan berdasarkan harga daftar

Estimator token & biaya

Token masukan: 17Biaya per permintaan: $0.000303

Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.

Performa

p50 TTFT
409 ms
Kecepatan output
216 tok/s
p95 TTFT
1.53 s
Tingkat kesalahan
0.07%

Benchmark publik

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Sumber: api-docs.deepseek.com

Perbincangan komunitas

Yang dibicarakan developer minggu ini

Hacker News13 sebutan · 7 hrnaik 13 dari minggu lalu

Perbandingan

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Input $/M$0.15$0.73$0.24$0.24
Output $/M$0.60$2.18$0.73$0.73
Konteks1.0M1.0M1.0M1.0M
Kualitas8/108/107/107/10
Bandingkan berdampinganBandingkan berdampinganBandingkan berdampinganBandingkan berdampingan

FAQ

Berapa biaya DeepSeek V4.1 Flash di OrcaRouter?
OrcaRouter menagih DeepSeek V4.1 Flash sebesar $0.15 per 1M token input dan $0.60 per 1M token output, diteruskan sesuai tarif penyedia tanpa markup. Tidak ada biaya terpisah yang dijelaskan untuk jendela konteks itu sendiri: 1,048,576 token adalah batas, bukan biaya. Token input mencakup teks, gambar, dan riwayat percakapan yang Anda kirim; token output mencakup semua yang dihasilkan, hingga 384,000 token.
Seberapa besar jendela konteks dan output maksimum?
DeepSeek V4.1 Flash memiliki jendela konteks 1.048.576 token dan keluaran maksimum 384.000 token. Jendela masukan memungkinkan Anda mengirimkan seluruh dokumen, transkrip, atau snapshot repositori dalam satu panggilan, sedangkan batas keluaran mendukung artefak panjang yang dihasilkan dalam satu kali proses seperti spesifikasi, rencana migrasi, atau diff panjang.
Dalam hal apa DeepSeek V4.1 Flash paling unggul?
Ini dirancang untuk pekerjaan dengan input panjang dan output panjang: analisis seluruh dokumen, pemahaman kode repositori besar, peninjauan multimodal atas teks dan gambar, serta alur kerja yang membutuhkan jawaban substansial yang dihasilkan, bukan balasan singkat. Skor 90,9 pada GPQA Diamond juga menunjukkan penalaran ilmiah dan teknis tingkat pascasarjana yang solid. Input mendukung teks dan gambar; output hanya teks.
Bagaimana perbandingannya dengan model-model frontier yang lebih besar?
Model frontier mungkin unggul pada tolok ukur penalaran tersulit dan biasanya mengenakan biaya lebih tinggi per token, sementara DeepSeek V4.1 Flash menawarkan jendela konteks 1,048,576 token dan batas maksimum output 384,000 token dengan harga $0.15 per 1M input dan $0.60 per 1M token output. Untuk pekerjaan berkonteks panjang dan bervolume tinggi, ini sering kali menjadi pilihan praktis; untuk langkah penalaran individual tersulit, mengarahkan panggilan tersebut ke model yang lebih mahal di OrcaRouter adalah pola yang wajar.
Bagaimana data ditangani saat saya memanggil model ini?
OrcaRouter merutekan permintaan ke API DeepSeek dan menagih dengan tarif penyedia tanpa markup. Retensi, penggunaan untuk pelatihan, dan ketentuan terkait diatur oleh kebijakan penyedia, bukan oleh pengaturan terpisah yang dijelaskan di sini, jadi pastikan ketentuan penyedia yang berlaku saat ini sebelum mengirim materi sensitif. Samarkan pengenal yang tidak Anda perlukan dan batasi prompt seminimal yang diperlukan tugas; konteks yang lebih kecil juga menurunkan biaya input pada $0.15 per 1 juta token.
Bagaimana cara memanggilnya melalui API yang kompatibel dengan OpenAI?
Setel URL dasar klien Anda ke https://api.orcarouter.ai/v1 dan gunakan id model deepseek/deepseek-v4.1-flash dengan kunci API OrcaRouter Anda. Permintaan dan respons mengikuti skema chat completions OpenAI, sehingga SDK yang ada, handler streaming, dan parsing tool-call tetap berfungsi tanpa perubahan. Migrasi biasanya berupa perubahan URL dasar dan string model ditambah menjalankan ulang set evaluasi Anda.
Bisakah DeepSeek V4.1 Flash menerima gambar?
Ya. Masukan gambar didukung melalui array konten multimodal standar, dengan bagian teks dan gambar dalam pesan pengguna yang sama. Token gambar dihitung sebagai input dan ditagih sebesar $0.15 per 1M token input di OrcaRouter. Output tetap hanya teks, sehingga model mendeskripsikan atau mengekstrak dari gambar alih-alih menghasilkannya.
Apakah skor 90.9 pada GPQA Diamond cukup untuk mempercayainya untuk tugas saya?
Ini adalah sinyal yang berguna, bukan jaminan. GPQA Diamond mengukur penalaran sains tingkat pascasarjana dalam format prompt tetap, yang relevan untuk penjawaban pertanyaan teknis tetapi tidak banyak menjelaskan tentang recall konteks panjang, nada, atau akurasi ekstraksi pada data Anda. Buat set evaluasi kecil dari input nyata, jalankan terhadap DeepSeek V4.1 Flash dan ID model alternatif apa pun di OrcaRouter, dan bandingkan biaya serta kualitas sebelum merutekan lalu lintas produksi.

Sematkan lencana ini

DeepSeek: DeepSeek V4.1 Flash$0.15/M in409ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash di OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Kartu model sebagai data

GET /api/public/models/deepseek/deepseek-v4.1-flashBuka