Kartu judul hero: Pemanggilan tool DeepSeek V4.1 Flash hadir di vLLM — tag berspasi merusak detektor V4
Engineering & Research

Pemanggilan Alat DeepSeek V4.1 Flash Hadir di vLLM: Apa yang Dirusak oleh Tag Berspasi

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

DeepSeek V4.1 Flash telah tersedia secara umum sejak 10 September 2026, dan selama dua belas hari pertama masa hidupnya, model ini memiliki celah yang tidak dibahas siapa pun: ia bisa bernalar, ia bisa melihat gambar, ia bisa menampung satu juta token konteks, tetapi ia tidak dapat memanggil alat secara andal melalui stack penyajian terbuka yang paling banyak digunakan. Celah itu kini ditutup di vLLM — bukan dengan flag konfigurasi, melainkan dengan penulisan ulang parser. Dua pull request membawa pekerjaan ini, dan alasan keduanya diperlukan adalah bagian yang menarik.

Versi singkatnya: DeepSeek V4.1 Flash mengeluarkan pemanggilan tool-nya dalam format tag yang tidak dikenali oleh detektor DeepSeek V4 yang ada, sehingga pada deployment vLLM bawaan, markup pemanggilan tool tersebut tiba sebagai teks biasa alih-alih keluaran terstruktur. Tidak ada error. Model tampak seolah-olah hanya menolak memanggil fungsi tersebut. Jika Anda selama ini menguji loop agen terhadap DeepSeek V4.1 Flash yang dihosting sendiri dan menyimpulkan bahwa model itu buruk dalam penggunaan tool, kemungkinan besar inilah yang sedang Anda lihat.

Apa yang sebenarnya berubah pada stack serving?

Parsing panggilan alat vLLM untuk model DeepSeek telah berada di dua tempat selama beberapa waktu: frontend Python dan frontend Rust yang lebih baru, dengan pekerjaan tingkat tata bahasa didelegasikan ke proyek XGrammar. Menghadirkan dukungan V4.1 Flash berarti mem-porting konversi C++ deepseek_xml di dalam XGrammar ke builder Rust, lalu menghubungkan encoding milik model ke direktori tokenizer vLLM.

• Pekerjaan frontend Rust adalah PR #56235, yang mem-port XGrammar C++ deepseek_xml konversi ke dalam builder Rust. Ini menyertakan 18 tes baru khusus untuk V4.1, dan seluruh suite yang sudah ada — 472 tes di vllm-parser dan 326 di vllm-chat — tetap hijau.

• Pekerjaan frontend Python adalah PR #56408, yang masih berupa draf. Ini bergantung pada perubahan XGrammar hulu (mlc-ai/xgrammar#885) yang harus masuk lebih dulu, dan melaporkan 110 tes yang lulus dengan dependensi tersebut diterapkan.

• Modul encoding baru adalah vllm/tokenizers/deepseek_v41_encoding.py — file terpisah, bukan cabang di dalam encoding V4, yang menunjukkan bahwa tata bahasa tag-nya benar-benar berbeda, bukan sekadar diperluas.

• Pemanggilan bersifat eksplisit: --tool-parser deepseek_v41. Tidak ada fallback deteksi otomatis yang diam-diam melakukan hal yang benar.

Tag yang diberi spasi adalah inti dari semuanya.

Alasan sebuah parser baru ada alih-alih ekspresi reguler yang diperlebar adalah spasi. DeepSeek V4.1 Flash menulis tag alat DSML-nya dengan spasi di antara token. Pola detektor V4 mengharapkan bentuk tanpa spasi, sehingga gagal mencocokkan, dan pencocokan yang gagal dalam parser panggilan alat bersifat senyap secara desain — teks diteruskan sebagai konten alih-alih memunculkan kesalahan.

Mode kegagalan itu layak direnungkan karena itulah jenis yang paling mahal. Parser yang melempar error bisa diperbaiki dalam satu sore. Parser yang mengembalikan string yang valid tetapi berisi markup yang tidak pernah diminta oleh pemanggil tampak seperti masalah kualitas model, dan tim menanggapinya seperti Anda menanggapi masalah kualitas model: mereka mencoba prompt yang berbeda, menambahkan contoh, mengganti model. Dua belas hari cukup lama untuk banyak hal semacam itu terjadi secara tertutup.

Ini juga berarti perbaikannya bukan sekadar kenop penyetelan. Anda tidak bisa sekadar mengandalkan prompt untuk mengatasi detektor yang tidak cocok dengan format keluaran model Anda, dan Anda tidak bisa memperbaikinya di klien melalui pascapemrosesan, karena saat teks mencapai klien Anda, strukturnya sudah hilang. Perbaikan itu harus terjadi di stack penyajian, yang memang merupakan tempatnya sekarang.

Mengapa hal ini lebih penting bagi V4.1 Flash daripada bagi V4

Pemanggilan tool bukan sekadar fitur tambahan untuk model khusus ini. DeepSeek V4.1 Flash adalah model mixture-of-experts dengan 552 miliar parameter, dengan 8 miliar parameter aktif pada input dan 16 miliar aktif pada output, jendela konteks 1M token dan output maksimum 384K token. Pemisahan aktivasi adalah petunjuknya: model ini dibangun untuk menerima input besar — repositori, kumpulan dokumen, jejak tool yang panjang — dan menghasilkan respons terstruktur yang panjang. Itu adalah bentuk agen, bukan bentuk chat.

Sisa spesifikasi peluncuran mengarah ke arah yang sama. Bobot berlisensi MIT, cache KV 890 byte per token, 45 triliun token prapelatihan, visi native. Angka cache KV adalah yang penting secara operasional pada konteks 1M: itulah yang membuat transkrip agen yang panjang terjangkau untuk tetap berada di memori, dan itulah sebabnya model ini masuk akal sebagai pekerja murah dalam sebuah loop yang diawasi oleh model yang lebih mahal.

Single-model scoreboard for DeepSeek V4.1 Flash: 552B total parameters in a mixture-of-experts design with 8B active on input and 16B on output, 1M-token context window, 384K max output, $0.15 input and $0.60 output per 1M tokens off-peak, and an 890-byte KV cache per token, footnoted as specs from DeepSeek's own release page with no independent tool-calling score yet

Yang menjadikan kesenjangan pemanggilan alat selama dua belas hari sebagai biaya nyata, bukan sekadar catatan kaki. Model yang dasar ekonominya bertumpu pada posisinya sebagai eksekutor bervolume tinggi dalam pipeline agen akan nyaris tidak bernilai jika pipeline tersebut tidak dapat memperoleh panggilan terstruktur darinya.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

Apa yang masih buka?

Gambaran jujur tentang situasi terkini, per 22 September 2026:

• Jalur frontend Rust (PR #56235) adalah jalur dengan cakupan pengujian penuh, baik pada kasus V4.1 yang baru maupun suite yang sudah ada sebelumnya. Jika Anda menggunakan build vLLM yang menyertakannya, parser tersebut sudah tersedia untuk Anda hari ini.

• Jalur frontend Python (PR #56408) masih berupa draf dan memiliki dependensi eksternal. Jika Anda dipatok pada build yang mendahului perubahan XGrammar, frontend Python belum akan memberi Anda parsing tool V4.1.

• Karena pemanggilannya eksplisit, deployment yang meningkatkan vLLM tetapi tidak mengubah flag peluncurannya akan mempertahankan perilaku lama. Parser yang ada dan parser yang digunakan adalah dua hal yang berbeda.

• Belum ada bukti publik tentang benchmark pemanggilan alat independen yang dijalankan terhadap V4.1 Flash dengan parser baru yang sudah terpasang. Yang kita tahu adalah bahwa infrastrukturnya berfungsi dan tesnya lulus. Apakah kualitas pemanggilan alat model tersebut bagus adalah pertanyaan terpisah yang tidak dijawab oleh merge ini.

Poin terakhir itulah yang perlu dipegang. Perbaikan parser memindahkan model dari "tidak dapat dievaluasi" menjadi "dapat dievaluasi." Itu adalah prasyarat untuk sebuah putusan, bukan putusannya.

Jika Anda tidak ingin menjalankan stack serving sendiri

Ada jalur yang lebih singkat. DeepSeek V4.1 Flash tersedia melalui endpoint OrcaRouter untuk model itu, yang berarti perilaku tool-calling datang sebagai panggilan API normal alih-alih sebagai masalah build — tidak ada versi XGrammar yang harus dicocokkan, tidak ada frontend yang harus dipilih, tidak ada flag peluncuran yang perlu diingat. Alasan hal itu penting secara khusus di sini adalah bahwa perbaikan tersebut mendarat di dua tempat dengan tingkat kematangan yang berbeda, dan endpoint yang dihosting meniadakan keputusan itu.

Kunci yang sama juga menjangkau model-model lainnya yang akan Anda bandingkan, yang merupakan properti berguna ketika pertanyaannya bukan "apakah parser ini benar" melainkan "apakah model ini cukup baik untuk loop saya." Anda dapat menempatkan DeepSeek V4.1 Flash di balik aturan perutean sebagai eksekutor murah dan melakukan failover ke model yang lebih kuat saat panggilan gagal, tanpa kontrak kedua atau SDK kedua. Mencoba model yang dukungan pemanggilan alatnya baru berusia dua minggu adalah tepat situasi yang menjadi alasan failover otomatis ada.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and observed time to first token of 2.63 s at p50 and 9.05 s at p95

Tontonan Berikutnya

Tiga hal akan mengubah ini dari cerita perpipaan menjadi sebuah putusan:

• PR #56408 keluar dari draf, yang akan membuat jalur frontend Python menjadi nyata dan mengakhiri situasi dukungan dua tingkat.

• Evaluasi agen independen atau pemanggilan alat yang dijalankan terhadap V4.1 Flash pada stack penyajian tetap. Model ini sudah beredar selama dua belas hari dan parser telah dapat digunakan kurang dari itu, jadi skor pemanggilan alat apa pun yang Anda lihat dikutip untuknya saat ini layak dipertanyakan — penyiapannya sama pentingnya dengan modelnya.

• Apakah stack serving lain mengikuti. vLLM adalah yang memiliki PR publik; masalah tag berspasi bukan khusus vLLM, jadi stack mana pun yang mengadopsi detektor V4 tanpa menurunkannya ulang dari output V4.1 memiliki kegagalan senyap yang sama di dalamnya.

Sampai hal pertama dari itu terwujud, ringkasan yang akurat bersifat sempit dan layak dinyatakan secara terus terang: DeepSeek V4.1 Flash adalah model GA dengan bobot MIT, konteks 1M dan batas atas keluaran 384K, dan tool calling-nya kini berfungsi pada jalur Rust di vLLM dengan flag parser yang eksplisit. Itu adalah langkah nyata dan belum menjadi sebuah hasil.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari