Kartu judul yang bertuliskan "DeepSeek's 3T Model" dengan subjudul "Klaim 3 triliun parameter, tabel memori Engram 1T, dan klaster yang baru tersedia paling cepat 2027", di atas tiga tile ikon yang bertuliskan "3T — parameter: belum terverifikasi", "~1T — Engram: perkiraan penulis sendiri", dan "Klaster — paling cepat akhir 2027", dengan baris footer yang berbunyi "Kebocoran sumber tunggal; tidak ada repositori, kartu model, atau baris harga yang ada."
Guides & Insights

Model 3T DeepSeek: Peningkatan Skala yang Harus Menunggu Klaster

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada tanggal 14 September, Deep​Seek akan menghentikan DeepSeek V4 Pro — model unggulan dengan 1,6 triliun parameter yang dirilis untuk umum pada 13 Agustus — dan menjawab setiap panggilan ke deepseek-v4-pro dengan DeepSeek V4.1 Flash, model dengan 552 miliar parameter yang dirilis pada 10 September. Empat hari sebelum peralihan itu diumumkan, seorang pengamat Deep​Seek yang menggunakan nama samaran memposting sesuatu yang justru mengarah ke arah sebaliknya: bahwa lab tersebut sedang mengerjakan model dengan 3 triliun parameter, "mungkin Engram lain dengan 1T parameter," dan bahwa alasan model itu belum dirilis adalah ekonomi, bukan kapabilitas.

Tidak ada yang pasti tentang model itu. Tidak ada nama, tidak ada repositori, tidak ada file konfigurasi, tidak ada tolok ukur, tidak ada jendela rilis — satu unggahan X, bersumber dari "otoritas yang baik," dengan satu detail paling menariknya secara eksplisit ditandai oleh penulisnya sendiri sebagai spekulasi. Anggap itu sebagai sinyal, bukan fakta. Tetap layak dibaca, karena dua bagian dari klaim tersebut menarik ke arah yang berlawanan dan hanya satu yang mungkin akan bertahan saat bersentuhan dengan peta jalan Deep​Seek sendiri.

Apa yang sebenarnya dikatakan bocoran tersebut, dan apa yang tidak

Postingan tersebut berasal dari akun teortaxesTex, seorang pengamat Deep​Seek yang sudah lama, yang menggambarkan dirinya sebagai penggemar lab tersebut sejak 2023. Bunyinya selengkapnya: "Sebenarnya saya mendapat informasi dari sumber terpercaya bahwa Deep​Seek sedang mengerjakan model 3T (backbone, mungkin param Engram 1T lagi, tapi itu spekulasi saya). Mereka hanya tidak yakin apakah akan ekonomis untuk post-train dan menyajikannya. Ketika kluster mereka tumbuh, kita akan melihat beberapa..."

Ada empat hal dalam dua kalimat itu yang berbobot, dan salah satunya sama sekali bukan fakta. "Otoritas yang baik" tidak disebutkan namanya. Jumlah parameter muncul sebagai satu angka tanpa pemisahan antara total dan aktif. Catatan sampingan tentang Engram diberi label spekulasi oleh orang yang membuat spekulasi itu. Dan "ketika kluster mereka tumbuh" adalah sebuah kondisional tanpa tanggal yang melekat padanya.

• Apa yang diklaim — bahwa model Deep​Seek dengan 3 triliun parameter ada dalam tahap pengembangan tertentu.

• Apa yang secara eksplisit merupakan tebakan penulis sendiri — bahwa kira-kira 1T dari itu adalah memori Engram.

• Yang tidak diketahui — namanya, arsitekturnya, jumlah parameter aktif, jendela konteks, status pelatihan, dan apakah ia benar-benar dirilis sebagai sebuah produk.

• Apa yang dapat diverifikasi saat ini — tidak ada. Tidak ada repositori Deep​Seek, kartu model, baris harga, atau entri dokumen yang menyebutkannya.

Bahkan aritmetikanya saja ambigu. "Model 3T (backbone, mungkin 1T parameter Engram lainnya)" mendukung dua pembacaan: model 3T yang sekitar 1T-nya adalah Engram, atau backbone 3T dengan tambahan 1T Engram di sampingnya, totalnya kira-kira 4T. Kesenjangan itu selebar satu triliun parameter, dan itu mengubah biaya serving lebih besar daripada yang dikeluarkan sebagian besar lab untuk sekali training run.

Perlu juga diingat bahwa rekam jejak akun ini campuran, bukan sempurna layaknya orakel. Ia membaca pemberitahuan Deep​Seek pada 9 September tentang pengalihan lalu lintas V4 Pro sebagai bukti bahwa laboratorium tersebut telah "memecahkan masalah arsitektur keluarga V4" — sebuah inferensi yang masuk akal, dan tetaplah sebuah inferensi. Pada awal September ia juga melontarkan gagasan bahwa model siluman anonim di platform pengodean pihak ketiga adalah Xiaomi MiMo-V3-Flash, yang belum dikonfirmasi oleh siapa pun. Sinyal awal yang berguna; bukan sumber rujukan.

Bagian yang menarik adalah tabel memori, bukan jumlah parameter.

Engram itu nyata, dan itulah alasan klaim 3T lebih masuk akal daripada yang terdengar. DeepSeek menerbitkan arsitektur memori kondisional pada Januari 2026 dengan kode sumber terbuka yang dilampirkan, dan ia melakukan sesuatu yang tidak biasa: ia memisahkan pengambilan pengetahuan statis dari penalaran dinamis. Alih-alih menghabiskan komputasi GPU untuk mengingat fakta, model tersebut me-hash konteksnya ke dalam tabel embedding yang disimpan di DRAM dan mengambilnya dalam waktu konstan, tanpa kerja GPU pada jalur pencarian, plus mekanisme gerbang yang menekan memori yang diambil ketika bertentangan dengan konteks sekitarnya.

Angka-angka yang dilaporkan Deep​Seek untuk konfigurasi pengujiannya sendiri itulah yang perlu dipegang: tabel embedding 100 miliar parameter yang diturunkan ke DRAM dengan penalti throughput di bawah 3%, dan akurasi needle-in-a-haystack 97% pada 1M token dibandingkan 84,2% untuk attention standar. Itu adalah angka laboratorium mereka sendiri, bukan hasil reproduksi kami. Evaluasi independen awal dilaporkan berada di kisaran 93–96% pada panjang konteks yang sama — jelas di atas baseline, di bawah klaim tersebut.

Perbesar ide itu sepuluh kali lipat dan bentuk kebocoran pun berubah. Jika sebagian besar parameter tambahan model 3T adalah memori tabel hash yang berada di DRAM, bukan para expert yang bersaing memperebutkan HBM, maka "3T" tidak lagi menjadi proksi untuk "tidak dapat dilayani". Jumlah total parameter dan biaya serving menjadi terpisah. Itulah ide yang benar-benar baru dalam kebocoran ini, dan itulah bagian yang memang didukung oleh penelitian yang diterbitkan.

Catatannya adalah bahwa makalah Engram dilaporkan tidak membahas overhead waktu inferensi — latensi dan throughput — yang justru merupakan tempat di mana tabel pencarian yang berada di DRAM akan muncul jika memang muncul di suatu tempat. Memori yang harus Anda ambil bukanlah memori yang Anda dapatkan secara gratis.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

Mengapa September Deep​Seek sendiri berpendapat sebaliknya

Argumen menentang produk 3T yang segera dirilis adalah bahwa Deep​Seek baru saja menjalankan eksperimen pada 1.6T dan menjawab pertanyaannya sendiri dengan sesuatu yang lebih kecil. Tangga V4 seperti yang ada saat ini:

DeepSeek-V4-Flash-0731 — 284B total parameter, 13B aktif per token.

DeepSeek-V4-Pro-0813 — 1,6T total, 49B aktif, bobot terbuka di bawah lisensi MIT.

• DeepSeek V4.1 Flash — backbone 552B pada desain Causal Encoder-Decoder yang mengaktifkan 8B parameter per token saat prefill dan 16B saat decode.

Pada 14 September pukul 12.00 waktu Beijing, anak tangga tengah dicabut. DeepSeek menonaktifkan V4 Pro dan mengalihkan permintaan untuk deepseek-v4-pro ke V4.1 Flash, ditagih dengan tarif Flash, sampai V4.1 Pro tersedia. Halaman harga resmi hari ini memuat dua baris, dan tidak ada satu pun yang merupakan penerus model yang dipensiunkan dari segi ukuran: deepseek-flash dengan $0.30 per juta token input dan $1.20 per juta token output pada jam sibuk, deepseek-v4-pro dengan $1.32 dan $3.96, dengan tarif di luar jam sibuk setengah dari angka-angka tersebut. Keduanya mencantumkan jendela konteks 1M token dan batas output 384,000 token.

Arah perjalanannya tidaklah samar. Sebuah laboratorium yang memensiunkan model terbesarnya demi model yang mengaktifkan sepersepuluh parameter per token telah menyimpulkan bahwa unit ekonomis dari kapabilitas mutakhir bukanlah checkpoint terbesar yang dapat dilatihnya. Model 3T yang pembuatnya tidak yakin dapat 'dilatih lebih lanjut dan disajikan secara ekonomis' bukanlah desas-desus tentang keraguan; itu menggambarkan laboratorium yang kini memiliki data terukur mengenai alternatif tersebut.

{{1}}Pasca-pelatihan{{/1}} adalah bagian yang lebih tajam dari masalah tersebut. Pasca-pelatihan parameter penuh dari lini DeepSeek-V4-Pro pada SuperPOD CloudMatrix384 milik Huawei telah dilaporkan oleh proyek SLAI T-Rex pihak ketiga pada 34,22% MFU, kira-kira 2,93 kali lipat dari resep baseline terbuka. Itu adalah angka yang menggembirakan — angka pihak ketiga, pada model 1,6T. Menggandakan backbone {{2}}secara kasar melipatgandakan biaya sebelum satu token pun dilayani.{{/2}}

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

Ketika klaster mereka tumbuh

Klausa penopang dalam kebocoran ini adalah yang terakhir, karena hanya bagian itulah yang memiliki jejak kertas publik. Deep​Seek dilaporkan berencana menggunakan setidaknya 160.000 akselerator Ascend 950DT Huawei di pusat data baru di Ulanqab, Mongolia Dalam, dengan nilai pesanan sekitar $2,56 miliar — salah satu klaster silikon AI buatan China terbesar yang pernah dicoba.

Catatan-catatan yang melekat pada rencana itu lebih penting daripada tajuk utamanya. Chip-chip tersebut direncanakan untuk inferensi, bukan pelatihan: DeepSeek telah mencoba pelatihan pada silikon Huawei sebelumnya dan masih melatih pada akselerator Nvidia, yang merupakan langkah yang sebenarnya dibutuhkan model 3T. Pengiriman bisa memakan waktu lebih dari satu tahun. Kapasitas parsial diharapkan beroperasi pada akhir 2027 hingga awal 2028. Dan pasokan memori bandwidth tinggi, bukan logika, diperkirakan akan membatasi berapa banyak unit 950DT yang dapat diproduksi Huawei tahun ini.

Jadi, pembacaan optimistis dari {{1}}ketika kluster mereka tumbuh{{/1}} menempatkan model 3T pada jadwal 2027–2028 paling cepat, dan pembacaan pesimistis — bahwa model itu tetap artefak riset dan tidak pernah menjadi produk — konsisten dengan semua yang telah {{KEEP}}Deep​Seek{{/KEEP}} rilis pada 2026. Lingkungan komputasi di sekitar laboratorium juga merupakan kebijakan yang diperebutkan, bukan sekadar soal pasokan murni: pada 8–9 September, NSA, FBI, dan CISA bersama-sama menuduh bahwa enam laboratorium Tiongkok, termasuk {{KEEP}}Deep​Seek{{/KEEP}}, mendistilasi model frontier AS dalam {{2}}"skala industri,"{{/2}} sebuah tuduhan yang ditolak oleh kementerian perdagangan Tiongkok. Apa pun penafsiran terhadap tuduhan tersebut, perilisan yang bergantung pada pertumbuhan kluster bergantung pada keputusan yang tidak dapat dikendalikan oleh siapa pun di dalam {{KEEP}}Deep​Seek{{/KEEP}}.

Apa yang akan mengubah ini dari kebocoran menjadi peluncuran

Daftar periksa ini singkat dan spesifik, dan belum ada satu pun yang terpicu:

• Sebuah repositori di bawah organisasi deepseek-ai di Hugging Face, dengan nama checkpoint berversi, bukan slug keluarga.

• Baris baru pada halaman Models & Pricing DeepSeek.

• Entri dengan tanggal pada umpan berita dokumentasi API, dalam format newsYYMMDD yang biasa digunakan lab.

• Pengidentifikasi model, bukan nama keluarga — versi DeepSeek adalah checkpoint, dan slug keluarga polos sejauh ini berarti pratinjau.

Tonggak yang lebih dekat adalah V4.1 Pro, yang dirujuk oleh anggota tim Deep​Seek pada 9 September sebagai titik akhir dari jendela perutean. Ia tidak memiliki spesifikasi yang dipublikasikan, tidak ada jumlah parameter, tidak ada harga, dan juga tidak ada tanggal. Dalam satu hal, V4.1 Pro adalah ujian dari kebocoran ini: jika andalan berikutnya hadir sekitar 1.6T milik V4 Pro atau di bawahnya, klaim 3T telah meleset setidaknya satu generasi.

Apa arti semua ini jika Anda memilih model minggu ini

Model 3T bukanlah keputusan pembelian pada 2026, dan pelajaran praktis dari September DeepSeek sama sekali bukan tentang skala. Pelajaran itu adalah bahwa model di balik sebuah endpoint dapat berubah sementara nama endpoint-nya tetap persis sama. Siapa pun yang memanggil deepseek-v4-promelalui lapisan abstraksi akan mendapatkan model yang berbeda, lebih kecil, dan lebih murah pada 14 September tanpa menyentuh kode mereka. Siapa pun yang terhubung langsung ke implementasi ID tersebut dari satu penyedia akan mendapatkan apa pun yang diputuskan penyedia tersebut.

Baik DeepSeek V4.1 Flash maupun DeepSeek V4 Pro tersedia di OrcaRouter dengan satu kunci tanpa markup — harga daftar penyedia diteruskan, yang berarti perubahan harga Deep​Seek per 10 September langsung aktif di sini pada hari yang sama sesuai daftar, bukan versi yang telah dinaikkan harganya. Halaman model menunjukkan $0,15 per juta token input dan $0,60 per juta token output pada periode off-peak, yang merupakan angka off-peak milik Deep​Seek sendiri tanpa tambahan apa pun. Failover otomatis antar penyedia adalah fitur yang tidak mencolok namun paling penting di minggu seperti ini: ketika vendor mengganti model dari sebuah endpoint, lapisan routing itulah yang mengubah hal tersebut menjadi perubahan konfigurasi, bukan migrasi.

Model DeepSeek 3T, jika suatu saat benar-benar dirilis, akan dilayani oleh siapa pun yang memiliki klaster untuk menampungnya, dengan harga yang ditentukan oleh biaya komputasi. Anda akan menjumpainya di lapisan perutean yang sama — tanpa kontrak kedua dan tanpa membangun ulang apa pun.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

Pertanyaan yang terbuka bukanlah apakah Deep​Seek dapat membangun model dengan 3 triliun parameter. {{1}}Tiga makalah arsitektur yang dipublikasikan, desain memori kerja, dan model 552B yang menurut pembuatnya mengungguli pendahulunya sendiri yang 1,6T semuanya menunjukkan bahwa laboratorium ini tahu caranya.{{/1}} Pertanyaannya adalah apakah ada yang mau membayar untuk menyajikannya — dan berdasarkan bukti dua minggu terakhir, Deep​Seek sendiri tidak yakin. {{2}}Perhatikan klusternya, bukan jumlah parameternya.{{/2}} Halaman harga akan memberi tahu Anda apa yang sebenarnya diluncurkan Deep​Seek lebih cepat daripada bocoran apa pun.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari