
Model 3T DeepSeek: Peningkatan Skala yang Harus Menunggu Klaster
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Pada tanggal 14 September, DeepSeek akan menghentikan DeepSeek V4 Pro — model unggulan dengan 1,6 triliun parameter yang dirilis untuk umum pada 13 Agustus — dan menjawab setiap panggilan ke deepseek-v4-pro dengan DeepSeek V4.1 Flash, model dengan 552 miliar parameter yang dirilis pada 10 September. Empat hari sebelum peralihan itu diumumkan, seorang pengamat DeepSeek yang menggunakan nama samaran memposting sesuatu yang justru mengarah ke arah sebaliknya: bahwa lab tersebut sedang mengerjakan model dengan 3 triliun parameter, "mungkin Engram lain dengan 1T parameter," dan bahwa alasan model itu belum dirilis adalah ekonomi, bukan kapabilitas.
Tidak ada yang pasti tentang model itu. Tidak ada nama, tidak ada repositori, tidak ada file konfigurasi, tidak ada tolok ukur, tidak ada jendela rilis — satu unggahan X, bersumber dari "otoritas yang baik," dengan satu detail paling menariknya secara eksplisit ditandai oleh penulisnya sendiri sebagai spekulasi. Anggap itu sebagai sinyal, bukan fakta. Tetap layak dibaca, karena dua bagian dari klaim tersebut menarik ke arah yang berlawanan dan hanya satu yang mungkin akan bertahan saat bersentuhan dengan peta jalan DeepSeek sendiri.
Apa yang sebenarnya dikatakan bocoran tersebut, dan apa yang tidak
Postingan tersebut berasal dari akun teortaxesTex, seorang pengamat DeepSeek yang sudah lama, yang menggambarkan dirinya sebagai penggemar lab tersebut sejak 2023. Bunyinya selengkapnya: "Sebenarnya saya mendapat informasi dari sumber terpercaya bahwa DeepSeek sedang mengerjakan model 3T (backbone, mungkin param Engram 1T lagi, tapi itu spekulasi saya). Mereka hanya tidak yakin apakah akan ekonomis untuk post-train dan menyajikannya. Ketika kluster mereka tumbuh, kita akan melihat beberapa..."
Ada empat hal dalam dua kalimat itu yang berbobot, dan salah satunya sama sekali bukan fakta. "Otoritas yang baik" tidak disebutkan namanya. Jumlah parameter muncul sebagai satu angka tanpa pemisahan antara total dan aktif. Catatan sampingan tentang Engram diberi label spekulasi oleh orang yang membuat spekulasi itu. Dan "ketika kluster mereka tumbuh" adalah sebuah kondisional tanpa tanggal yang melekat padanya.
• Apa yang diklaim — bahwa model DeepSeek dengan 3 triliun parameter ada dalam tahap pengembangan tertentu.
• Apa yang secara eksplisit merupakan tebakan penulis sendiri — bahwa kira-kira 1T dari itu adalah memori Engram.
• Yang tidak diketahui — namanya, arsitekturnya, jumlah parameter aktif, jendela konteks, status pelatihan, dan apakah ia benar-benar dirilis sebagai sebuah produk.
• Apa yang dapat diverifikasi saat ini — tidak ada. Tidak ada repositori DeepSeek, kartu model, baris harga, atau entri dokumen yang menyebutkannya.
Bahkan aritmetikanya saja ambigu. "Model 3T (backbone, mungkin 1T parameter Engram lainnya)" mendukung dua pembacaan: model 3T yang sekitar 1T-nya adalah Engram, atau backbone 3T dengan tambahan 1T Engram di sampingnya, totalnya kira-kira 4T. Kesenjangan itu selebar satu triliun parameter, dan itu mengubah biaya serving lebih besar daripada yang dikeluarkan sebagian besar lab untuk sekali training run.
Perlu juga diingat bahwa rekam jejak akun ini campuran, bukan sempurna layaknya orakel. Ia membaca pemberitahuan DeepSeek pada 9 September tentang pengalihan lalu lintas V4 Pro sebagai bukti bahwa laboratorium tersebut telah "memecahkan masalah arsitektur keluarga V4" — sebuah inferensi yang masuk akal, dan tetaplah sebuah inferensi. Pada awal September ia juga melontarkan gagasan bahwa model siluman anonim di platform pengodean pihak ketiga adalah Xiaomi MiMo-V3-Flash, yang belum dikonfirmasi oleh siapa pun. Sinyal awal yang berguna; bukan sumber rujukan.
Bagian yang menarik adalah tabel memori, bukan jumlah parameter.
Engram itu nyata, dan itulah alasan klaim 3T lebih masuk akal daripada yang terdengar. DeepSeek menerbitkan arsitektur memori kondisional pada Januari 2026 dengan kode sumber terbuka yang dilampirkan, dan ia melakukan sesuatu yang tidak biasa: ia memisahkan pengambilan pengetahuan statis dari penalaran dinamis. Alih-alih menghabiskan komputasi GPU untuk mengingat fakta, model tersebut me-hash konteksnya ke dalam tabel embedding yang disimpan di DRAM dan mengambilnya dalam waktu konstan, tanpa kerja GPU pada jalur pencarian, plus mekanisme gerbang yang menekan memori yang diambil ketika bertentangan dengan konteks sekitarnya.
Angka-angka yang dilaporkan DeepSeek untuk konfigurasi pengujiannya sendiri itulah yang perlu dipegang: tabel embedding 100 miliar parameter yang diturunkan ke DRAM dengan penalti throughput di bawah 3%, dan akurasi needle-in-a-haystack 97% pada 1M token dibandingkan 84,2% untuk attention standar. Itu adalah angka laboratorium mereka sendiri, bukan hasil reproduksi kami. Evaluasi independen awal dilaporkan berada di kisaran 93–96% pada panjang konteks yang sama — jelas di atas baseline, di bawah klaim tersebut.
Perbesar ide itu sepuluh kali lipat dan bentuk kebocoran pun berubah. Jika sebagian besar parameter tambahan model 3T adalah memori tabel hash yang berada di DRAM, bukan para expert yang bersaing memperebutkan HBM, maka "3T" tidak lagi menjadi proksi untuk "tidak dapat dilayani". Jumlah total parameter dan biaya serving menjadi terpisah. Itulah ide yang benar-benar baru dalam kebocoran ini, dan itulah bagian yang memang didukung oleh penelitian yang diterbitkan.
Catatannya adalah bahwa makalah Engram dilaporkan tidak membahas overhead waktu inferensi — latensi dan throughput — yang justru merupakan tempat di mana tabel pencarian yang berada di DRAM akan muncul jika memang muncul di suatu tempat. Memori yang harus Anda ambil bukanlah memori yang Anda dapatkan secara gratis.

Mengapa September DeepSeek sendiri berpendapat sebaliknya
Argumen menentang produk 3T yang segera dirilis adalah bahwa DeepSeek baru saja menjalankan eksperimen pada 1.6T dan menjawab pertanyaannya sendiri dengan sesuatu yang lebih kecil. Tangga V4 seperti yang ada saat ini:
• DeepSeek-V4-Flash-0731 — 284B total parameter, 13B aktif per token.
• DeepSeek-V4-Pro-0813 — 1,6T total, 49B aktif, bobot terbuka di bawah lisensi MIT.
• DeepSeek V4.1 Flash — backbone 552B pada desain Causal Encoder-Decoder yang mengaktifkan 8B parameter per token saat prefill dan 16B saat decode.
Pada 14 September pukul 12.00 waktu Beijing, anak tangga tengah dicabut. DeepSeek menonaktifkan V4 Pro dan mengalihkan permintaan untuk deepseek-v4-pro ke V4.1 Flash, ditagih dengan tarif Flash, sampai V4.1 Pro tersedia. Halaman harga resmi hari ini memuat dua baris, dan tidak ada satu pun yang merupakan penerus model yang dipensiunkan dari segi ukuran: deepseek-flash dengan $0.30 per juta token input dan $1.20 per juta token output pada jam sibuk, deepseek-v4-pro dengan $1.32 dan $3.96, dengan tarif di luar jam sibuk setengah dari angka-angka tersebut. Keduanya mencantumkan jendela konteks 1M token dan batas output 384,000 token.
Arah perjalanannya tidaklah samar. Sebuah laboratorium yang memensiunkan model terbesarnya demi model yang mengaktifkan sepersepuluh parameter per token telah menyimpulkan bahwa unit ekonomis dari kapabilitas mutakhir bukanlah checkpoint terbesar yang dapat dilatihnya. Model 3T yang pembuatnya tidak yakin dapat 'dilatih lebih lanjut dan disajikan secara ekonomis' bukanlah desas-desus tentang keraguan; itu menggambarkan laboratorium yang kini memiliki data terukur mengenai alternatif tersebut.
{{1}}Pasca-pelatihan{{/1}} adalah bagian yang lebih tajam dari masalah tersebut. Pasca-pelatihan parameter penuh dari lini DeepSeek-V4-Pro pada SuperPOD CloudMatrix384 milik Huawei telah dilaporkan oleh proyek SLAI T-Rex pihak ketiga pada 34,22% MFU, kira-kira 2,93 kali lipat dari resep baseline terbuka. Itu adalah angka yang menggembirakan — angka pihak ketiga, pada model 1,6T. Menggandakan backbone {{2}}secara kasar melipatgandakan biaya sebelum satu token pun dilayani.{{/2}}

Ketika klaster mereka tumbuh
Klausa penopang dalam kebocoran ini adalah yang terakhir, karena hanya bagian itulah yang memiliki jejak kertas publik. DeepSeek dilaporkan berencana menggunakan setidaknya 160.000 akselerator Ascend 950DT Huawei di pusat data baru di Ulanqab, Mongolia Dalam, dengan nilai pesanan sekitar $2,56 miliar — salah satu klaster silikon AI buatan China terbesar yang pernah dicoba.
Catatan-catatan yang melekat pada rencana itu lebih penting daripada tajuk utamanya. Chip-chip tersebut direncanakan untuk inferensi, bukan pelatihan: DeepSeek telah mencoba pelatihan pada silikon Huawei sebelumnya dan masih melatih pada akselerator Nvidia, yang merupakan langkah yang sebenarnya dibutuhkan model 3T. Pengiriman bisa memakan waktu lebih dari satu tahun. Kapasitas parsial diharapkan beroperasi pada akhir 2027 hingga awal 2028. Dan pasokan memori bandwidth tinggi, bukan logika, diperkirakan akan membatasi berapa banyak unit 950DT yang dapat diproduksi Huawei tahun ini.
Jadi, pembacaan optimistis dari {{1}}ketika kluster mereka tumbuh{{/1}} menempatkan model 3T pada jadwal 2027–2028 paling cepat, dan pembacaan pesimistis — bahwa model itu tetap artefak riset dan tidak pernah menjadi produk — konsisten dengan semua yang telah {{KEEP}}DeepSeek{{/KEEP}} rilis pada 2026. Lingkungan komputasi di sekitar laboratorium juga merupakan kebijakan yang diperebutkan, bukan sekadar soal pasokan murni: pada 8–9 September, NSA, FBI, dan CISA bersama-sama menuduh bahwa enam laboratorium Tiongkok, termasuk {{KEEP}}DeepSeek{{/KEEP}}, mendistilasi model frontier AS dalam {{2}}"skala industri,"{{/2}} sebuah tuduhan yang ditolak oleh kementerian perdagangan Tiongkok. Apa pun penafsiran terhadap tuduhan tersebut, perilisan yang bergantung pada pertumbuhan kluster bergantung pada keputusan yang tidak dapat dikendalikan oleh siapa pun di dalam {{KEEP}}DeepSeek{{/KEEP}}.
Apa yang akan mengubah ini dari kebocoran menjadi peluncuran
Daftar periksa ini singkat dan spesifik, dan belum ada satu pun yang terpicu:
• Sebuah repositori di bawah organisasi deepseek-ai di Hugging Face, dengan nama checkpoint berversi, bukan slug keluarga.
• Baris baru pada halaman Models & Pricing DeepSeek.
• Entri dengan tanggal pada umpan berita dokumentasi API, dalam format newsYYMMDD yang biasa digunakan lab.
• Pengidentifikasi model, bukan nama keluarga — versi DeepSeek adalah checkpoint, dan slug keluarga polos sejauh ini berarti pratinjau.
Tonggak yang lebih dekat adalah V4.1 Pro, yang dirujuk oleh anggota tim DeepSeek pada 9 September sebagai titik akhir dari jendela perutean. Ia tidak memiliki spesifikasi yang dipublikasikan, tidak ada jumlah parameter, tidak ada harga, dan juga tidak ada tanggal. Dalam satu hal, V4.1 Pro adalah ujian dari kebocoran ini: jika andalan berikutnya hadir sekitar 1.6T milik V4 Pro atau di bawahnya, klaim 3T telah meleset setidaknya satu generasi.
Apa arti semua ini jika Anda memilih model minggu ini
Model 3T bukanlah keputusan pembelian pada 2026, dan pelajaran praktis dari September DeepSeek sama sekali bukan tentang skala. Pelajaran itu adalah bahwa model di balik sebuah endpoint dapat berubah sementara nama endpoint-nya tetap persis sama. Siapa pun yang memanggil deepseek-v4-promelalui lapisan abstraksi akan mendapatkan model yang berbeda, lebih kecil, dan lebih murah pada 14 September tanpa menyentuh kode mereka. Siapa pun yang terhubung langsung ke implementasi ID tersebut dari satu penyedia akan mendapatkan apa pun yang diputuskan penyedia tersebut.
Baik DeepSeek V4.1 Flash maupun DeepSeek V4 Pro tersedia di OrcaRouter dengan satu kunci tanpa markup — harga daftar penyedia diteruskan, yang berarti perubahan harga DeepSeek per 10 September langsung aktif di sini pada hari yang sama sesuai daftar, bukan versi yang telah dinaikkan harganya. Halaman model menunjukkan $0,15 per juta token input dan $0,60 per juta token output pada periode off-peak, yang merupakan angka off-peak milik DeepSeek sendiri tanpa tambahan apa pun. Failover otomatis antar penyedia adalah fitur yang tidak mencolok namun paling penting di minggu seperti ini: ketika vendor mengganti model dari sebuah endpoint, lapisan routing itulah yang mengubah hal tersebut menjadi perubahan konfigurasi, bukan migrasi.
Model DeepSeek 3T, jika suatu saat benar-benar dirilis, akan dilayani oleh siapa pun yang memiliki klaster untuk menampungnya, dengan harga yang ditentukan oleh biaya komputasi. Anda akan menjumpainya di lapisan perutean yang sama — tanpa kontrak kedua dan tanpa membangun ulang apa pun.

Pertanyaan yang terbuka bukanlah apakah DeepSeek dapat membangun model dengan 3 triliun parameter. {{1}}Tiga makalah arsitektur yang dipublikasikan, desain memori kerja, dan model 552B yang menurut pembuatnya mengungguli pendahulunya sendiri yang 1,6T semuanya menunjukkan bahwa laboratorium ini tahu caranya.{{/1}} Pertanyaannya adalah apakah ada yang mau membayar untuk menyajikannya — dan berdasarkan bukti dua minggu terakhir, DeepSeek sendiri tidak yakin. {{2}}Perhatikan klusternya, bukan jumlah parameternya.{{/2}} Halaman harga akan memberi tahu Anda apa yang sebenarnya diluncurkan DeepSeek lebih cepat daripada bocoran apa pun.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
