
Fugu Ultra v2 vs DeepSeek V4 Pro: pertanyaan harga output 34x
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Fugu Ultra v2 mengenakan biaya sekitar tiga puluh empat kali harga daftar DeepSeek V4 Pro untuk teks yang ditulisnya. Itu bukan salah ketik dan bukan artefak pembulatan: orkestrator baru Sakana AI dipatok $30,00 per juta token keluaran, DeepSeek melaporkan $0,87 per juta, dan pada satu-satunya tolok ukur yang angkanya diterbitkan kedua vendor, selisih performanya sama sekali bukan tiga puluh empat kali. Sakana mengklaim 74,3 pada DeepSWE untuk Fugu Ultra v2, yang dirilis 11 September 2026; DeepSeek melaporkan 62,7 untuk DeepSeek V4 Pro, model berbobot terbuka yang diluncurkannya pada Agustus. Keunggulan 11,6 poin yang dilaporkan vendor untuk harga keluaran 34x adalah keseluruhan perbandingan dalam satu baris — dan pertanyaan jujurnya bukanlah apakah Fugu Ultra v2 lebih baik, melainkan apakah ia lebih baik senilai sembilan belas dolar per juta token, dan untuk siapa.
Dua jawaban untuk masalah yang sama, dibangun dari ujung yang berlawanan
DeepSeek V4 Pro dan Fugu Ultra v2 sama-sama merupakan respons terhadap kegelisahan yang sama — ketergantungan pada satu vendor frontier tertutup — dan keduanya nyaris tidak bisa lebih berbeda dalam hal metode.
DeepSeek V4 Pro adalah sebuah model. Liputan peluncuran menetapkan peluncuran API versi resminya — build DeepSeek-V4-Pro-0813 — sekitar 12 hingga 13 Agustus 2026, menggantikan pratinjau 24 April. Ini adalah sistem mixture-of-experts yang dilaporkan memiliki 1,5 hingga 1,6 triliun parameter total dengan sekitar 49 miliar yang diaktifkan per token, membawa jendela konteks 1 juta token dan output maksimum 384 ribu token. Model ini bernalar dalam mode berpikir dan non-berpikir dengan tiga tingkat upaya, mendukung protokol API OpenAI dan Anthropic, serta menambahkan Responses API native yang diarahkan langsung ke harness agen bergaya Codex. Yang krusial, bobotnya diterbitkan di bawah MIT, yang berarti argumen ketahanan sudah dipastikan oleh kepemilikan: tidak ada yang dapat mencabut salinan Anda.
Fugu Ultra v2 bukanlah sebuah model. Ini adalah koordinator terlatih, dilaporkan sekitar 7B parameter, yang menguraikan permintaan ke seluruh kumpulan model yang tidak diungkapkan, menetapkan peran Thinker, Worker, dan Verifier, lalu menyintesis jawaban di balik satu endpoint yang kompatibel dengan OpenAI. Argumen ketahanannya bersifat arsitektural, bukan legal: karena kumpulan modelnya dapat ditukar, sistem ini dapat bertahan ketika vendor mana pun mengubah ketentuan. Versi 2.0, yang dirilis bersama Fugu Max, memindahkan batas waktu pelatihan ke 28 Agustus 2026 dan — yang patut dicatat — menghapus Claude Fable 5, Claude Fable 5.1, dan GPT-6 Astra sepenuhnya dari kumpulan model tersebut sambil tetap mengklaim menang atas mereka.
Jadi perbandingannya adalah kepemilikan versus koordinasi. DeepSeek memberi Anda model yang dapat Anda unduh, audit, fine-tune, dan jalankan sendiri dengan margin apa pun yang memungkinkan perangkat keras Anda sendiri. Sakana memberi Anda sistem yang memutuskan cara menangani setiap masalah, dengan tarif yang mendanai menjalankan beberapa model frontier atas nama Anda.

Apa yang sebenarnya bisa didapat dengan 34x
Benchmark dulu, dengan sumbernya di garis depan dan menjadi pusat perhatian. Setiap angka DeepSeek di bawah ini berasal dari vendor itu sendiri dan mendahului revisi harga peak/off-peak yang DeepSeek umumkan untuk pertengahan Agustus, yang angka akhirnya masih diperselisihkan sumber — satu laporan menempatkan output peak sekitar ¥27 per juta, laporan lain sekitar ¥12, terhadap basis ¥6. Verifikasi dengan daftar tarif yang diterbitkan DeepSeek sebelum Anda menyusun model anggaran. Setiap angka Fugu adalah milik Sakana sendiri, dan tidak ada pihak independen yang mereproduksi satu pun dari angka-angka itu; masih belum ada entri Artificial Analysis untuk model Fugu.
• DeepSWE — Fugu Ultra v2 74,3 (dilaporkan vendor) vs DeepSeek V4 Pro 62,7 (dilaporkan vendor)
• Terminal Bench 2.1 — tidak ada angka Fugu Ultra v2 yang dipublikasikan oleh Sakana vs DeepSeek V4 Pro 87.9 (dilaporkan vendor)
• SWE-bench (Vals) — tidak ada angka untuk Fugu Ultra v2 vs DeepSeek V4 Pro 96,4 (dilaporkan vendor)
• Humanity's Last Exam — tidak ada angka untuk Fugu Ultra v2 v2.0 vs DeepSeek V4 Pro 42,7 tanpa alat, 60,0 dengan alat (dilaporkan vendor)
• GPQA Diamond — tidak ada angka Fugu Ultra v2 v2.0 vs DeepSeek V4 Pro 92.8 (dilaporkan vendor)
• Harga output — Fugu Ultra v2 $30,00 per 1 juta, naik menjadi $45,00 di atas konteks 272K vs DeepSeek V4 Pro sekitar $0,87 per 1 juta harga daftar, dengan tarif terukur yang telah berjalan lebih tinggi
Dua catatan penting pada baris harga itu, karena seluruh perbandingan bergantung padanya. Pertama, angka DeepSeek adalah tarif daftar yang dilaporkan dalam liputan peluncuran dan dinyatakan ulang dalam deskripsi model kami sendiri, tetapi tarif terukur pada listing kami telah berjalan pada $2,18 per juta output dan $0,73 per juta input — perilaku cache dan bauran menggeser angka efektif, jadi kelipatan yang jujur berada di antara sekitar 14x dan sekitar 34x tergantung pada berapa banyak input Anda yang di-cache. Bahkan pada batas bawah rentang itu, biaya output lebih dari selusin kali lipat. Kedua, DeepSeek telah mengumumkan revisi harga peak/off-peak yang angka akhirnya masih diselisihkan sumber — satu laporan menempatkan output peak mendekati ¥27 per juta, laporan lain mendekati ¥12, terhadap basis ¥6. Verifikasi terhadap kartu tarif yang diterbitkan sebelum Anda menyusun anggaran.
• Harga input — Fugu Ultra v2 $5,00 per 1 juta, dua kali lipat di atas 272K vs DeepSeek V4 Pro sekitar $0,435 per 1 juta saat cache miss, kurang lebih 120x lebih murah saat cache hit
• Bobot — Fugu Ultra v2 tertutup, pool tidak diungkapkan, perutean tidak diekspos secara desain vs DeepSeek V4 Pro terbuka di bawah MIT, dapat dihosting sendiri
• Konteks dan output — Fugu Ultra v2 konteks 1M, batas output tidak dipublikasikan vs DeepSeek V4 Pro konteks 1M, batas output 384K
Masalah tumpang tindihnya jelas: kedua sistem hampir tidak muncul pada baris yang sama. Sakana menerbitkan lima kemenangan dari delapan tolok ukur yang dipilihnya; DeepSeek menerbitkan papan yang lebih luas yang mencakup cakupan agentik yang mendalam — MCP Atlas 73.6, Toolathlon-Verified 74.1, CyberGym 83.3, NL2Repo 61.5, CorpusQA 62.0 pada konteks panjang — di mana Fugu Ultra v2 tidak memiliki angka yang diterbitkan sama sekali. Satu-satunya baris yang dapat Anda sejajarkan, DeepSWE, adalah baris di mana Fugu mengklaim keunggulan rekayasa perangkat lunaknya yang terbesar. Pembaca yang membandingkan kedua rilis itu sedang membandingkan dua ujian yang berbeda.
Pengganda verbositas
Harga output bukanlah pajak linear atas orkestrasi; harga itu adalah pengganda pada kuantitas yang ditingkatkan oleh orkestrasi. Fugu Ultra v2 memunculkan agen-agen, yang masing-masing menghasilkan token penalaran dan output, sebelum seorang koordinator menyintesisnya. FAQ penetapan harga Sakana membuat komitmen yang benar-benar ramah konsumen — Anda membayar satu tarif campuran berdasarkan model tingkat teratas dalam kumpulan, dan menambahkan agen tidak melipatgandakan tagihan — yang membatasi skenario terburuk. Namun, itu tidak membatasi volume. Dengan $30 per juta token output, proses multi-agen yang mengeluarkan teks empat kali lipat dari panggilan model tunggal memakan biaya empat kali lipat, dan penggandanya berlipat ganda seiring tingkat output yang 34 kali lebih tinggi.
Bentuk biaya DeepSeek V4 Pro memberi imbalan pada perilaku yang berlawanan. Cache hit pada input kira-kira dua orde besaran lebih murah daripada cache miss, sehingga pekerjaan konteks panjang yang berulang — repositori yang sama, kumpulan dokumen yang sama, system prompt yang sama — jauh lebih murah daripada yang tersirat oleh tarif tertera. Bagi loop agen yang membaca ulang konteks yang sama pada setiap giliran, di situlah biaya efektifnya mendarat, dan itu adalah keunggulan struktural yang tidak dapat dilewati oleh orchestrator mana pun.
Gabungkan keduanya dan keputusannya menjadi konkret. Jika Fugu Ultra v2 memberikan keunggulan DeepSWE sebesar 11,6 poin dan menghasilkan tiga kali lipat token keluaran dibandingkan satu panggilan, Anda membayar sekitar seratus kali lebih mahal per tugas yang diselesaikan untuk perolehan sepuluh hingga lima belas poin pada satu tolok ukur. Pertukaran itu dapat dipertahankan untuk penelitian dan masalah rekayasa yang secara inheren sulit, di mana poin marginal adalah segalanya, dan tidak dapat dipertahankan untuk pipeline yang berjalan seratus ribu kali sehari.

Sebenarnya untuk siapa masing-masing
Pilih DeepSeek V4 Pro jika salah satu dari hal berikut ini benar: beban kerja Anda bervolume tinggi dan sensitif terhadap biaya; Anda memerlukan output yang lebih panjang daripada batas maksimum yang akan diberikan oleh orkestrator kepada Anda; Anda memerlukan sistem yang dapat Anda audit, fine-tune, atau jalankan di perangkat keras Anda sendiri karena alasan residensi data; atau Anda memerlukan harga yang merupakan angka yang dapat Anda hitung, bukan angka yang Anda amati. Lisensi MIT terbuka bukanlah fitur pemasaran — ini adalah bentuk terkuat dari argumen ketahanan yang diajukan oleh kedua sistem, karena tidak bergantung pada itikad baik vendor mana pun yang berkelanjutan. Harganya juga, sekitar $0.87 per sejuta output, cukup murah sehingga bereksperimen tidak memakan biaya apa pun.
Pilih Fugu Ultra v2 jika poin marginalnya bernilai kelipatan, pekerjaannya berjangka panjang, dan kebenarannya dapat diperiksa — pengodean dengan rangkaian tes, penalaran dokumen terstruktur, analisis multi-langkah di mana peran Verifier dapat menangkap kesalahan yang akan diloloskan oleh satu kali proses. Studi kasus Sakana sendiri menunjuk tepat pada hal ini: proses riset otonom selama empat belas jam, pemecah kubus Rubik yang menyelesaikan semua 300 pengacakan sementara dua baseline yang dianonimkan gagal total. Perlu diingat bahwa baseline tersebut dianonimkan dan dipilih vendor, yang melemahkan nilainya sebagai bukti dan tidak membuatnya salah. Ingat juga batasan yang mengakhiri diskusi bagi sebagian tim: Fugu Ultra v2 tidak dijual di EU atau EEA, dan Sakana menyatakannya secara terang-terangan.
Satu catatan praktis jika Anda berniat menjalankan salah satunya. Fugu Ultra v2 tidak ada di OrcaRouter — model ini diakses melalui API milik Sakana sendiri yang kompatibel dengan OpenAI dan beberapa platform pihak ketiga, dan peningkatan dari Fugu versi sebelumnya hanyalah perubahan parameter satu baris. DeepSeek V4 Pro tersedia di OrcaRouter dengan harga daftar penyedia dan markup 0%, yang di sini lebih penting daripada biasanya: DeepSeek telah mengumumkan satu revisi harga pada siklus ini, dan pada router pass-through, perubahan harga vendor langsung berlaku pada kunci yang sama di hari yang sama, bukan setelah negosiasi ulang. Jika Anda ingin mengukur keduanya terhadap beban kerja Anda sendiri sebelum memutuskan, sisi perbandingan yang lebih murah adalah sisi yang dapat Anda panggil dengan harga daftar dengan failover otomatis di belakangnya.

Putusan
Ini bukan pertarungan yang imbang secara ekonomi dan bukan pertarungan yang menentukan secara kapabilitas. DeepSeek V4 Pro adalah pilihan default yang lebih baik dengan selisih yang lebar: bobot terbuka yang dapat Anda pegang, batas keluaran 384K, konteks 1M, skor konteks panjang yang dipublikasikan, dan harga sekitar satu per tiga puluh empat dari harga output Fugu Ultra v2. Fugu Ultra v2 adalah instrumen yang lebih baik untuk kelas sempit masalah mahal, dan klaim Sakana — bahwa kumpulan tetap yang mengecualikan tiga model terkuat masih dapat mengalahkan mereka dalam pekerjaan yang dapat diverifikasi — adalah argumen arsitektural paling menarik di bidang ini saat ini, sekaligus yang paling sedikit didukung bukti independen.
Jalan keluar praktisnya bukanlah memilih. Jalankan DeepSeek V4 Pro sebagai default karena murah, terbuka, dan cepat, lalu simpan Fugu Ultra v2 sebagai cadangan untuk tugas-tugas ketika kenaikan biaya seratus kali lipat tetap lebih kecil daripada biaya jika salah. Yang tidak boleh Anda lakukan adalah membaca papan delapan benchmark Sakana sebagai bukti bahwa orkestrator mahal telah menggantikan model terbuka yang murah. Pada satu baris yang sama-sama mereka miliki, ia unggul 11,6 poin dengan harga output 34 kali lipat. Apakah itu kesepakatan bagus atau jebakan sepenuhnya bergantung pada masalah mana yang Anda arahkan kepadanya.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
