Kartu hero untuk pertarungan Fugu Ultra v2 versus Kimi K3, yang menampilkan model yang merutekan token ke para ahli di samping orkestrator yang merutekan tugas ke model.
Guides & Insights

Fugu Ultra v2 vs Kimi K3: Dua Router, Dua Ketinggian

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kedua sistem ini adalah router, dan itulah hal pertama yang terlewat oleh sebagian besar liputan. Kimi K3 adalah model Mixture-of-Experts dengan 2,8 triliun parameter yang mengaktifkan sekitar 104 miliar parameter per token — artinya, pada setiap token yang dihasilkannya, model ini membuat keputusan perutean, memilih 16 dari 896 expert-nya untuk melakukan pekerjaan tersebut. Fugu Ultra v2, yang diumumkan oleh Sakana AI pada 11 September 2026, adalah router pada tingkat yang sama sekali berbeda: ia menerima tugas yang masuk, memecahnya, lalu mengirimkan potongan-potongannya ke kumpulan model yang terpisah. Yang satu merutekan di dalam satu forward pass; yang lain merutekan di seluruh armada model. Memahami bahwa keduanya adalah gagasan yang sama pada dua skala adalah cara tercepat untuk melihat mengapa harga keduanya berbeda 2× pada input dan 5× pada output.

Dua router itu, berdampingan

Kimi K3 — Model unggulan Moonshot AI, dirilis pada pertengahan Juli 2026 dengan bobot terbuka yang diterbitkan pada 27 Juli 2026. Arsitekturnya tidak biasa bahkan menurut standar tahun 2026: 69 lapisan Kimi Delta Attention yang diselang-seling dengan 24 lapisan Gated MLA, Attention Residuals, desain "Stable LatentMoE", dan encoder visi MoonViT-V2 berparameter 401 juta. Bobotnya dikirim dalam MXFP4 dengan aktivasi MXFP8 di bawah pelatihan yang sadar kuantisasi. API yang dihosting mengekspos upaya penalaran dengan tepat satu nilai yang didukung — max.

Fugu Ultra v2 — Tingkat orkestrasi kemampuan puncak Sakana AI, dan bukan model dasar dalam pengertian biasa. Ini adalah endpoint tunggal yang kompatibel dengan OpenAI yang menguraikan tugas dan mengirimkannya ke seluruh kumpulan model open-weight dan model khusus. Sakana menyatakan bahwa Claude Fable 5, Claude Fable 5.1 dan GPT-6 Astra dikecualikan dari kumpulan itu, dan mencantumkan batas pelatihan 20260828. Tidak ada jumlah parameter yang dipublikasikan, karena tidak ada parameter untuk dihitung seperti yang akan Anda lakukan untuk K3 — kemampuannya terletak pada kebijakan penjadwalan.

Konsekuensinya adalah bahwa K3 adalah komponen dan Fugu Ultra v2 adalah rakitan. Itu membuat perbandingan ini tidak biasa: keduanya bukan hanya pesaing, melainkan juga bahan potensial. Model seperti K3 persis jenis sistem bobot terbuka, konteks panjang, dan pemanggilan alat yang secara masuk akal akan disewa oleh orkestrator. Sakana tidak mempublikasikan keanggotaan kumpulan tersebut, jadi apakah K3 ada di dalam Fugu Ultra v2 tidak diketahui — tetapi jika ya, sebagian dari yang Anda bayar untuk tarif Fugu adalah token K3 dengan markup.

Apa sebenarnya kesenjangan harga itu

Input — Fugu Ultra v2 pada harga yang dilaporkan $5,00 per 1J (daftar pihak ketiga; halaman pengumuman Sakana tidak mempublikasikan tarifnya sendiri) vs Kimi K3 pada $3,00 per 1J, dengan cache hit sebesar $0,30.

Keluaran — Fugu Ultra v2 dengan harga yang dilaporkan $30,00 per 1 juta vs Kimi K3 $15,00 per 1 juta. Setengah harganya, untuk model yang juga dapat Anda unduh.

Input cache — Fugu Ultra v2 $0.50 per 1 juta vs Kimi K3 $0.30 per 1 juta pada cache hit. Dalam loop agen yang panjang dengan system prompt yang stabil, selisih tersebut terakumulasi di setiap giliran.

Penjenjangan konteks — Kimi K3 tetap sama di seluruh jendela 1.048.576 token-nya tanpa penalti konteks panjang. Tingkat yang dilaporkan untuk Fugu Ultra v2 di atas sekitar 272.000 token masukan mengalihkan seluruh permintaan ke sekitar $10,00 / $45,00.

Baris terakhir itulah yang menentukan tagihan sebenarnya. Satu kali jalan agen dengan horizon panjang menghabiskan sebagian besar masa hidupnya di atas 272K token, dan di situlah tarif datar K3 tetap datar sementara tarif Fugu Ultra v2 berlipat dua. Jika beban kerja Anda seperti itu, selisih efektif di sisi input lebih mendekati 3,3× daripada 1,7×.

Two-column comparison scoreboard for Fugu Ultra v2 and Kimi K3 covering type, release date, input price ($5.00 vs $3.00 per million tokens), output price ($30.00 vs $15.00), cached input ($0.50 vs $0.30) and long-context pricing (reprices above roughly 272K vs flat to 1M).

Satu angka yang mereka miliki bersama

Kedua vendor melaporkan DeepSWE, dan perbandingannya kurang menguntungkan bagi Fugu dibandingkan yang disiratkan oleh framing peluncurannya. Sakana mencantumkan Fugu Ultra v2 pada 74,3. Moonshot mencantumkan Kimi K3 pada 67,5 — dilaporkan vendor, dari kartu model. Itu adalah selisih 6,8 poin pada benchmark agen coding, yang memang nyata, tetapi itu hanya satu tes dari kumpulan yang jauh lebih besar yang dipublikasikan, dan itu adalah tes yang sama yang membuat Sakana unggul 1,6 poin terhadap GPT-5.6 Sol. Sebuah benchmark di mana tiga vendor berbeda semuanya berkumpul dalam rentang tujuh poin mengukur sesuatu yang nyata tetapi tidak memisahkan mereka secara meyakinkan.

Selain itu, keduanya mempublikasikan pada level yang benar-benar berbeda. Angka K3 milik Moonshot mencakup Terminal-Bench 2.1 sebesar 88,3, GPQA Diamond 93,5, HLE-Full 43,5 (56,0 dengan alat), SWE-Marathon 42,0, OSWorld-Verified 84,8, dan MCPMark-Verified 94,5 — semuanya dilaporkan vendor, semuanya tercantum di kartu model. Delapan tolok ukur Sakana untuk Fugu Ultra v2 mencakup dua tolok ukur internal, SWEFish dan Toolathon, yang tidak dapat direproduksi oleh siapa pun di luar Sakana.

Secara independen, hanya satu di antaranya yang bahkan telah diukur. Kimi K3 memperoleh skor 44 pada Artificial Analysis Intelligence Index v4.3 — peringkat kedua di antara model berbobot terbuka, di belakang GLM-5.3 dengan 45 — dan 93,40% pada SWE-bench Verified di bawah harness agentik terstandarisasi Vals AI, di belakang Claude Opus 5 dan DeepSeek V4 Pro tetapi dekat. Ia juga memimpin Frontend Code Arena dengan 1679 Elo, di depan Fable 5 dengan 1631 dan GPT-5.6 Sol dengan 1618. Jika Anda melihat K3 dikutip pada 57 atau 60, itu adalah skala indeks yang sudah digantikan dan tidak boleh diulang.

Fugu Ultra v2 tidak memiliki skor independen dalam bentuk apa pun. Model ini diumumkan pada 11 September 2026 dan belum ada orang di luar Sakana yang menjalankannya.

Kecepatan: satu terukur, satu tidak

Kimi K3 lambat, dan ini diukur bukan sekadar diklaim: Artificial Analysis mencatat 37,9 token per detik dengan waktu hingga token pertama 3,80 detik, dan menandainya sebagai sangat bertele-tele. Untuk model yang dirancang bagi pengkodean agentik jangka panjang, throughput merupakan kendala nyata — model yang lambat dalam loop panjang memakan waktu nyata, bukan hanya uang.

Sakana sama sekali tidak menerbitkan angka latensi atau throughput untuk Fugu Ultra v2. Untuk sebuah orkestrator, itu bisa dibilang jujur, bukan mengelak, karena waktu respons sepenuhnya bergantung pada model mana yang diputuskan untuk dipanggil dan berapa banyak lintasan yang dilakukannya. Tetapi itu juga berarti Anda tidak dapat memodelkan biaya waktu aktual untuk beralih ke sana tanpa mengukurnya sendiri. Untuk Fugu Ultra sebelumnya, para penguji secara publik melaporkan eksekusi yang berlangsung hingga mendekati 30 menit; itu adalah model Juni 2026 dan bukan bukti tentang v2, tetapi itulah angka yang harus dikalahkan saat Anda melakukan benchmark.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Bobot terbuka, dengan syarat yang perlu dibaca

Bobot Kimi K3 dapat diunduh, yang merupakan perbedaan nyata dari model Fugu Ultra v2 yang hanya dihosting — tetapi lisensinya lebih sempit daripada yang biasanya tersirat oleh frasa "open weights". K3 dirilis di bawah Lisensi Kimi K3, bukan lisensi MIT atau Apache yang disetujui OSI, dan klaim yang banyak diulang bahwa lisensi itu "MIT yang dimodifikasi" masih diperdebatkan. Persyaratannya memerlukan perjanjian terpisah dengan Moonshot untuk bisnis model-as-a-service dengan pendapatan di atas $20M dalam periode dua belas bulan berturut-turut mana pun, ditambah atribusi untuk produk dengan lebih dari 100M pengguna bulanan atau pendapatan bulanan $20M. Penggunaan internal dikecualikan.

Jadi perumusan yang jujur adalah: K3 memberi Anda bobot yang dapat Anda pegang, periksa, fine-tune, dan self-host, dengan tunduk pada syarat komersial yang dibatasi berdasarkan pendapatan. Fugu Ultra v2 tidak memberi Anda satu pun dari itu — tidak ada bobot, tidak ada kumpulan yang dapat diperiksa, tidak ada self-hosting — tetapi juga tidak memberlakukan syarat pendapatan, karena tidak ada yang perlu dilisensikan. Mana yang lebih permisif di antara keduanya sepenuhnya bergantung pada apakah Anda termasuk jenis perusahaan yang menjadi sasaran lisensi K3.

Satu catatan praktis jika rencananya adalah self-hosting: checkpoint K3 kira-kira 1,5 terabyte dan vendor merekomendasikan 64 akselerator atau lebih. "Bobot terbuka" di sini berarti keputusan klaster inferensi, bukan keputusan laptop. Bagi sebagian besar tim, API adalah jalur yang masuk akal apa pun pilihannya — itulah sebabnya dukungan vLLM dan SGLang sejak hari pertama lebih penting daripada unduhannya.

Apa kata trafik kita sendiri

Satu titik data yang tidak diterbitkan oleh kedua vendor, dan yang nilainya lebih besar daripada yang terlihat: di seluruh gateway OrcaRouter, Kimi K3 adalah model yang paling banyak digunakan di antara semua yang dibahas dalam artikel ini dengan selisih yang lebar, memindahkan sekitar 3,27 miliar token dalam tujuh hari terakhir.

Itu bukan tolok ukur dan tidak menyelesaikan apa pun soal kualitas. Tapi itu adalah sampel besar dari apa yang sebenarnya dipilih para pengembang ketika keputusan itu tidak memakan biaya apa pun selain harga token, dan itu menunjukkan bahwa kombinasi K3 berupa jendela tarif tetap 1M, bobot terbuka, dan posisi kuat di coding arena telah memenangkan pangsa substansial dari pekerjaan agentik konteks panjang yang nyata. Fugu Ultra v2 tidak memiliki sinyal yang sebanding, karena baru diluncurkan hari ini.

Screenshot of the OrcaRouter model page for Kimi K3 showing the kimi/kimi-k3 identifier, a 1M token context window, and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Menuju ke masing-masing dari mereka

Kimi K3 tersedia di OrcaRouter dengan tarif milik Moonshot sendiri — $3,00 per juta token masukan, $0,30 saat cache hit, $15,00 per juta token keluaran — diteruskan tanpa markup, jadi perubahan harga vendor langsung berlaku di sini pada hari yang sama alih-alih mengikuti jadwal migrasi. Model ini kompatibel dengan OpenAI pada base URL yang sama dengan katalog lainnya, dan karena berada di belakang gateway yang sama dengan yang lain, Anda dapat memasukkannya ke rantai failover atau merutekannya secara kondisional alih-alih mengodekan satu penyedia secara permanen ke jalur produksi. Hal itu lebih penting dari biasanya di sini: model dengan 2,8T parameter yang dilayani pada 37,9 token per detik adalah persis jenis dependensi yang layak memiliki fallback di belakangnya.

Fugu Ultra v2 tidak dirutekan oleh kami. Model ini tersedia dari API milik Sakana AI sendiri yang kompatibel dengan OpenAI, dan perusahaan tersebut mengatakan integrasi Fugu yang ada dapat beralih ke model ini hanya dengan mengubah satu parameter. Kedua model menggunakan format permintaan yang sama, jadi evaluasi yang menempatkan keduanya di balik satu flag hanyalah penggantian base-URL, bukan penulisan ulang.

Mana yang harus dipilih

Kimi K3 adalah pembelian yang lebih dapat dipertahankan untuk hampir semua beban kerja. Harganya setengah dari harga Fugu Ultra v2 untuk input maupun output, tetap stabil di seluruh jendela 1M tanpa penurunan tajam pada konteks panjang, mendapat skor independen 44 pada indeks Artificial Analysis saat ini, dapat dihosting sendiri di bawah lisensi yang dibatasi pendapatan, dan sudah menjadi model dengan lalu lintas tertinggi dalam perbandingan ini dengan selisih yang besar. Biayanya adalah kecepatan dan verbositas: 37,9 token per detik benar-benar lambat untuk loop agentik, dan lisensinya memiliki konsekuensi nyata jika Anda adalah bisnis model-as-a-service yang besar.

Fugu Ultra v2 adalah pembelian yang tepat jika Anda menginginkan properti spesifik yang dijual Sakana — sebuah tingkat kemampuan yang menguraikan pekerjaan multi-langkah yang sulit ke seluruh kumpulan yang secara struktural mengecualikan vendor-vendor terdepan, sehingga tidak ada satu pun model hulu yang dapat dicabut, diubah harganya, atau diputus di bawah Anda. Keunggulan DeepSWE-nya atas K3 nyata dan dilaporkan vendor; posisinya di dua teratas pada tujuh dari delapan tolok ukur juga dilaporkan vendor, dan pada pengujian yang sebagiannya tidak ada di tempat lain.

Hal yang perlu diperhatikan adalah bahwa keduanya merupakan keputusan perutean, dan Anda diminta memilih ketinggian. K3 merutekan token ke para ahli di dalam model yang dapat Anda unduh dan kendalikan. Fugu Ultra v2 merutekan tugas ke model-model yang tidak dapat Anda lihat. Yang kedua adalah gagasan yang lebih besar dan lebih kuat. Itu juga satu-satunya yang hanya dapat Anda terima dengan keyakinan — dan biayanya lima kali lebih besar per token untuk menerima keyakinan itu.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari