
Fugu Max vs Kimi K3: Sakana Memilih Tolok Ukur Ini, Jadi Mari Kita Baca
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Rilis Sakana AI untuk Fugu Max menyebut tepat tiga model untuk membenarkan penetapan harganya, dan Kimi K3 dari Moonshot AI adalah salah satunya. Klaimnya adalah bahwa tarif output Fugu Max 40 hingga 60 persen lebih rendah daripada ketiga model itu, yang menjadikan Kimi K3 — bukan Grok 4.6, bukan Qwen3.8-Max — sebagai tolok ukur yang dipilih Sakana sendiri untuk nilai. Itu hal yang luar biasa murah hati untuk dilakukan seorang vendor: ia memberi Anda tongkat ukur dan memberi tahu di mana harus memegangnya. Jadi halaman ini melakukan hal yang jelas dan memegangnya. Fugu Max dirilis pada 11 September 2026 dengan harga $2,00 per juta token input dan $6,00 per juta token output. Kimi K3 dipatok pada $3,00 dan $15,00. Klaim 60 persen pada output benar secara aritmetika. Yang tidak disebutkan oleh kalimat itu adalah bahwa model yang sedang disaingi dengan harga lebih murah menerbitkan catatan lengkap hasil yang diukur secara independen, dan model yang menawarkan harga lebih murah itu tidak menerbitkan apa pun.
Kalimat 40 sampai 60 persen, ditelaah
• Input — Fugu Max $2,00 per 1 juta token vs Kimi K3 $3,00 per 1 juta token, penghematan 33 persen, bukan 40 hingga 60 persen yang diunggulkan dalam rilis
• Keluaran — Fugu Max $6,00 per 1 juta token vs Kimi K3 $15,00 per 1 juta token, yaitu 60 persen di bawah batas atas rentang yang dinyatakan Sakana
• Input cache — Fugu Max $0.25 per 1 juta token vs Kimi K3 $0.30 per 1 juta token, selisih yang cukup kecil sehingga loop yang padat cache tidak akan menyadarinya
• Jendela konteks — Fugu Max tidak ada angka yang dipublikasikan dalam rilis vs Kimi K3 1.048.576 token
• Penetapan harga ulang untuk prompt panjang — Fugu Max tidak menyebutkan tier vs Kimi K3 yang tetap di seluruh rentang tanpa biaya tambahan pada panjang apa pun
• Penerapan — hanya API vendor Fugu Max, keanggotaan pool tidak diungkapkan vs bobot Kimi K3 yang dapat diunduh di bawah Lisensi Kimi K3
• Evaluasi independen — Fugu Max: tidak ada, dan tidak ada halaman Artificial Analysis untuk model Fugu mana pun vs Kimi K3 dengan Artificial Analysis Intelligence Index sebesar 44 dan 93,40% terstandardisasi pada SWE-bench Verified dari Vals AI
Perhatikan bentuk baris pertama itu. Rentang utama, 40 hingga 60 persen, adalah rentang di antara tiga kompetitor yang disebutkan, dan Kimi K3 adalah yang menghasilkan angka 60. Jika hanya berdasarkan input, perbandingannya adalah 33 persen, yang tetap merupakan penghematan nyata tetapi dengan kalimat yang berbeda. Ini bukan kritik terhadap penetapan harga — $2.00 dan $6.00 adalah angka yang benar-benar rendah untuk sistem yang mengklaim hasil yang mendekati frontier. Ini adalah catatan tentang angka mana dalam rilis yang berperan membujuk, dan tentang bagaimana paragraf itu ditata di sekitarnya.
Kimi K3 ada di katalog kami dengan tarif Moonshot sendiri — $3,00 per juta input, $0,30 saat cache hit, $15,00 per juta output — diteruskan dengan markup 0%, jadi jika Moonshot mengubah harganya tarif baru langsung berlaku di kunci yang sama pada hari yang sama alih-alih mengikuti siklus migrasi. Ini lebih penting di sini daripada biasanya, karena pemotongan harga di sisi hulu justru itulah yang menggerus atau memperlebar selisih 60 persen yang menjadi dasar seluruh perbandingan ini.
Apa yang diterbitkan oleh tolok ukur
Rekor Kimi K3 adalah kebalikan dari minim. Kartu model Moonshot sendiri melaporkan Terminal-Bench 2.1 pada 88,3, GPQA Diamond pada 93,5, HLE-Full pada 43,5 yang naik menjadi 56,0 dengan alat, SWE-Marathon pada 42,0, OSWorld-Verified pada 84,8, MCPMark-Verified pada 94,5 dan DeepSWE pada 67,5. Semua dilaporkan oleh vendor, dan jumlahnya sangat banyak.
Lapisan independen juga ada, dan itulah bagian yang penting untuk perbandingan ini. Artificial Analysis memberi Kimi K3 skor 44 pada Intelligence Index v4.3 — peringkat kedua di antara model open-weight, di belakang GLM-5.3 pada 45 — dengan throughput tercatat 37,9 token keluaran per detik dan waktu hingga token pertama 3,80 detik. Harness agentik terstandardisasi milik Vals AI menempatkannya pada 93,40% di SWE-bench Verified, di belakang Claude Opus 5 dan DeepSeek V4 Pro tetapi tidak jauh. Model ini juga memimpin Frontend Code Arena dengan 1679 Elo, di atas Claude Fable 5 pada 1631 dan GPT-5.6 Sol pada 1618. Satu peringatan: jika Anda pernah melihat Kimi K3 dikutip pada 57 atau 60 di Intelligence Index, itu adalah angka pra-penyajian ulang dari sebelum Artificial Analysis mengkalibrasi ulang skala pada September 2026 dan tidak boleh diulang bersama angka saat ini.
Ada sinyal penggunaan juga, dan itu berasal dari gateway kami sendiri, bukan dari pemasaran siapa pun: Kimi K3 memindahkan sekitar 3,27 miliar token melalui OrcaRouter dalam tujuh hari terakhir, trafik terpadat di antara model mana pun dalam perbandingan ini. Itu bukan pengukuran kualitas. Ini adalah sampel besar dari apa yang diandalkan para pengembang ketika satu-satunya biaya untuk memilih adalah harga token, dan ini menunjukkan bahwa jendela 1M yang flat dan bobot terbuka telah memenangkan pangsa substansial dari pekerjaan nyata berhorizon panjang.

Papan skor tanpa angka di atasnya
Sakana melaporkan Fugu Max sebagai peraih skor keseluruhan terbaik pada enam benchmark: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench, dan SWEFish. Laporan itu juga menyebut Max memperluas frontier Pareto biaya-kinerja pada tujuh dari sepuluh benchmark. Keduanya adalah pernyataan tentang peringkat pada sebuah grafik. Tidak satu pun disertai nilai, selisih, atau angka pesaing di sampingnya.
Dua daftar itu hampir tidak bersinggungan, dan itulah masalah praktisnya. Kimi K3 melaporkan Terminal-Bench 2.1 pada 88,3; Sakana mengatakan Fugu Max meraih hasil terbaik secara keseluruhan di Terminal Bench 2.1 dan tidak mencetak apa pun untuk dibandingkan dengannya. Baris tunggal itu adalah ilustrasi paling jelas dari keseluruhan adu ini: kedua vendor menyebut pengujian yang sama, satu mencetak angka, dan yang lain mencetak kata "terbaik". Sampai Sakana menerbitkan angkanya, tidak ada bukti terbitan yang menjawab apakah Fugu Max mengalahkan Kimi K3 pada benchmark yang dipilih Sakana untuk dijadikan andalan.
Ada pembacaan yang adil atas rilis ini yang layak dikemukakan. Fugu Max adalah tier biaya — dirilis pada hari yang sama dengan Fugu Ultra v2, yang merupakan dorongan kemampuan pada harga input $5.00 dan output $30.00 — dan argumennya digambarkan pada plot Pareto di mana skor per dolar, bukan skor, yang menjadi klaimnya. Dalam kerangka itu, angka benchmark mentah akan menjadi statistik yang kurang jujur. Masalahnya adalah rilis ini juga menghilangkan penyebutnya: liputan Sakana sendiri mengakui bahwa berpindah model di tengah tugas dapat mengurangi penggunaan ulang cache konteks dan menghasilkan token orkestrasi tambahan, dan menegaskan bahwa perusahaan tidak mengungkapkan tingkat hit cache Max atau total biaya token per tugasnya. Jadi, satu-satunya pengukuran yang dapat menyelesaikan argumen tier biaya adalah pengukuran yang tidak disediakan.
Bobot yang bisa Anda pegang, atau kumpulan yang tidak bisa Anda lihat
Di sinilah kedua produk sama sekali tidak lagi bisa dibandingkan.
Kimi K3 hadir dengan bobot yang dapat diunduh, yang merupakan jalan keluar yang sesungguhnya: jika harga atau ketentuan berubah, model tersebut dapat dilayani dari infrastruktur Anda sendiri. Lisensinya lebih sempit daripada yang biasanya tersirat oleh "open weights". Lisensi ini adalah Kimi K3 License, bukan lisensi yang disetujui OSI, dan deskripsi yang sering diulang bahwa lisensi ini adalah MIT yang dimodifikasi masih diperdebatkan. Ketentuannya mensyaratkan perjanjian terpisah dengan Moonshot bagi bisnis model-as-a-service dengan pendapatan di atas $20 juta selama dua belas bulan berturut-turut, ditambah atribusi untuk produk dengan lebih dari 100 juta pengguna bulanan atau pendapatan bulanan $20 juta, dengan penggunaan internal dikecualikan. Dan skala praktisnya nyata: checkpoint-nya sekitar 1,5 terabyte dan Moonshot merekomendasikan 64 akselerator atau lebih, jadi self-hosting adalah keputusan klaster inferensi, bukan keputusan laptop.
Fugu Max tidak menawarkan satu pun dari itu — tidak ada bobot, tidak ada kumpulan yang dapat diperiksa, tidak ada opsi self-hosting — dan sebagai imbalannya tidak memberlakukan syarat lisensi apa pun, karena tidak ada yang perlu dilisensikan. Manfaat yang dinyatakan Sakana adalah kebalikan dari kontrol: kumpulan yang mencakup model open-weights dan model terspesialisasi, yang diperluas untuk Max dengan keluarga NVIDIA Nemotron, berarti tidak ada penghentian dukungan atau penetapan harga ulang dari satu vendor hulu mana pun yang dapat menjatuhkan produk Anda. Itu adalah lindung nilai yang nyata. Hal itu juga tidak dapat diverifikasi dari luar, karena keanggotaannya sengaja tidak dipublikasikan, dan itu berarti hasil Fugu Max membawa tanggal kedaluwarsa yang tidak dimiliki hasil Kimi K3.
Bobot terbuka dan kumpulan yang tidak diungkapkan adalah dua jawaban berbeda atas ketakutan yang sama. Yang satu mengatakan Anda bisa pergi. Yang lain mengatakan tidak ada yang bisa ditinggalkan.
Di mana jendela datar memutuskannya
Konteks 1.048.576 token milik Kimi K3 bersifat datar — tidak ada tingkatan konteks panjang, tidak ada biaya tambahan pada panjang apa pun. Rilis Fugu Max tidak menyebutkan jendela sama sekali, jadi tidak ada yang bisa dibandingkan dengannya dan tidak ada yang bisa dijadikan acuan perencanaan. Untuk pengodean agentik horizon panjang yang menjadi sasaran kedua produk, ketika sesi menghabiskan sebagian besar masa hidupnya jauh di dalam konteks, asimetri itu lebih penting daripada daftar tarifnya.
Kecepatan adalah bayangan cermin dari masalah yang sama. Kimi K3 menghasilkan 37,9 token per detik dengan waktu hingga token pertama 3,80 detik, dan itu terukur, serta lambat — benar-benar sebuah keterbatasan bagi model yang dibangun untuk loop panjang, dan Artificial Analysis menandainya sebagai sangat bertele-tele. Sakana tidak menerbitkan angka latensi atau throughput untuk Fugu Max, yang bagi sebuah orkestrator bisa dibilang jujur ketimbang mengelak: waktu responsnya bergantung pada model yang dipilihnya dan berapa banyak proses yang dijalaninya. Tetapi itu berarti Anda tidak dapat memodelkan biaya waktu aktual dari peralihan tanpa mengukurnya sendiri. Untuk Fugu Ultra yang lebih awal, pengguna melaporkan secara publik proses yang berlangsung hingga mendekati 30 menit. Itu adalah model Juni 2026 dan bukan bukti tentang Max, tetapi itulah angka yang harus dikalahkan saat Anda melakukan benchmark.

Putusannya, dalam istilah Sakana sendiri
Sakana memilih Kimi K3 sebagai salah satu dari tiga model yang harga Fugu Max lebih murah, dan pada tarif keluaran klaim itu berlaku: $6,00 dibandingkan $15,00 adalah 60 persen lebih rendah, tepat di batas atas kisaran yang disebutkan. Jika percaya pada pernyataan rilisnya, Fugu Max adalah produk yang lebih murah.
Sekarang terapkan tolok ukur yang dihindari oleh rilis tersebut. Kimi K3 33 persen lebih mahal pada input dan 150 persen lebih mahal pada output — dan untuk uang sebesar itu, Anda mendapatkan jendela 1M token tanpa jurang penetapan harga ulang, checkpoint yang dapat diunduh di bawah lisensi dengan pembatasan pendapatan, penempatan Intelligence Index independen di angka 44, skor SWE-bench Verified terstandarisasi sebesar 93,40%, tempat pertama di Frontend Code Arena, dan lalu lintas nyata terberat di antara model mana pun dalam perbandingan ini. Fugu Max memberi Anda tarif lebih rendah untuk kedua sisi token, enam kemenangan benchmark yang tidak terkuantifikasi, tingkat cache setengah dari K3 tanpa tingkat hit yang dipublikasikan, dan pool yang tidak dapat Anda periksa.
Kesimpulan jujurnya adalah Sakana memilih tolok ukur yang membuatnya tampak unggul soal harga dan tidak memberi Anda apa pun untuk memeriksa kemampuannya. Jika beban kerja Anda bervolume tinggi dan tugas-tugas Anda adalah jenis yang dapat diuraikan secara andal oleh koordinator, selisih tarifnya adalah uang nyata dan Fugu Max layak mendapatkan uji coba terbatas dengan penghitungan token diaktifkan sejak permintaan pertama. Jika Anda memerlukan keputusan produksi yang dapat Anda pertahankan kuartal ini — jendela waktu yang dapat Anda jadikan dasar perencanaan, skor yang dapat Anda tunjuk, dan model yang tetap dapat Anda jalankan seandainya vendor menghilang — Kimi K3 adalah jawabannya, dan model itu tersedia di OrcaRouter dengan harga daftar Moonshot dengan tarif penyedia diteruskan tanpa diubah.

