
Sakana Fugu Max: Orkestrator $2/$6 yang Memilih Model Termurah yang Berfungsi
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Sebagian besar model bersaing berdasarkan seberapa banyak yang bisa mereka lakukan. Sakana Fugu Max bersaing berdasarkan seberapa sedikit yang bisa dilakukannya tanpa masalah. Sakana AI merilis Sakana Fugu Max pada 11 September 2026, bersama Sakana Fugu Ultra v2 — dua penyetelan dari satu arsitektur orkestrasi yang diarahkan ke ujung-ujung berlawanan dari kurva biaya-kinerja. Fugu Max tidak menjawab permintaan Anda sendiri. Ia membaca tugas, memilih model termurah di kumpulannya yang secara masuk akal dapat menanganinya, mengarahkan ke sana, dan mengembalikan satu jawaban. Sakana menetapkan harganya pada $2 per juta token masukan dan $6 per juta token keluaran.
Bagian yang menarik adalah apa yang menjadi tolok ukur harga tersebut. Sakana mengklaim tarif output Fugu Max 40–60% lebih murah daripada Claude Sonnet 5, GPT-5.6 Terra, dan Kimi K3. Klaim itu dapat diperiksa, dan tidak biasa untuk tolok ukur hari peluncuran, aritmetikanya pun valid: dibandingkan harga daftar saat ini dari tiga model yang disebut Sakana, $6 per juta output berada hampir tepat di tengah rentang yang dinyatakan. Yang jauh lebih sulit diperiksa adalah sisi performanya, karena Sakana menerbitkan hasil Fugu Max sebagai plot sebar, bukan angka.
Apa sebenarnya Fugu Max
Fugu Max bukanlah checkpoint. Tidak ada file bobot, tidak ada jumlah parameter, dan tidak ada yang perlu diunduh. Sakana mendeskripsikannya sebagai "sebuah arsitektur, bukan model tunggal" — mesin orkestrasi inti yang sama dengan Fugu Ultra v2, yang disetel untuk pertanyaan yang berbeda. Ultra v2 menanyakan kemampuan tertinggi apa yang tersedia. Fugu Max menanyakan keluaran terbaik apa dengan biaya terendah.
Perbedaan itu penting secara operasional. Anda tidak dapat melakukan fine-tuning pada Fugu Max, menghostingnya sendiri, atau memeriksa mengapa ia memilih satu model dibandingkan model lain. Anda juga tidak dapat melihat daftar lengkap model yang dilalui peruteannya — Sakana mengatakan kumpulan itu diperluas menjadi "kumpulan model terbuka dan terspesialisasi terbesar kami hingga saat ini" dan secara eksplisit menyebutkan keluarga Nemotron milik NVIDIA, yang ditambahkan melalui kemitraan NVIDIA yang diumumkan Sakana pada Agustus. Sisa kumpulan itu tidak dinamai, dan Sakana tidak menerbitkan jejak perutean per permintaan.
Apa yang bisa Anda lihat adalah bentuk dari hal itu. Diagram milik vendor itu sendiri menunjukkan Fugu Max di puncak sebuah fan-out: satu orkestrator, sederet slot model yang dapat dipertukarkan di belakangnya, dan Sakana Namazu serta Fugu Max sendiri di antara targetnya. Pool ini digambarkan dapat ditukar secara desain, dan motivasi yang dinyatakan sama politisnya dengan ekonomis — Sakana membingkai orkestrasi sebagai perlindungan terhadap vendor lock-in, pencabutan API, dan kontrol ekspor, dengan argumen bahwa sistem yang dapat menukar pemasoknya tidak dapat diputus oleh salah satu dari mereka.
Sakana Fugu sendiri bukan hal baru. Ia mencapai ketersediaan umum pada 22 Juni 2026, dan lini masa milik vendor itu sendiri berjalan April (beta), Juni (GA plus Fugu Ultra v1), Juli (Fugu-Cyber dan antarmuka Claude Code), Agustus (Sakana Chat plus kemitraan NVIDIA), dan kini September. Fugu Max adalah langkah bulanan kelima, bukan debut — dan siapa pun yang sudah menjalankan Fugu dapat meningkatkannya ke versi itu dengan perubahan parameter satu baris pada endpoint yang sama yang kompatibel dengan OpenAI, tanpa migrasi.
Klaim harga itu tetap bertahan saat dihadapkan pada harga daftar.
Angka $2 input / $6 output Sakana dinyatakan secara gamblang di halaman peluncuran. Liputan sekunder menambahkan tarif input cache sebesar $0,25 per juta token, yang tidak dicantumkan oleh halaman peluncuran itu sendiri — anggap yang itu sebagai dilaporkan, bukan dikonfirmasi. Sebagai perbandingan, Fugu Ultra v2 adalah $5 input, $30 output, dengan $0,50 input cache.
Sekarang klaim 40–60%. Tiga pembanding yang disebutkan saat ini berada pada:
• GPT-5.6 Terra — $2 input / $12 output, setelah pemotongan harga {{KEEP}}OpenAI's{{/KEEP}} pada 30 Juli menurunkan output dari $15.
• Claude Sonnet 5 — output $10 pada tarif promosi peluncuran, $15 pada tarif standar. Sumber-sumber tidak sepakat apakah kenaikan September yang dijadwalkan dibatalkan atau hanya ditunda, sehingga rentangnya lebar.
• Kimi K3 — $3 input / $15 output, dengan input yang di-cache sebesar $0,30.
Dibandingkan dengan itu, output $6 adalah 50% lebih rendah dari Terra, 40% lebih rendah dari tarif promosi Sonnet 5, 60% lebih rendah dari tarif standar Sonnet 5, dan 60% lebih rendah dari Kimi K3. Klaim itu terbukti benar, dan terbukti benar terhadap harga daftar yang dipublikasikan alih-alih model biaya internal — sesuatu yang tidak bisa Anda katakan tentang setiap persentase hari peluncuran.
Satu angka di bagian yang sama tidak bertahan dari perlakuan yang sama. Sakana juga mengatakan Fugu Max memberikan "kinerja yang hampir menyamai model-model elit dengan biaya dua hingga enam kali lebih rendah." Dibandingkan dengan tiga model yang disebutkannya untuk angka 40–60%, selisih harga output mentahnya lebih dekat ke 1,7× hingga 2,5×. Pengali yang lebih lebar mungkin diukur di seluruh frontier — termasuk model-model yang biayanya jauh lebih dari $12 — bukan dibandingkan dengan tiga model dalam kalimat itu. Ini adalah klaim yang dapat dipertahankan tentang kurva Pareto dan klaim yang tidak dapat dipertahankan tentang para rival yang disebutkan, dan halaman peluncuran tidak membedakan keduanya.
Di sinilah lapisan perutean membuktikan nilainya di sisi penetapan harga. OrcaRouter meneruskan harga daftar penyedia tanpa markup, jadi saat vendor mengubah harga daftar, angka yang Anda lihat ikut berubah pada hari itu juga — relevan di sini karena seluruh premis Fugu Max adalah bahwa ada model yang lebih murah di suatu tempat dalam kumpulan tersebut dan Anda seharusnya bisa mencapainya tanpa perlu memikirkannya. Kami tidak menghosting Fugu Max; ia berjalan di API milik Sakana sendiri. Namun prinsip penerusan yang sama itulah yang membuat tarif output $6 layak dibandingkan dengan pemain lama berharga $12, alih-alih memercayai salah satu angka begitu saja.
Apa yang menurut Sakana dapat dikalahkannya, dan apa yang tidak akan ditunjukkannya kepadamu

Bagian benchmark dari vendor membuat tiga klaim spesifik untuk Fugu Max: skor keseluruhan terbaik pada enam benchmark — Terminal Bench 2.1, GPQA-D, AA-LCR, GDP.pdf, AutomationBench, dan SWEFish — perluasan frontier Pareto biaya-kinerja pada tujuh dari sepuluh benchmark, serta performa yang "nyaris menyamai model-model elit" dengan sebagian kecil dari pengeluaran token.
Ada tiga hal tentang bukti itu yang perlu diingat sebelum Anda mengutip bagian mana pun darinya.
Pertama adalah bahwa Sakana tidak mempublikasikan angka apa pun. Hasil Fugu Max muncul sebagai sepuluh plot sebar — skor pada sumbu vertikal, harga output dalam dolar per juta token pada sumbu horizontal — dengan Fugu Max digambarkan sebagai titik merah di barat laut bidang abu-abu. Anda dapat melihat bahwa titik itu berada di atas dan di sebelah kiri. Anda tidak dapat membaca skor darinya. Terminal Bench 2.1, GPQA-D, dan AA-LCR semuanya memiliki papan peringkat publik yang memungkinkan angka dibandingkan secara langsung, dan tidak ada satu pun yang diberikan.
Kedua, salah satu dari enam benchmark itu milik Sakana sendiri. SWEFish dijelaskan di halaman peluncuran sebagai "benchmark internal kami yang mencerminkan tantangan dan kasus penggunaan coding Sakana AI sendiri." Itu cara yang sah untuk mengukur kecocokan bagi produk Anda sendiri, dan bukan cara untuk membandingkan dengan pesaing — skor pada benchmark yang dirancang vendor, pada tugas yang dipilih vendor, bukanlah bukti tentang model orang lain.
Yang ketiga adalah bahwa angka-angka terkuat di halaman itu milik model yang lain. Fugu Ultra v2 mendapatkan angka, sementara Fugu Max mendapatkan grafik: Chartography 48,3 versus Opus 5 pada 27,3 dan Fable 5 pada 29,5, DeepSWE 74,3, terbaik atau setara terbaik pada lima dari delapan benchmark dan masuk dua teratas pada tujuh dari delapan. Ultra v2 juga mencantumkan batas pelatihan yang dinyatakan sebesar 2026-08-28 — sedikit lebih dari dua minggu sebelum peluncuran — dan, secara mencolok, catatan eksplisit bahwa Fable 5, Fable 5.1, dan GPT-6 Astra tidak ada dalam kumpulannya. Sakana mengklaim bahwa ia mencapainya tanpa menyewa model-model spesifik tersebut, yang merupakan keseluruhan argumen kedaulatan dalam satu catatan kaki.
Tidak satu pun dari ini membuat klaim Fugu Max menjadi salah. Ini membuat klaim tersebut belum terverifikasi, dan membuat tajuk utama enam benchmark baru aman untuk diulang jika labelnya disertakan. Evaluasi independen terhadap endpoint orkestrasi yang benar-benar baru jarang dilakukan, dan belum ada apa pun yang dipublikasikan.
Fugu Max vs Fugu Ultra v2: mana yang sebenarnya Anda inginkan

Ini bukan produk yang saling bersaing, dan begitu Anda melihat angkanya secara berdampingan, pilihan di antara keduanya tidaklah sulit. Fugu Max adalah yang murah: input $2, output $6, dibuat untuk mengarahkan menjauh dari model mahal setiap kali model yang lebih murah bisa mengerjakan tugasnya. Fugu Ultra v2 adalah yang kuat: input $5, output $30, biaya cache $0,50, dibuat untuk mengarahkan menuju kemampuan pada pekerjaan multi-langkah yang kompleks bahkan ketika itu lebih mahal.
Pemisahan praktisnya adalah berdasarkan bentuk tugas, bukan berdasarkan anggaran. Jika trafik Anda sebagian besar berupa pencarian, ekstraksi, klasifikasi, generasi pendek, dan pemanggilan alat yang lugas, seluruh desain Fugu Max adalah untuk mengenali hal itu dan mengeluarkan biaya sesedikit mungkin — dan klaim Sakana bahwa ia memperluas batas pada tujuh dari sepuluh tolok ukur setidaknya secara arah berkaitan dengan itu. Jika trafik Anda mencakup proses agentic yang panjang, refaktor multi-berkas, atau tugas riset yang gagal dengan biaya mahal ketika satu langkah keliru, tarif keluaran $30 pada Ultra v2 benar-benar membeli sesuatu yang nyata: posisi dua teratas pada tujuh dari delapan tolok ukur adalah bagian dari halaman peluncuran yang paling menyerupai klaim kemampuan alih-alih klaim biaya.
Keduanya tersedia pada API yang kompatibel dengan OpenAI yang sama melalui konsol Sakana, dan jalur peningkatan dari Fugu yang ada hanyalah perubahan parameter. Ada dua catatan ketersediaan. Fugu dilaporkan tidak tersedia di UE dan EEA sambil menunggu pekerjaan GDPR, yang jika masih berlaku akan membatasi di mana salah satu model dapat diterapkan. Dan keduanya adalah sistem tertutup: Anda membeli sebuah endpoint, dan vendor memilih model mana yang berada di baliknya — termasuk, untuk Fugu Max, daftar model yang tidak diungkapkannya secara penuh.
Masalahnya: sebuah orkestrator yang masih menyewa frontier-nya.
Kritik paling tajam terhadap Fugu adalah kritik yang Sakana sendiri undang dengan membingkainya sebagai infrastruktur kedaulatan. Lapisan orkestrasi yang merutekan lalu lintas melintasi API pihak ketiga tidak mencegah dicabutnya API tersebut. Lapisan itu mengubah satu titik kegagalan tunggal menjadi titik kegagalan yang terdiversifikasi, yang merupakan peningkatan nyata, tetapi model-model yang mendasarinya tetap milik orang lain, tetap dapat dijangkau oleh kontrol ekspor yang sama, dan tetap rentan terhadap pemutusan layanan mendadak yang sama. Kemitraan NVIDIA pada Agustus dan penambahan Nemotron adalah jawaban paling konkret untuk hal ini sejauh ini — model berbobot terbuka di dalam kumpulan adalah model yang tidak dapat dimatikan oleh siapa pun — tetapi Sakana tidak mengatakan berapa banyak lalu lintas Fugu Max yang benar-benar diarahkan ke model-model itu.
Ada pertukaran kedua yang lebih sunyi. Keputusan perutean menambah latensi dan menghilangkan determinisme. Permintaan yang hari ini mendarat pada model kecil besok bisa mendarat pada model lain jika kumpulan atau bobot biayanya berubah, yang membuat perilaku lebih sulit diuji regresi dan lebih sulit dijelaskan kepada siapa pun yang mengaudit sistem. Jawaban Sakana adalah bahwa orkestrasinya bersifat internal dan API-nya berperilaku seperti satu model. Itu benar di antarmuka dan tidak benar di baliknya, dan tim dengan persyaratan reproduksibilitas yang ketat harus mengujinya dengan cermat sebelum hal itu menjadi penopang beban.
Jika Anda menginginkan keunggulan biaya tanpa menjadikan pool sebagai satu-satunya ketergantungan, pola yang sama tersedia untuk Anda susun sendiri. DSL perutean kami memungkinkan Anda menentukan panel model di balik satu endpoint dan memutuskan model mana yang menangani kelas permintaan tertentu, dan fusi model menjalankan beberapa model pada prompt yang sama serta merekonsiliasi jawabannya ketika konsensus lebih penting daripada harga. Failover lintas penyedia berarti ketika pemasok mengalami penurunan kinerja — atau menghilang — lalu lintas dialihkan ke model yang sudah Anda percaya tanpa mengubah kode. Itulah versi yang lebih konservatif dari taruhan yang diminta Sakana agar Anda lakukan secara menyeluruh.

Ada baiknya kita bersikap tepat mengenai apa yang kami tawarkan dan tidak tawarkan di sini. Sakana Fugu Max tidak ada dalam katalog kami — ini bukan model yang dapat dirutekan di sisi kami, dan model ini berjalan di API serta konsol Sakana sendiri. Katalog kami adalah 196 model dari 15 penyedia dengan satu kunci dan satu tagihan, dengan tarif per token yang tercetak di setiap kartu dan tanpa markup di atasnya. Tumpang tindih yang relevan dengan Fugu Max adalah idenya, bukan inventarisnya: keduanya adalah argumen bahwa jawaban yang tepat untuk "model mana yang harus menangani ini" biasanya bukan yang terbesar.
Siapa yang harus bergerak, dan siapa yang harus menunggu.
Fugu Max adalah salah satu rilis yang lebih menarik bulan ini justru karena ia bukan sebuah model. Jika Anda sudah menggunakan Sakana Fugu, peningkatan ini hanya perubahan satu baris dengan harga yang lebih murah dan tidak ada alasan untuk ragu-ragu. Jika Anda menjalankan trafik bervolume tinggi dengan kompleksitas rendah pada model kelas menengah dan membayar $10–$15 per juta token keluaran untuknya, hitungan yang ditawarkan Sakana layak untuk Anda uji tolok ukur sendiri — ambil permintaan nyata selama seminggu, jalankan melalui Fugu Max, dan bandingkan kualitasnya dengan model Anda saat ini, bukan dengan plot sebar.
Jika Anda membutuhkan angka benchmark yang dipublikasikan sebelum berkomitmen, tunggu dulu. Belum ada apa pun yang independen tentang Fugu Max, bukti dari vendor sendiri hanyalah bagan, bukan tabel, dan salah satu dari enam benchmark utamanya adalah milik Sakana. Itu bukan alasan untuk mengabaikannya — itu alasan untuk mengujinya pada trafik Anda sendiri, yang merupakan satu-satunya benchmark yang memang akan memprediksi hasil Anda. Dan jika beban kerja Anda bersifat agentik, berhorizon panjang, dan mahal jika salah, model yang perlu dilihat dalam pasangan ini adalah Fugu Ultra v2, bukan Fugu Max: model itulah yang punya angka yang menyertainya.
kamiDSL routing memungkinkan Anda menentukan panel model di balik satu endpoint dan memutuskan model mana yang menangani kelas permintaan yang mana, dan fusi model menjalankan beberapa model pada prompt yang sama dan merekonsiliasi jawaban di mana kesepakatan lebih penting daripada harga.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
