Kartu judul hero untuk Fugu Ultra v2 berjudul 'Fugu Ultra v2' dengan subjudul 'Kolamnya mengecil dan skornya naik', lencana pil bertuliskan 'Chartography 48.3', 'DeepSWE 74.3' dan '$5 / $30 per 1M', baris footer 'Sakana AI - dirilis 11 September 2026', dan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Sakana Fugu Ultra v2, dijelaskan: kumpulannya mengecil dan skornya naik

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Fugu Ultra v2 adalah semacam peningkatan yang aneh: Sakana AI merilisnya pada 11 September 2026 dengan kumpulan model yang tidak lagi memuat Claude Fable 5, Claude Fable 5.1, atau GPT-6 Astra — tiga dari sistem terkuat yang kini tersedia — dan tetap mengklaim mampu mengalahkan ketiganya. Produk andalan baru dari lab Tokyo itu untuk kelas kualitas, yang dirilis pada hari yang sama dengan kerabatnya yang lebih murah bernama Fugu Max, meraih posisi terbaik atau setara terbaik pada lima dari delapan benchmark dalam evaluasi Sakana sendiri, termasuk 48,3 pada Chartography melawan Claude Opus 5 pada 27,3 dan Claude Fable 5 pada 29,5, serta 74,3 pada DeepSWE. Tidak satu pun dari angka-angka itu telah direproduksi secara independen, dan masih belum ada halaman Artificial Analysis untuk model Fugu mana pun. Kesenjangan itulah intinya: yang diminta untuk Anda beli adalah lapisan koordinasi yang seluruh daya tariknya adalah bahwa ia tidak memerlukan model-model terbaik untuk menghasilkan jawaban terbaik.

Sakana AI didirikan pada 2023 oleh Llion Jones, salah satu penulis bersama makalah Transformer, dan David Ha. Lini Fugu diluncurkan pada Juni 2026 sebagai sistem multi-agen yang dihadirkan sebagai satu model: Anda memanggil satu endpoint yang kompatibel dengan OpenAI, dan di belakangnya, koordinator terlatih menguraikan permintaan, memunculkan agen, dan menyintesis hasilnya. Risetnya nyata dan dipublikasikan — TRINITY (arXiv 2512.04695) mengembangkan koordinator ringan yang menetapkan peran Thinker, Worker, dan Verifier; Conductor (arXiv 2512.04388) mempelajari koordinasi bahasa alami antaragen; laporan teknis Fugu berada di arXiv 2606.21228. Yang belum pernah dipublikasikan Sakana adalah hal yang sebenarnya diinginkan semua orang: identitas model di dalam kumpulan, dan keputusan perutean per tugas.

Apa yang sebenarnya berubah dari Fugu Ultra Juni

Versi 2.0 adalah penyegaran point-refresh sekitar sebelas minggu setelah versi aslinya, bukan arsitektur baru. Menurut pihak vendor sendiri, Fugu Ultra v2 dan Fugu Max adalah "arsitektur orkestrasi inti yang sama" yang disetel untuk dua misi berbeda: Max mendorong batas biaya-kinerja ke bawah, Ultra mendorong kemampuan puncak ke atas. ID modelnya adalah fugu-ultra-v2.0, dan Sakana mengatakan bahwa bermigrasi dari Fugu versi sebelumnya cukup dengan mengubah satu baris parameter tanpa perlu migrasi SDK — dan inilah hal yang paling ramah konsumen dari rilis ini.

Perubahan substantifnya terletak pada dua hal di kedua ujung. Pertama, batas waktu pelatihan bergeser ke 20260828, sehingga koordinator telah disetel ulang terhadap generasi model frontier saat ini. Kedua, dan yang jauh lebih menarik, komposisi kumpulan berubah dengan cara yang dipilih Sakana untuk diumumkan: Claude Fable 5, Claude Fable 5.1, dan GPT-6 Astra secara eksplisit dikecualikan. Argumen Sakana adalah bahwa ini membuktikan skor tidak bergantung pada satu model frontier berpemilik, yang penting jika yang Anda khawatirkan adalah keterikatan vendor, pencabutan API, atau model yang menghilang di balik kontrol ekspor.

Ada konsekuensi tingkat kedua yang tidak diperdalam Sakana. Jika kumpulan itu mengecualikan tiga model terkuat yang tersedia, maka perbandingan benchmark terhadap Fable 5 dan Fable 5.1 dilakukan terhadap sistem yang tidak dapat dipanggil oleh orkestrator bahkan jika ia menginginkannya. Perbandingan itu sah — ini klaim tentang arsitektur, bukan tentang akses — tetapi ini bukan uji setara tentang siapa yang memiliki model lebih baik. Ini adalah uji apakah koordinasi mengalahkan kemampuan mentah. Itu pertanyaan yang benar-benar menarik. Ini sekadar bukan pertanyaan yang disiratkan papan skor sekilas.

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

Angka-angkanya, dan siapa yang menghasilkannya

Setiap angka di bagian ini dilaporkan oleh vendor. Sakana belum merilis harness evaluasi, grid skor per tugas, maupun resep reproduksi, dan desain orkestrasi membuat replikasi independen lebih sulit, bukan lebih mudah: mereproduksi skor memerlukan akses ke setiap model dalam kumpulan pada versi yang sama dengan topologi yang sama, dan secara desain topologi bervariasi per permintaan.

• Chartography (penalaran visual atas bagan dan dokumen terstruktur) — Fugu Ultra v2 48.3, Claude Opus 5 27.3, Claude Fable 5 29.5 — dilaporkan oleh vendor

• DeepSWE (rekayasa perangkat lunak dunia nyata) — Fugu Ultra v2 74.3 — dilaporkan vendor, dikatakan mengalahkan model yang biayanya tiga hingga lima kali lebih mahal per token

• Peringkat terbaik atau terbaik bersama — lima dari delapan benchmark: GDP.pdf, Chartography, SWEFish, DeepSWE, dan Toolathon — dilaporkan vendor

• Posisi dua teratas — tujuh dari delapan tolok ukur — dilaporkan vendor

• Fugu Ultra sebelumnya (Juni 2026, sebagai perbandingan) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — dilaporkan vendor

Baris Chartography memang layak mendapat penekanan yang diterimanya, karena itulah satu-satunya kategori di mana selisih dengan produk unggulan terkini yang disebutkan namanya tidak marginal. Selisih 21 poin dibanding Claude Opus 5 pada tolok ukur penalaran visual adalah jenis angka yang biasanya muncul di papan peringkat independen dalam beberapa hari. Sampai tulisan ini dibuat, belum ada yang muncul. Perlakukan baris itu sebagai hipotesis yang disertai angka dolar, bukan sebagai hasil yang sudah final.

Harga: tidak berubah dari Juni, dan sangat mahal untuk output

Fugu Ultra v2 berbiaya $5 per juta token masukan, $30 per juta token keluaran, dan $0,50 per juta input yang di-cache. Di atas 272.000 token konteks, biaya tersebut masing-masing menjadi $10, $45, dan $1,00. Fugu Max memiliki bentuk yang sama sekali berbeda: $2 masukan, $6 keluaran, $0,25 untuk cache, tetap sama di semua panjang konteks, ditambah $0,007 per pencarian web atau panggilan fetch.

Dua hal tentang tabel harga itu patut dibaca dengan cermat. Yang pertama adalah outputnya enam kali input — rasio agresif yang memberi harga pada banyaknya kata yang dihasilkan model, dan orkestrasi adalah urusan yang bertele-tele. Koordinator yang memunculkan agen dan menyintesis jawaban mereka mengeluarkan banyak token, dan Anda membayar semuanya sebesar $30 per juta. Klaim efisiensi Sakana adalah tentang kumpulan yang mendasarinya, bukan tentang berapa banyak teks yang dihasilkan sistem atas nama Anda, dan itu adalah angka yang berbeda. Susun anggaran berdasarkan jumlah token yang teramati, bukan berdasarkan tarif utama.

Yang kedua adalah tebing 272K. Menggandakan tarif per token di atas ambang tertentu adalah cara yang sah untuk menetapkan harga pekerjaan konteks panjang, tetapi itu berarti biaya efektif dari menjalankan agen konteks panjang bukanlah angka yang tertera di halaman harga. Jika beban kerja Anda berada dekat dengan batas tersebut, perhitungannya berubah secara signifikan di kedua sisinya.

Tingkatan langganan Fugu — $20 Standard, $100 Pro, $200 Max per bulan, dengan jatah 10x dan 20x — semuanya mencakup akses ke Fugu, Fugu Ultra, dan Fugu Max. Sakana juga menetapkan harga model Fugu dasar berdasarkan tingkatan tertinggi yang ada di pool untuk permintaan tertentu, dan menyatakan dengan jelas bahwa menambahkan lebih banyak agen tidak melipatgandakan tagihan. Itu perbedaan nyata dari model biaya fan-out yang akan Anda dapatkan dengan memanggil sendiri beberapa model frontier.

Apa yang Sakana tidak akan katakan kepadamu

Tanyakan model mana yang menjawab pertanyaan Anda dan FAQ-nya langsung: "informasi routing ini memang tidak diungkapkan." Pool Ultra dan Max bersifat tetap, jadi Anda tidak dapat mengecualikan vendor; hanya model Fugu dasar yang mendukung pengecualian per model di pengaturan konsol. Pelanggan Enterprise dapat menegosiasikan konfigurasi khusus.

Opasitas itu adalah inti dari kritik yang dialamatkan pada lini Fugu sejak Juni, dan itu adalah kritik yang wajar, bukan kritik yang berniat memusuhi. Ketika sebuah orkestrator mendapat nilai bagus dengan menggabungkan model-model dari laboratorium lain, nilai itu menjadi milik sistem tersebut — yang merupakan hal nyata dan dapat dipertahankan untuk dijual — tetapi nilai itu tidak berpindah ke model mana pun secara individual, dan tidak dapat diaudit. Para peninjau telah menyampaikan poin ini secara blak-blakan: Fugu tidak mengalahkan model unggulan, ia menyewa model unggulan. Pada tugas-tugas yang dapat diverifikasi dengan pemeriksa yang murah, seperti tolok ukur pengodean dengan rangkaian uji, sebuah komite memang benar-benar dapat mengungguli anggota terbaiknya. Pada tugas-tugas tanpa pemeriksa semacam itu, panel yang mengambil sampel dari beberapa model terdepan dan melaporkan hasil terbaik sebagian sedang melaporkan keberuntungan. Pilihan kategori Sakana sendiri — Chartography, DeepSWE, Toolathon — condong ke ujung yang dapat diverifikasi, yang merupakan tempat yang tepat untuk mengajukan klaim tersebut dan juga alasan klaim itu tidak dapat digeneralisasi secara gratis.

Penguji independen juga menyoroti variasi latensi sebagai biaya praktis dari orkestrasi: pada tugas sulit, koordinator bermusyawarah, dan pada tugas mudah, musyawarah itu murni overhead. Tugas shader milik seorang peneliti dilaporkan memakan waktu sekitar tiga puluh menit dengan kualitas yang dinilai hanya dapat diterima.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Di mana Anda benar-benar bisa mendapatkannya

Fugu Ultra v2 kini sudah aktif melalui API milik Sakana sendiri yang kompatibel dengan OpenAI — arahkan klien yang sudah ada ke endpoint dengan kunci API dan ubah satu baris — dan melalui beberapa platform pihak ketiga. OrcaRouter tidak menyediakan model Fugu; jika Anda ingin memanggil Fugu Ultra v2, API milik vendor sendiri adalah jalur langsung.

Yang patut dicatat adalah alternatif yang secara implisit menjadi pesaing Sakana. Kumpulan yang membuat Fugu Ultra v2 berfungsi disusun dari model-model yang saat ini dapat dipanggil satu per satu, dan lawan yang menjadi pembandingnya adalah model yang sudah dijalankan tim. Claude Opus 5, DeepSeek V4 Pro, dan Gem​ini 3.1 Pro semuanya tersedia di OrcaRouter dengan harga daftar dari penyedia masing-masing dengan markup 0%, yang berarti penurunan harga dari salah satu vendor tersebut langsung berlaku di sisi kami pada hari yang sama saat diumumkan. Jika alasan Anda mempertimbangkan orkestrator adalah ketahanan — tidak ingin jalur produksi bergantung pada uptime satu vendor atau kebijakan satu vendor — maka lapisan routing dengan failover otomatis antarpenyedia menyelesaikan sebagian masalah itu di tingkat model, dan Fugu Ultra v2 menyelesaikan bagian yang berbeda di tingkat penalaran. Satu API untuk 200+ model dengan failover bukanlah pengganti koordinator yang terlatih, dan koordinator yang terlatih bukanlah pengganti dari tidak bergantung pada satu vendor. Sebagian tim akan menginginkan keduanya.

Masalah kepatuhan

Fugu tidak tersedia di Uni Eropa atau Kawasan Ekonomi Eropa. Pernyataan vendor tegas: belum tersedia di UE/KEE sementara pihaknya berupaya mematuhi GDPR dan regulasi khusus UE, dan di tempat lain akses dapat dibatasi oleh kondisi jaringan atau aturan lokal. Jika organisasi Anda memiliki entitas UE dalam cakupan, ini mencoret lini Fugu dari pertimbangan terlepas dari performa benchmark, yang layak diketahui sebelum evaluasi, bukan setelahnya.

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

Apa yang harus ditonton

Tiga hal akan mengubah Fugu Ultra v2 dari klaim yang menarik menjadi pilihan yang menanggung beban. Evaluasi independen — entri Artificial Analysis, posisi di LMArena, apa pun yang memiliki harness di belakangnya — akan menyelesaikan pertanyaan Chartography dalam seminggu. Angka yang direproduksi oleh pihak ketiga pada benchmark coding yang dapat diverifikasi akan mengonfirmasi peningkatan tingkat sistem yang diprediksi oleh arsitektur tersebut. Dan pool yang diungkapkan, atau bahkan hanya sebagian, akan memungkinkan pembeli menalar tentang titik kegagalan tunggal mana tepatnya yang mereka terima ketika mereka merutekan lalu lintas produksi melalui koordinator yang tidak dapat mereka periksa.

Sampai saat itu, posisi yang jujur adalah ini. Fugu Ultra v2 adalah upaya paling serius sejauh ini untuk menjual orkestrasi sebagai produk alih-alih demo riset, dari lab yang memiliki karya terpublikasi di belakangnya, dengan harga yang membuat premi orkestrasi menjadi eksplisit alih-alih tersembunyi. Jika beban kerja Anda berjangka panjang, dapat diverifikasi, dan terbatas pada wilayah tempat Sakana dapat melayani Anda, maka layak untuk melakukan pilot dengan lingkup terbatas dengan akuntansi token diaktifkan. Jika tidak, model-model yang dibandingkan dengan Fugu Ultra v2 hanya berjarak satu panggilan API, dengan harga daftar, dengan bukti untuk membuktikan apa yang bisa mereka lakukan.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari