Kartu judul hero untuk Fugu Ultra v2 vs Gemini 3.1 Pro dengan subjudul 'Lawan yang mungkin sudah berada di dalam mesin', badge berbentuk pil yang bertuliskan '$30.00 vs $12.00 keluaran', 'CharXiv 86.6 vs 80.2 directional' dan 'Kumpulan tidak diungkapkan', baris footer 'Sakana AI vs Google DeepMind - September 2026', serta logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Fugu Ultra v2 vs Gemini 3.1 Pro: lawan yang mungkin sudah berada di dalam mesin

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada versi perbandingan Fugu Ultra v2 vs Gem​ini 3.1 Pro yang mana Gem​ini menang apa pun hasil benchmarknya — karena ia mungkin melakukan sebagian pekerjaannya. Sistem orkestrasi Sakana AI, yang dirilis 11 September 2026, tidak mengungkapkan model mana yang dikoordinasikannya; kumpulan yang dilaporkan Fugu Ultra edisi Juni mencakup Gem​ini 3.1 Pro di antara yang lain, dan versi 2.0 hanya memberi tahu kita apa yang dihilangkannya, dengan menyebut Claude Fable 5, Claude Fable 5.1, dan GPT-6 Astra sebagai yang dikecualikan. Gem​ini 3.1 Pro milik Goo​gle adalah satu model frontier multimodal dengan konteks 1 juta token yang menangani teks, gambar, PDF, audio, dan video, tersedia secara umum sejak Mei 2026 dengan tarif $2,00 per juta token input dan $12,00 per juta token output. Salah satunya adalah model yang dapat Anda periksa. Yang lainnya adalah sistem yang kemenangan benchmark-nya mungkin mengalir melalui model pertama, dan tidak ada vendor yang akan memberi tahu Anda apakah memang begitu.

Apa sebenarnya setiap sistem itu

Gemini 3.1 Pro terbaca dengan jelas dengan cara yang kini jarang ditemui di antara rilis model terdepan. Ini adalah transformer sparse mixture-of-experts dari Google DeepMind, pertama kali dikirim dalam pratinjau pada 19 Februari 2026, dengan satu sumber menyebut ketersediaan umum pada Mei 2026 — daftar kami sendiri memuatnya di bawah ID model pratinjau. Model ini memiliki jendela masukan 1M token dan batas keluaran 65K token, menerima teks, gambar, PDF, audio, video, dan kode, serta menyediakan kontrol penalaran tiga tingkat — rendah, sedang, atau tinggi — dengan tinggi sebagai bawaan API. Google melaporkan 77,1% pada ARC-AGI-2, lebih dari dua kali lipat 31,1% dari generasi sebelumnya; 94,3% pada GPQA Diamond; 80,6% pada SWE-bench Verified; 68,5% pada Terminal-Bench 2.0; 85,9% pada BrowseComp; dan 44,4% pada Humanity's Last Exam tanpa alat, naik menjadi 51,4% dengan pencarian dan eksekusi kode. Itu adalah angka dari vendor. Batas pengetahuannya adalah Januari 2025, yang perlu dicatat jika pekerjaan Anda bergantung pada peristiwa terkini.

Fugu Ultra v2 adalah koordinator. Ini adalah model terlatih, dilaporkan sekitar 7B parameter, yang membaca permintaan, menyusun tim agen dengan peran Thinker, Worker, dan Verifier yang diambil dari riset TRINITY milik Sakana, dan menyintesis jawaban di balik endpoint yang kompatibel dengan OpenAI. Tidak ada daftar modalitas yang dipublikasikan miliknya sendiri — apa pun yang dapat dilihatnya, ia melihatnya karena ada model di pool-nya yang dapat melihatnya. Konteksnya adalah 1M token dengan jurang harga yang tajam pada 272K, di mana tarifnya berlipat dua menjadi $10 untuk input dan $45 untuk output. Batas outputnya tidak dipublikasikan. Pool-nya tidak diungkapkan, keputusan peruteannya "tidak diekspos secara desain," dan untuk tier Ultra pool-nya tetap, sehingga Anda tidak dapat mengecualikan penyedia.

Asimetri itulah keseluruhan pertarungannya. Gem​ini 3.1 Pro adalah komponen yang dapat Anda beli secara langsung dan bernalar tentangnya. Fugu Ultra v2 adalah rakitan yang bagian-bagiannya tidak dapat Anda lihat dan yang klaim benchmark terkuatnya mungkin, sebagian, adalah hasil Gem​ini sendiri yang digabungkan dengan hasil orang lain.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Perbandingan di mana keduanya tumpang tindih

Sangat sedikit bukti yang dipublikasikan yang menyejajarkan kedua sistem pada baris yang sama. Angka Gem​ini 3.1 Pro di bawah ini adalah milik Goo​gle sendiri; angka Fugu Ultra v2 adalah milik Sakana sendiri; jika ada agregator pihak ketiga yang telah menerbitkan baris bersama, hal itu ditandai dan disertai catatan bahwa sifatnya hanya indikatif, bukan menentukan.

• Penalaran multimodal (CharXiv, baris bersama) — Fugu Ultra v2 86,6% vs Gemini 3.1 Pro 80,2%, menurut BenchLM, yang menandai kategori ini sebagai direksional dan menolak menyebutkan pemenang

• TerminalBench 2.1 — tidak ada angka Fugu Ultra v2 v2.0 vs Gem​ini 3.1 Pro, tidak ada angka setara yang dipublikasikan; Fugu Ultra Juni melaporkan 82,1% berbanding 70,3% milik Gem​ini 3.1 Pro dalam agregasi pihak ketiga

• SWE-Bench Pro — tidak ada angka Fugu Ultra v2 v2.0 vs Gem​ini 3.1 Pro, tidak ada angka terbitan yang sebanding; Fugu Ultra edisi Juni melaporkan 73,7% dibandingkan 54,2% milik Gem​ini 3.1 Pro

• ARC-AGI-2 — tidak ada angka Fugu Ultra v2 vs Gemini 3.1 Pro 77,1%, dilaporkan vendor

• Humanity's Last Exam — tidak ada angka untuk Fugu Ultra v2 v2.0 vs Gem​ini 3.1 Pro, 44,4% tanpa alat, 51,4% dengan alat, dilaporkan vendor

• Cakupan modalitas — Fugu Ultra v2 mewarisi apa pun yang didukung pool-nya, tidak diungkapkan vs Gem​ini 3.1 Pro yang terdokumentasi untuk teks, gambar, PDF, audio, video, dan kode

• Harga input / output — Fugu Ultra v2 $5.00 / $30.00 per 1M, dua kali lipat di atas 272K vs Gem​ini 3.1 Pro $2.00 / $12.00 per 1M hingga 200K, $4.00 / $18.00 di luar itu, input yang di-cache $0.20 / $0.40

• Konteks dan output — Fugu Ultra v2 konteks 1M, batas output tidak dipublikasikan vs Gem​ini 3.1 Pro input 1M, output 65K

• Bobot dan akses — Fugu Ultra v2 tertutup, UE/EEA dikecualikan vs Gemini 3.1 Pro proprieter tetapi tersedia secara luas di seluruh platform Google

Baris multimodal adalah baris yang perlu ditangani dengan hati-hati, karena paling banyak dikutip dan paling tidak kokoh. Agregasi CharXiv milik BenchLM menempatkan Fugu Ultra v2 unggul 6,4 poin ternormalisasi — dan halaman yang sama menyatakan secara gamblang bahwa baris terarah tidak pernah menerima pemenang, bahwa Gemini tidak memiliki hasil terukur dalam kategori agentik, coding, pengetahuan, atau multibahasa, dan bahwa Fugu tidak memiliki satu pun di matematika atau multibahasa. Kategori yang hanya satu sisinya telah diukur pada sebagian besar baris tidak dapat menghasilkan putusan. Jika tidak ada hal lain yang Anda ambil dari perbandingan ini, ambil ini: secara khusus pada pekerjaan multimodal, bukti yang dipublikasikan tidak mendukung kesimpulan ke arah mana pun, dan satu-satunya baris yang ada secara eksplisit bukanlah hasil yang sudah final.

Kemungkinan yang mengubah kerangka

Sakana tidak akan mengungkapkan apa yang ada di dalam pool. Itu adalah pilihan desain yang didokumentasikan, bukan kelalaian — FAQ menyatakan bahwa informasi perutean memang tidak diungkapkan karena dirancang demikian, dan tidak ada mekanisme untuk memeriksanya. Yang kita ketahui dari generasi Juni adalah bahwa anggota pool yang dilaporkan mencakup Gem​ini 3.1 Pro bersama model-model terdepan lainnya. Versi 2.0 mengubah pool tersebut, dan Sakana menggambarkan perubahan itu hanya melalui pengurangan: Claude Fable 5, Claude Fable 5.1, dan GPT-6 Astra keluar. Tidak ada apa pun dalam rilis tersebut yang menyatakan bahwa Gem​ini masih ada di dalamnya.

Jika Gemini 3.1 Pro ada dalam kumpulan model, tiga konsekuensi menyusul, dan ketiganya bersifat praktis, bukan filosofis. Pertama, sebagian dari performa multimodal Fugu Ultra v2 adalah performa Gemini, yang digabungkan dengan performa model lain — artinya Anda membayar premi koordinasi di atas tarif per token yang bisa Anda bayar langsung. Kedua, Fugu Ultra v2 dengan biaya output $30 per juta versus Gemini 3.1 Pro $12 adalah premi untuk perakitan, bukan untuk kemampuan mentah; jika tugas Anda hanya satu pertanyaan multimodal, Gemini menjawabnya dengan lebih murah dan Anda dapat melihat persis model mana yang menjawab. Ketiga, dan yang paling berguna, tolok ukur yang jujur untuk sebuah orkestrator bukanlah "apakah ia mengalahkan komponen-komponennya" melainkan "apakah ia mengalahkan komponen terbaiknya ketika Anda menggunakannya sendirian." Arsitektur Sakana dibangun atas klaim bahwa ia mampu melakukannya, pada tugas-tugas yang dapat diverifikasi. Klaim itu layak diuji pada beban kerja Anda sendiri sebelum Anda menerimanya berdasarkan tolok ukur pembacaan grafik.

Ada versi di mana jawabannya adalah tidak dan orkestrator tetap layak mendapatkan tempatnya. Jika Gem​ini ada di dalam kumpulan dan skor Chartography Fugu Ultra v2 sebesar 48,3 melawan 27,3 milik Claude Opus 5 tetap bertahan, maka yang dibangun Sakana adalah lapisan koordinasi yang secara andal memperoleh lebih banyak dari model yang sama daripada yang Anda dapatkan dengan memanggilnya sekali. Itu produk nyata, dan pertanyaan yang masih terbuka hanyalah apakah marginnya menutupi harganya. Belum ada yang mempublikasikan eksperimen itu.

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

Di mana batas-batas yang jujur berada

Keunggulan Gem​ini 3.1 Pro bersifat konkret. Harganya sekitar dua per lima harga Fugu Ultra v2 untuk input dan output, dan tidak seperti Fugu, tarifnya tidak berlipat ganda setelah melewati ambang batas konteks — lonjakan pada 200K lebih landai daripada tebing 272K. Model ini mendokumentasikan modalitasnya alih-alih mewarisinya, yang berarti pekerjaan audio dan video adalah fitur yang didukung, bukan sekadar harapan. Model ini memiliki batas keluaran yang dipublikasikan. Model ini tersedia melalui permukaan milik Goo​gle sendiri dan, seperti model lain yang dijadikan pembanding Fugu Ultra v2, model ini dapat dipanggil di OrcaRouter — sebagai google/gemini-3.1-pro-preview, pada harga daftar Goo​gle dengan markup 0%, sehingga perubahan harga Goo​gle langsung berlaku pada kunci yang sama pada hari yang sama saat diumumkan.

Keunggulan Fugu Ultra v2 lebih sempit dan nyata. Ia menyerang masalah sulit lebih dari sekali, dengan peran Verifier yang memeriksa pekerjaan, itulah sebabnya klaim terkuatnya berada pada benchmark yang kebenarannya dapat diperiksa — Chartography, DeepSWE, Toolathon — bukan pada daya ingat pengetahuan. Studi kasus terbitan Sakana juga condong ke arah yang sama: sebuah iris CAD mekanis yang membuka dan menutup dengan benar, di mana model lain meninggalkan celah dan sambungan yang lemah; pemecah kubus Rubik berbasis Python murni yang menyelesaikan semua 300 kubus acak, sedangkan dua baseline frontier anonim gagal total. Baseline tersebut dianonimkan dan dipilih vendor, jadi perlakukan sebagai ilustrasi, bukan bukti. Tetapi polanya konsisten di seluruh rilis, dan ini menggambarkan kemampuan asli yang tidak dimiliki oleh satu panggilan model: kegigihan terhadap suatu masalah sampai jawabannya lolos pemeriksaan.

Pertimbangkan juga kendalanya. Fugu Ultra v2 tidak dijual di UE atau EEA, dan Sakana secara eksplisit menyatakan bahwa pihaknya sedang berupaya mencapai kepatuhan GDPR. Gem​ini 3.1 Pro tidak memiliki batasan semacam itu dan memiliki rekam jejak evaluasi independen yang jauh lebih panjang di belakangnya.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Putusan

Untuk sebagian besar pekerjaan multimodal, Gem​ini 3.1 Pro adalah pilihan yang tepat dan tidak ada yang mendekatinya. Harganya lebih murah per token, lebih murah per dokumen, terdokumentasi untuk audio dan video, dibatasi pada ambang konteks yang tidak menggandakan tagihan Anda di tengah proses, dan — bagian yang paling penting di sini — Anda dapat melihat apa yang menjawab Anda. Jika Anda membutuhkan satu model untuk membaca PDF, menonton klip, dan menjawab pertanyaan, tidak ada alasan untuk mengarahkannya melalui kumpulan yang tidak diungkapkan dengan harga output dua setengah kali lipat.

Fugu Ultra v2 adalah pilihan yang tepat untuk bentuk pekerjaan yang spesifik dan jauh lebih sempit: tugas berhorizon panjang dengan jawaban yang dapat diverifikasi, di mana mencoba suatu masalah dengan tiga cara dan memverifikasi hasilnya lebih baik daripada mencobanya sekali, dan di mana poin kualitas marginalnya sepadan dengan kelipatannya. Ini sama sekali di luar pertimbangan jika Anda memiliki pengguna UE atau EEA dalam cakupan.

Pertanyaan tidak nyaman yang dibiarkan terbuka oleh pertarungan ini adalah pertanyaan yang belum diukur oleh siapa pun. Jika Gemini 3.1 Pro ada di dalam pool — dan satu-satunya jawaban jujur hari ini adalah bahwa Sakana belum mengatakan bahwa ia tidak ada di sana — maka sebagian dari apa yang Anda beli dengan Fugu Ultra v2 adalah Gemini 3.1 Pro dengan lapisan koordinasi di atasnya, pada harga yang menyiratkan bahwa lapisan itu bernilai kira-kira dua setengah kali lipat modelnya. Itu bisa saja benar. Arsitektur Sakana dibangun untuk membuatnya benar. Tetapi itu adalah hipotesis dengan papan skor vendor di belakangnya dan tanpa uji independen, dan sampai seseorang menjalankannya, model yang dapat Anda lihat adalah model yang dapat Anda pertahankan.