
Fugu Ultra v2 vs Gemini 3.1 Pro: lawan yang mungkin sudah berada di dalam mesin
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ada versi perbandingan Fugu Ultra v2 vs Gemini 3.1 Pro yang mana Gemini menang apa pun hasil benchmarknya — karena ia mungkin melakukan sebagian pekerjaannya. Sistem orkestrasi Sakana AI, yang dirilis 11 September 2026, tidak mengungkapkan model mana yang dikoordinasikannya; kumpulan yang dilaporkan Fugu Ultra edisi Juni mencakup Gemini 3.1 Pro di antara yang lain, dan versi 2.0 hanya memberi tahu kita apa yang dihilangkannya, dengan menyebut Claude Fable 5, Claude Fable 5.1, dan GPT-6 Astra sebagai yang dikecualikan. Gemini 3.1 Pro milik Google adalah satu model frontier multimodal dengan konteks 1 juta token yang menangani teks, gambar, PDF, audio, dan video, tersedia secara umum sejak Mei 2026 dengan tarif $2,00 per juta token input dan $12,00 per juta token output. Salah satunya adalah model yang dapat Anda periksa. Yang lainnya adalah sistem yang kemenangan benchmark-nya mungkin mengalir melalui model pertama, dan tidak ada vendor yang akan memberi tahu Anda apakah memang begitu.
Apa sebenarnya setiap sistem itu
Gemini 3.1 Pro terbaca dengan jelas dengan cara yang kini jarang ditemui di antara rilis model terdepan. Ini adalah transformer sparse mixture-of-experts dari Google DeepMind, pertama kali dikirim dalam pratinjau pada 19 Februari 2026, dengan satu sumber menyebut ketersediaan umum pada Mei 2026 — daftar kami sendiri memuatnya di bawah ID model pratinjau. Model ini memiliki jendela masukan 1M token dan batas keluaran 65K token, menerima teks, gambar, PDF, audio, video, dan kode, serta menyediakan kontrol penalaran tiga tingkat — rendah, sedang, atau tinggi — dengan tinggi sebagai bawaan API. Google melaporkan 77,1% pada ARC-AGI-2, lebih dari dua kali lipat 31,1% dari generasi sebelumnya; 94,3% pada GPQA Diamond; 80,6% pada SWE-bench Verified; 68,5% pada Terminal-Bench 2.0; 85,9% pada BrowseComp; dan 44,4% pada Humanity's Last Exam tanpa alat, naik menjadi 51,4% dengan pencarian dan eksekusi kode. Itu adalah angka dari vendor. Batas pengetahuannya adalah Januari 2025, yang perlu dicatat jika pekerjaan Anda bergantung pada peristiwa terkini.
Fugu Ultra v2 adalah koordinator. Ini adalah model terlatih, dilaporkan sekitar 7B parameter, yang membaca permintaan, menyusun tim agen dengan peran Thinker, Worker, dan Verifier yang diambil dari riset TRINITY milik Sakana, dan menyintesis jawaban di balik endpoint yang kompatibel dengan OpenAI. Tidak ada daftar modalitas yang dipublikasikan miliknya sendiri — apa pun yang dapat dilihatnya, ia melihatnya karena ada model di pool-nya yang dapat melihatnya. Konteksnya adalah 1M token dengan jurang harga yang tajam pada 272K, di mana tarifnya berlipat dua menjadi $10 untuk input dan $45 untuk output. Batas outputnya tidak dipublikasikan. Pool-nya tidak diungkapkan, keputusan peruteannya "tidak diekspos secara desain," dan untuk tier Ultra pool-nya tetap, sehingga Anda tidak dapat mengecualikan penyedia.
Asimetri itulah keseluruhan pertarungannya. Gemini 3.1 Pro adalah komponen yang dapat Anda beli secara langsung dan bernalar tentangnya. Fugu Ultra v2 adalah rakitan yang bagian-bagiannya tidak dapat Anda lihat dan yang klaim benchmark terkuatnya mungkin, sebagian, adalah hasil Gemini sendiri yang digabungkan dengan hasil orang lain.

Perbandingan di mana keduanya tumpang tindih
Sangat sedikit bukti yang dipublikasikan yang menyejajarkan kedua sistem pada baris yang sama. Angka Gemini 3.1 Pro di bawah ini adalah milik Google sendiri; angka Fugu Ultra v2 adalah milik Sakana sendiri; jika ada agregator pihak ketiga yang telah menerbitkan baris bersama, hal itu ditandai dan disertai catatan bahwa sifatnya hanya indikatif, bukan menentukan.
• Penalaran multimodal (CharXiv, baris bersama) — Fugu Ultra v2 86,6% vs Gemini 3.1 Pro 80,2%, menurut BenchLM, yang menandai kategori ini sebagai direksional dan menolak menyebutkan pemenang
• TerminalBench 2.1 — tidak ada angka Fugu Ultra v2 v2.0 vs Gemini 3.1 Pro, tidak ada angka setara yang dipublikasikan; Fugu Ultra Juni melaporkan 82,1% berbanding 70,3% milik Gemini 3.1 Pro dalam agregasi pihak ketiga
• SWE-Bench Pro — tidak ada angka Fugu Ultra v2 v2.0 vs Gemini 3.1 Pro, tidak ada angka terbitan yang sebanding; Fugu Ultra edisi Juni melaporkan 73,7% dibandingkan 54,2% milik Gemini 3.1 Pro
• ARC-AGI-2 — tidak ada angka Fugu Ultra v2 vs Gemini 3.1 Pro 77,1%, dilaporkan vendor
• Humanity's Last Exam — tidak ada angka untuk Fugu Ultra v2 v2.0 vs Gemini 3.1 Pro, 44,4% tanpa alat, 51,4% dengan alat, dilaporkan vendor
• Cakupan modalitas — Fugu Ultra v2 mewarisi apa pun yang didukung pool-nya, tidak diungkapkan vs Gemini 3.1 Pro yang terdokumentasi untuk teks, gambar, PDF, audio, video, dan kode
• Harga input / output — Fugu Ultra v2 $5.00 / $30.00 per 1M, dua kali lipat di atas 272K vs Gemini 3.1 Pro $2.00 / $12.00 per 1M hingga 200K, $4.00 / $18.00 di luar itu, input yang di-cache $0.20 / $0.40
• Konteks dan output — Fugu Ultra v2 konteks 1M, batas output tidak dipublikasikan vs Gemini 3.1 Pro input 1M, output 65K
• Bobot dan akses — Fugu Ultra v2 tertutup, UE/EEA dikecualikan vs Gemini 3.1 Pro proprieter tetapi tersedia secara luas di seluruh platform Google
Baris multimodal adalah baris yang perlu ditangani dengan hati-hati, karena paling banyak dikutip dan paling tidak kokoh. Agregasi CharXiv milik BenchLM menempatkan Fugu Ultra v2 unggul 6,4 poin ternormalisasi — dan halaman yang sama menyatakan secara gamblang bahwa baris terarah tidak pernah menerima pemenang, bahwa Gemini tidak memiliki hasil terukur dalam kategori agentik, coding, pengetahuan, atau multibahasa, dan bahwa Fugu tidak memiliki satu pun di matematika atau multibahasa. Kategori yang hanya satu sisinya telah diukur pada sebagian besar baris tidak dapat menghasilkan putusan. Jika tidak ada hal lain yang Anda ambil dari perbandingan ini, ambil ini: secara khusus pada pekerjaan multimodal, bukti yang dipublikasikan tidak mendukung kesimpulan ke arah mana pun, dan satu-satunya baris yang ada secara eksplisit bukanlah hasil yang sudah final.
Kemungkinan yang mengubah kerangka
Sakana tidak akan mengungkapkan apa yang ada di dalam pool. Itu adalah pilihan desain yang didokumentasikan, bukan kelalaian — FAQ menyatakan bahwa informasi perutean memang tidak diungkapkan karena dirancang demikian, dan tidak ada mekanisme untuk memeriksanya. Yang kita ketahui dari generasi Juni adalah bahwa anggota pool yang dilaporkan mencakup Gemini 3.1 Pro bersama model-model terdepan lainnya. Versi 2.0 mengubah pool tersebut, dan Sakana menggambarkan perubahan itu hanya melalui pengurangan: Claude Fable 5, Claude Fable 5.1, dan GPT-6 Astra keluar. Tidak ada apa pun dalam rilis tersebut yang menyatakan bahwa Gemini masih ada di dalamnya.
Jika Gemini 3.1 Pro ada dalam kumpulan model, tiga konsekuensi menyusul, dan ketiganya bersifat praktis, bukan filosofis. Pertama, sebagian dari performa multimodal Fugu Ultra v2 adalah performa Gemini, yang digabungkan dengan performa model lain — artinya Anda membayar premi koordinasi di atas tarif per token yang bisa Anda bayar langsung. Kedua, Fugu Ultra v2 dengan biaya output $30 per juta versus Gemini 3.1 Pro $12 adalah premi untuk perakitan, bukan untuk kemampuan mentah; jika tugas Anda hanya satu pertanyaan multimodal, Gemini menjawabnya dengan lebih murah dan Anda dapat melihat persis model mana yang menjawab. Ketiga, dan yang paling berguna, tolok ukur yang jujur untuk sebuah orkestrator bukanlah "apakah ia mengalahkan komponen-komponennya" melainkan "apakah ia mengalahkan komponen terbaiknya ketika Anda menggunakannya sendirian." Arsitektur Sakana dibangun atas klaim bahwa ia mampu melakukannya, pada tugas-tugas yang dapat diverifikasi. Klaim itu layak diuji pada beban kerja Anda sendiri sebelum Anda menerimanya berdasarkan tolok ukur pembacaan grafik.
Ada versi di mana jawabannya adalah tidak dan orkestrator tetap layak mendapatkan tempatnya. Jika Gemini ada di dalam kumpulan dan skor Chartography Fugu Ultra v2 sebesar 48,3 melawan 27,3 milik Claude Opus 5 tetap bertahan, maka yang dibangun Sakana adalah lapisan koordinasi yang secara andal memperoleh lebih banyak dari model yang sama daripada yang Anda dapatkan dengan memanggilnya sekali. Itu produk nyata, dan pertanyaan yang masih terbuka hanyalah apakah marginnya menutupi harganya. Belum ada yang mempublikasikan eksperimen itu.

Di mana batas-batas yang jujur berada
Keunggulan Gemini 3.1 Pro bersifat konkret. Harganya sekitar dua per lima harga Fugu Ultra v2 untuk input dan output, dan tidak seperti Fugu, tarifnya tidak berlipat ganda setelah melewati ambang batas konteks — lonjakan pada 200K lebih landai daripada tebing 272K. Model ini mendokumentasikan modalitasnya alih-alih mewarisinya, yang berarti pekerjaan audio dan video adalah fitur yang didukung, bukan sekadar harapan. Model ini memiliki batas keluaran yang dipublikasikan. Model ini tersedia melalui permukaan milik Google sendiri dan, seperti model lain yang dijadikan pembanding Fugu Ultra v2, model ini dapat dipanggil di OrcaRouter — sebagai google/gemini-3.1-pro-preview, pada harga daftar Google dengan markup 0%, sehingga perubahan harga Google langsung berlaku pada kunci yang sama pada hari yang sama saat diumumkan.
Keunggulan Fugu Ultra v2 lebih sempit dan nyata. Ia menyerang masalah sulit lebih dari sekali, dengan peran Verifier yang memeriksa pekerjaan, itulah sebabnya klaim terkuatnya berada pada benchmark yang kebenarannya dapat diperiksa — Chartography, DeepSWE, Toolathon — bukan pada daya ingat pengetahuan. Studi kasus terbitan Sakana juga condong ke arah yang sama: sebuah iris CAD mekanis yang membuka dan menutup dengan benar, di mana model lain meninggalkan celah dan sambungan yang lemah; pemecah kubus Rubik berbasis Python murni yang menyelesaikan semua 300 kubus acak, sedangkan dua baseline frontier anonim gagal total. Baseline tersebut dianonimkan dan dipilih vendor, jadi perlakukan sebagai ilustrasi, bukan bukti. Tetapi polanya konsisten di seluruh rilis, dan ini menggambarkan kemampuan asli yang tidak dimiliki oleh satu panggilan model: kegigihan terhadap suatu masalah sampai jawabannya lolos pemeriksaan.
Pertimbangkan juga kendalanya. Fugu Ultra v2 tidak dijual di UE atau EEA, dan Sakana secara eksplisit menyatakan bahwa pihaknya sedang berupaya mencapai kepatuhan GDPR. Gemini 3.1 Pro tidak memiliki batasan semacam itu dan memiliki rekam jejak evaluasi independen yang jauh lebih panjang di belakangnya.

Putusan
Untuk sebagian besar pekerjaan multimodal, Gemini 3.1 Pro adalah pilihan yang tepat dan tidak ada yang mendekatinya. Harganya lebih murah per token, lebih murah per dokumen, terdokumentasi untuk audio dan video, dibatasi pada ambang konteks yang tidak menggandakan tagihan Anda di tengah proses, dan — bagian yang paling penting di sini — Anda dapat melihat apa yang menjawab Anda. Jika Anda membutuhkan satu model untuk membaca PDF, menonton klip, dan menjawab pertanyaan, tidak ada alasan untuk mengarahkannya melalui kumpulan yang tidak diungkapkan dengan harga output dua setengah kali lipat.
Fugu Ultra v2 adalah pilihan yang tepat untuk bentuk pekerjaan yang spesifik dan jauh lebih sempit: tugas berhorizon panjang dengan jawaban yang dapat diverifikasi, di mana mencoba suatu masalah dengan tiga cara dan memverifikasi hasilnya lebih baik daripada mencobanya sekali, dan di mana poin kualitas marginalnya sepadan dengan kelipatannya. Ini sama sekali di luar pertimbangan jika Anda memiliki pengguna UE atau EEA dalam cakupan.
Pertanyaan tidak nyaman yang dibiarkan terbuka oleh pertarungan ini adalah pertanyaan yang belum diukur oleh siapa pun. Jika Gemini 3.1 Pro ada di dalam pool — dan satu-satunya jawaban jujur hari ini adalah bahwa Sakana belum mengatakan bahwa ia tidak ada di sana — maka sebagian dari apa yang Anda beli dengan Fugu Ultra v2 adalah Gemini 3.1 Pro dengan lapisan koordinasi di atasnya, pada harga yang menyiratkan bahwa lapisan itu bernilai kira-kira dua setengah kali lipat modelnya. Itu bisa saja benar. Arsitektur Sakana dibangun untuk membuatnya benar. Tetapi itu adalah hipotesis dengan papan skor vendor di belakangnya dan tanpa uji independen, dan sampai seseorang menjalankannya, model yang dapat Anda lihat adalah model yang dapat Anda pertahankan.
