Kartu judul hero untuk Fugu Ultra v2 vs Claude Opus 5 dengan subjudul 'Harga input sama, dua taruhan berbeda', badge pil bertuliskan '$5.00 input keduanya', 'Chartography 48.3 vs 27.3' dan 'konteks 1M', baris footer 'Sakana AI vs Anthropic - September 2026', serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5: harga input sama, dua taruhan berbeda

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

Kebetulan yang membentuk segalanya

Mulailah dari hal yang disepakati kedua produk, karena itu lebih dari sekadar harga yang ditonjolkan.

• Harga input — Fugu Ultra v2 $5,00 per 1 juta token vs Claude Opus 5 $5,00 per 1 juta token

• Harga output — Fugu Ultra v2 $30.00 per 1 juta token vs Claude Opus 5 $25.00 per 1 juta token

• Input cache — Fugu Ultra v2 $0.50 per 1M di atas tarif dasar vs Claude Opus 5, yang menerapkan caching sebagai diskon hingga 90% untuk input cache

• Konteks — Fugu Ultra v2 1M token, dengan tarif berlipat ganda di atas 272K dibanding Claude Opus 5 1M token yang tetap

• Batas keluaran — Fugu Ultra v2 tidak dipublikasikan sebagai satu angka dibandingkan dengan Claude Opus 5 128K token

• Ketersediaan — Fugu Ultra v2 tidak dijual di UE/EEA, sedangkan Claude Opus 5 tersedia secara umum berdasarkan ketentuan API standar

• Bukti — benchmark yang dilaporkan vendor untuk Fugu Ultra v2, belum ada evaluasi independen sampai sekarang, dibandingkan dengan benchmark vendor Claude Opus 5 plus posisi papan peringkat pihak ketiga selama berbulan-bulan

Baris terakhir itulah tempat pertandingan sebenarnya berbalik. Pada harga input yang sama, Anda memilih antara sistem yang skornya harus Anda terima begitu saja dan model yang skornya telah direproduksi oleh orang lain. Jurang 272K memperburuknya: melewati ambang itu, tarif input Fugu Ultra v2 menjadi dua kali lipat jadi $10 dan outputnya $45, sementara tarif Claude Opus 5 tidak berubah. Untuk eksekusi agen dengan konteks panjang — beban kerja persis yang dirancang untuk Fugu Ultra v2 — keunggulan harga dari angka utama yang lebih murah hilang tepat di tempat sistem itu seharusnya bersinar.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Apa sebenarnya masing-masing itu

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

Fugu Ultra v2 bukan itu, dan perbedaannya bukan sekadar kosmetik. Ia adalah koordinator — model kecil terlatih, dilaporkan sekitar 7B parameter, yang membaca permintaan Anda, menyusun tim agen, menetapkan peran Thinker, Worker, dan Verifier dari karya TRINITY Sakana, dan menyintesis jawaban akhir. Model dasarnya tidak diungkapkan, keputusan perutean tidak diekspos secara sengaja, dan untuk tier Ultra kumpulannya tetap: Anda tidak dapat mengeluarkan vendor mana pun. Kerangka Sakana sendiri untuk versi 2 adalah bahwa batas akhir pelatihan dipindahkan ke 28 Agustus 2026 dan komposisi kumpulan berubah — khususnya untuk mengecualikan Claude Fable 5, Claude Fable 5.1, dan GPT-6 Astra.

Pengecualian itu adalah detail paling mengungkap dalam rilis tersebut. Fugu Ultra v2 mengklaim kemenangan benchmark atas tiga model terkuat yang tersedia sekaligus mengonfirmasi bahwa ia tidak memanggil satu pun dari mereka. Apa pun yang memang ada dalam kumpulan itu, itu bukan puncak pasar menurut perhitungan Sakana sendiri. Narasinya adalah bahwa koordinasi mengalahkan kapabilitas. Itu adalah tesis yang nyata, dan pada tugas-tugas yang dapat diverifikasi dengan pemeriksa murah, itu adalah tesis yang didukung bukti. Itu bukan klaim yang sama dengan "sistem ini lebih pintar daripada Claude Opus 5," dan papan skor disusun sedemikian rupa sehingga keduanya mudah dikacaukan.

Papan skor yang dipilih Sakana

Setiap angka di bawah ini berasal dari evaluasi Sakana sendiri terhadap Fugu Ultra v2. Angka-angka Claude Opus 5 adalah sebagaimana diukur oleh Sakana dalam perbandingan yang sama, kecuali jika dinyatakan lain. Belum ada pihak independen yang mereproduksi kolom Fugu, dan hingga tulisan ini dibuat, tidak ada entri Artificial Analysis untuk model Fugu mana pun.

• Chartography — Fugu Ultra v2 48.3 vs Claude Opus 5 27.3 — dilaporkan vendor, selisih 21 poin

• DeepSWE — Fugu Ultra v2 74.3 vs tidak ada angka Claude Opus 5 yang dipublikasikan dalam tabel yang sama — dilaporkan vendor

• Posisi benchmark — Fugu Ultra v2 terbaik atau setara terbaik pada lima dari delapan, dua teratas pada tujuh dari delapan — dilaporkan vendor

• SWE-bench Verified — tidak ada angka untuk Fugu Ultra v2 vs Claude Opus 5 96,0% — dilaporkan Anthropic

• SWE-bench Pro — tidak ada angka Fugu Ultra v2 vs Claude Opus 5 79,2% — dilaporkan Anthropic

• ARC-AGI 3 — tidak ada angka Fugu Ultra v2 vs Claude Opus 5 ~30,2% — dilaporkan Anthropic

Baca itu sebagai bentuk, bukan peringkat. Sakana menerbitkan papan delapan tolok ukur yang di dalamnya ia menang di lima, dan hasil terkuat Claude Opus 5 yang terdokumentasi publik — baris SWE-bench, ARC-AGI 3 — sama sekali tidak ada di sana. Itu bukan tuduhan iktikad buruk; begitulah bentuk papan skor vendor, termasuk papan skor setiap vendor. Tapi itu berarti Anda tidak dapat menyimpulkan dari rilis tersebut bahwa Fugu Ultra v2 mengalahkan Claude Opus 5 dalam rekayasa perangkat lunak, karena kedua sistem itu tidak diukur pada baris yang sama cukup sering untuk bisa mengatakan demikian. Pada satu-satunya baris tempat keduanya muncul dan kedua angkanya publik — Chartography — Fugu Ultra v2 mengklaim kemenangan besar. Pada baris penalaran dan pengodean yang paling luas, hanya satu pihak yang telah menerbitkan.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

Biaya per tugas, bukan biaya per token

Tagihan token sebuah orkestrator bukan tarif per tokennya. Fugu Ultra v2 memunculkan agen, masing-masing menyumbang token penalaran dan keluaran, dan koordinator itu sendiri menghasilkan teks sintesis. FAQ harga Sakana membuat komitmen yang benar-benar berguna di sini — Anda dikenai satu tarif campuran berdasarkan model tingkat teratas yang terlibat, dan menambahkan agen tidak melipatgandakan tagihan — yang menghilangkan perkalian fan-out kasus terburuk yang membuat penyiapan multi-agen yang naif menjadi mahal. Namun, ini tidak menghilangkan volumenya. Jumlah token keluaran yang ditagih tetap merupakan fungsi dari berapa banyak agen yang berjalan dan seberapa banyak yang mereka tulis, dan pada $30 per juta, volume itu adalah variabel yang tidak dapat Anda prediksi dari halaman harga.

Bentuk biaya Claude Opus 5 justru kebalikannya. Satu panggilan, satu model, pengatur effort yang Anda kendalikan, dan tarif output $25 dengan pemrosesan batch yang tersedia dengan diskon 50% untuk pekerjaan non-real-time. Anda dapat meramalkannya. Untuk beban kerja yang Anda jalankan sepuluh ribu kali sehari, kemampuan peramalan jauh lebih bernilai daripada selisih benchmark pada tugas membaca grafik.

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

Di mana Fugu Ultra v2 benar-benar unggul

Berikan penghargaan yang pantas kepada sistem ini. Hasil Chartography, jika bertahan, adalah jenis kemenangan yang sulit dipalsukan oleh model tunggal: penalaran visual atas dokumen terstruktur memberi ganjaran pada upaya mencoba suatu pembacaan, memeriksanya terhadap dokumen, dan mencoba lagi — yang persis menjadi fungsi peran Verifier. Logika yang sama berlaku untuk Toolathon dan DeepSWE, yang jawabannya dapat diuji alih-alih diperdebatkan. Studi kasus terbitan Sakana juga mengarah ke arah yang sama: AutoResearch run dengan 123 eksperimen selama empat belas jam di satu H100, pemecah kubus Rubik's murni-Python yang menyelesaikan semua 300 kubus yang diacak sementara dua baseline frontier yang dianonimkan mengalami crash total, sebuah iris CAD mekanis yang benar-benar membuka dan menutup. Ini adalah contoh yang dipilih vendor dengan baseline yang dianonimkan, jadi buktinya tidak sekuat yang terlihat. Tetapi polanya konsisten, dan ini menunjuk pada kategori yang nyata: tugas-tugas yang kebenarannya dapat diperiksa dan bagian sulitnya adalah ketekunan.

Ada juga argumen struktural yang tidak ada hubungannya dengan tolok ukur. Claude Opus 5 adalah model milik satu vendor, yang tunduk pada keputusan penetapan harga, jadwal penghentian, dan kebijakan vendor tersebut. Fugu Ultra v2 dirancang untuk bertahan jika salah satu dari hal-hal itu berubah, dan Sakana secara eksplisit menyatakan bahwa itulah intinya — vendor lock-in, pencabutan API, kontrol ekspor. Di pasar tempat model telah ditarik dari wilayah dengan pemberitahuan yang minim, itu bukan hal hipotetis. Ini adalah lindung nilai, dan lindung nilai membutuhkan biaya: $5 lebih per juta token keluaran kira-kira adalah harga dari lindung nilai ini.

Putusan

Claude Opus 5 memenangkan keputusan yang sebenarnya dibuat sebagian besar tim. Ia didukung oleh evaluasi independen selama berbulan-bulan, jendela 1M token yang tidak menggandakan harga di tengah dokumen Anda, batas output 128K, harga terbitan yang dapat Anda perkirakan, pengatur upaya yang memungkinkan Anda membeli penalaran hanya ketika tugasnya memang layak, dan hasil pihak ketiga pada tolok ukur yang tepat — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — yang paling dipedulikan oleh tim agentic dan coding. Fugu Ultra v2 memenangkan pertanyaan yang lebih sempit dan lebih menarik: apakah koordinator dengan kumpulan model yang lebih kecil dapat mengalahkan model unggulan pada tugas-tugas di mana jawabannya dapat diperiksa. Papan skor Sakana sendiri menyatakan ya pada lima dari delapan baris, dan eksklusi kumpulan model menunjukkan bahwa kemenangan itu diperoleh tanpa tiga model terbaik di dunia.

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari