Sebuah kartu judul hero bertuliskan 'Fugu Ultra v2 vs Qwen3.8-Max' dengan subjudul 'Mengapa label harga adalah angka yang salah', tiga lencana pil bertuliskan 'Output: $30.00 vs $6.00', 'Di atas 272K: tarif menjadi dua kali lipat' dan 'Skor Fugu independen: tidak ada', baris footer bertuliskan 'Sakana AI, 11 September 2026 vs Alibaba, Agustus 2026', dan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Fugu Ultra v2 vs Qwen3.8-Max: mengapa angka pada label harga itu salah

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Fugu Ultra v2 berbiaya $30,00 per juta token keluaran. Qwen3.8-Max berbiaya $6,00. Itu selisih lima banding satu, dan jika Anda memilih di antara dua sistem agentik ini berdasarkan rasio tersebut, Anda akan salah memilih — karena tidak satu pun dari keduanya benar-benar ditagih seperti yang tersirat dalam daftar harganya. Menurut pengukuran Artificial Analysis sendiri, Qwen3.8-Max menghasilkan 180 juta token keluaran untuk menyelesaikan Intelligence Index, lebih dari dua kali lipat angka 89 juta milik model median, dengan biaya $2,67 per tugas. Ia model yang hemat dari sisi token tetapi boros dari sisi jawaban. Fugu Ultra v2 milik Sakana AI, yang dirilis 11 September 2026, memiliki bentuk yang berlawanan: kumpulan model lab lain yang tidak diungkapkan, yang ia jalankan dan koordinasikan per permintaan, ditagih dengan satu tarif campuran yang menurut Sakana tidak berlipat saat agen ditambahkan. Yang satu adalah model tunggal berparameter 2,4 triliun yang mengekspresikan proses berpikirnya dalam waktu lama. Yang lain adalah koordinator kecil yang menyewa bantuan. Membandingkan harga token keduanya hampir tidak memberi tahu Anda mana yang lebih murah untuk dijalankan.

Dua cara berlawanan untuk menjadi mahal

Mulailah dari mekanismenya, karena hal itulah yang menjelaskan setiap perbedaan lainnya dalam perbandingan ini.

Qwen3.8-Max adalah model sparse mixture-of-experts — 2,4 triliun parameter total, sekitar 95 miliar aktif per token — yang mencapai hasil yang mendekati frontier dengan bekerja lebih lama, bukan dengan menjadi lebih besar. Artificial Analysis mengukurnya pada 37,8 token output per detik, memeringkatkannya di #154 dari 200 model dalam hal kecepatan, dengan 180 juta token output yang dihasilkan di seluruh Intelligence Index (#70 dari 200 dalam hal verbositas). Biaya per tugas Intelligence Index-nya tercatat $2,67, dan diskon cache-nya luar biasa besar, yaitu 88%, yang merupakan pengungkit yang sebenarnya mengendalikan tagihan di sini: proses agen yang panjang yang terus membaca ulang konteks yang sama itu murah, sedangkan yang terus menghasilkan teks baru tidak.

Fugu Ultra v2 mendekati masalah yang sama dari ujung yang lain. Ini adalah orkestrator — koordinator kecil yang dilatih, dilaporkan berukuran sekitar 7 miliar parameter, yang membaca permintaan, menyusun tim agen dalam peran Thinker, Worker, dan Verifier dari karya TRINITY Sakana, lalu menyintesis jawaban. Tagihan tokennya adalah jumlah dari apa yang dihasilkan sub-agennya ditambah teks sintesis koordinator itu sendiri. Sakana berkomitmen dalam FAQ harganya bahwa Anda dikenakan satu tarif campuran yang dipatok pada model tingkat teratas yang terlibat dan bahwa menambahkan agen tidak melipatgandakan tagihan, yang menghilangkan ledakan multi-agen klasik ketika fan-out melipatgandakan biaya. Yang tidak dihilangkannya adalah volume. Pada $30,00 per juta token keluaran, angka yang penting adalah berapa banyak agen yang berjalan dan seberapa banyak yang mereka tulis, dan itu adalah angka yang tidak dapat Anda maupun Sakana prediksi dari halaman harga.

Itulah pembingkaian yang jujur atas selisih harga: ini adalah tarif, bukan total. Tarif yang lima kali lebih tinggi yang diterapkan pada beban kerja yang volume keluarannya tidak dapat Anda perkirakan bukanlah biaya lima kali lipat — melainkan kelipatan tak berbatas dengan batas bawah yang dapat diprediksi.

A two-column scoreboard titled 'Fugu Ultra v2 vs Qwen3.8-Max Scoreboard' contrasting six dimensions. Fugu Ultra v2: price $5.00/$30.00 per 1M, context 1M tokens, above 272K input doubles to $10, AA Index none published, speed not measured, weights closed with pool undisclosed. Qwen3.8-Max: price $2.00/$6.00 per 1M, context 1M tokens, above 272K no surcharge, AA Index 40 ranked #30 of 200, speed 37.8 tokens/sec, weights open checkpoint published. Footer reads 'Fugu Ultra v2 figures vendor-reported; no independent evaluation. Qwen3.8-Max figures per Artificial Analysis, recalibrated scale.' OrcaRouter logo bottom-right.

Lembar spesifikasi, dan satu baris yang menentukan segalanya

• Harga — Fugu Ultra v2 $5.00 masuk / $30.00 keluar per 1 juta token vs Qwen3.8-Max $2.00 masuk / $6.00 keluar

• Input cache — Fugu Ultra v2 $0,50 per 1 juta vs Qwen3.8-Max $0,25 per 1 juta pembacaan, dan diskon cache 88% yang diukur oleh Artificial Analysis

• Biaya tambahan konteks panjang — input Fugu Ultra v2 berlipat ganda menjadi $10.00 dan output menjadi $45.00 di atas 272K token, dibandingkan Qwen3.8-Max tanpa biaya tambahan prompt panjang, tetap hingga jendela konteks

• Jendela konteks — Fugu Ultra v2 1M token vs Qwen3.8-Max 1M token

• Batas keluaran — Fugu Ultra v2 tidak dipublikasikan sebagai satu angka vs Qwen3.8-Max sekitar 128K token

• Modalitas masukan — teks Fugu Ultra v2, dengan kemampuan pool itu sendiri di baliknya vs teks, gambar, video, dan PDF Qwen3.8-Max

• Bobot — Fugu Ultra v2 tertutup, keanggotaan pool tidak diungkapkan secara sengaja vs Qwen3.8-Max bobot terbuka yang diterbitkan untuk checkpoint kelas Max di bawah lisensi khusus

• Ketersediaan regional — Fugu Ultra v2 tidak dijual di UE/EEA, sedangkan Qwen3.8-Max tersedia tanpa pembatasan regional

• Evaluasi independen — Fugu Ultra v2 tidak ada yang dipublikasikan, dan tidak ada halaman Artificial Analysis untuk model Fugu mana pun vs Qwen3.8-Max, sebuah entri Artificial Analysis yang aktif dengan angka kecepatan, verbositas, dan biaya per tugas yang dipublikasikan

Baca dua baris terakhir secara bersamaan, dan pertandingannya makin tajam. Qwen3.8-Max adalah model yang dapat Anda patok berdasarkan versi, telusuri lisensinya, unduh checkpoint-nya, dan periksa terhadap papan skor pihak ketiga. Fugu Ultra v2 adalah sistem yang tidak dapat Anda inspeksi, tidak dapat Anda host sendiri, tidak dapat Anda beli di Eropa, dan tidak dapat Anda verifikasi terhadap siapa pun di luar Sakana. Biaya tambahan 272K memperparahnya: setelah ambang itu, tarif input Fugu Ultra v2 berlipat dua dan tarif outputnya naik setengah, sementara tarif Qwen3.8-Max tidak bergerak. Untuk pekerjaan dokumen dan repositori berjangka panjang yang menjadi sasaran kedua sistem ini, angka utama yang lebih murah juga yang lebih datar.

Angka Qwen3.8-Max yang dikutip semua orang sudah usang

Jika Anda telah membaca tentang model ini di mana pun dalam dua minggu terakhir, Anda mungkin pernah melihat Artificial Analysis Intelligence Index sebesar 58, atau 58,1, atau 58,4. Angka-angka itu nyata dan tidak lagi berlaku. Artificial Analysis mengalibrasi ulang indeksnya ke v4.3 pada 7 September 2026, memadatkan skor secara menyeluruh, dan halaman Qwen3.8-Max yang aktif kini menampilkan 40, menempatkannya di #30 dari 200 model — dengan lencana "Updated" yang menandai skor yang dinyatakan ulang. Tulisan-tulisan lama juga memuat beban usaha yang diukur pada skala sebelumnya: 64 giliran per tugas dibandingkan 14 untuk generasi Qwen sebelumnya, dan sekitar $1,14 per tugas Intelligence Index. Halaman saat ini menunjukkan $2,67 per tugas, 37,8 token keluaran per detik, dan 180 juta token keluaran pada indeks tersebut.

Ada dua hal yang menyusul. Pertama, pada skala yang telah dikalibrasi ulang, Qwen3.8-Max berada di pita yang sama dengan sisa lapis kedua frontier, bukan setara dengan frontier itu, dan perbandingan apa pun yang Anda baca yang menempatkannya berhadapan dengan Claude Opus 5 atau Kimi K3 pada angka 58 sedang membandingkan snapshot dari skala yang berbeda. Kedua, dan yang lebih berguna untuk pertarungan ini, koreksinya bersifat satu arah: Qwen3.8-Max memiliki angka yang bisa salah lalu diperbaiki. Fugu Ultra v2 tidak punya angka. Setiap angka Fugu dalam artikel ini berasal dari evaluasi Sakana sendiri, dan per 11 September tidak ada halaman Artificial Analysis untuk Fugu Ultra v2 atau model Fugu lainnya — URL-nya 404. Ketika vendor menerbitkan papan skor dan tidak ada pihak independen yang menjalankan modelnya, papan skor itulah seluruh catatan.

Di mana mereka sebenarnya tumpang tindih, dan di mana tidak

Sakana melaporkan Fugu Ultra v2 sebagai yang terbaik atau terbaik bersama pada lima dari delapan tolok ukur — GDP.pdf, Chartography, SWEFish, DeepSWE, dan Toolathon — serta masuk dua teratas pada tujuh dari delapan. Dua angka konkret dalam rilis tersebut adalah Chartography di 48,3, dibandingkan dengan 27,3 untuk Claude Opus 5 dan 29,5 untuk Claude Fable 5 dalam tabel yang sama, dan DeepSWE di 74,3. Baris yang diterbitkan Alibaba sendiri untuk Qwen3.8-Max mencakup Terminal-Bench 2.1 sebesar 86,6, OSWorld-Verified sebesar 86,1, GPQA Diamond sebesar 92,6, dan SWE-bench Pro sebesar 67,7.

Perhatikan apa yang dimiliki bersama oleh kedua daftar itu: tidak ada. Tidak satu pun benchmark muncul di kedua tabel vendor. Tidak ada baris tempat Anda bisa menyandingkan angka Sakana dan angka Alibaba lalu langsung menentukan pemenangnya, yang berarti jawaban jujur untuk "mana yang lebih baik dalam agen coding" adalah tidak ada bukti terbitan yang menjawabnya. Yang ada adalah satu sistem dengan delapan baris yang dipilih vendor dan tanpa verifikasi dari luar, serta satu sistem dengan baris vendor plus entri independen yang mengukur biaya dan kecepatan, bukan kemampuan secara head-to-head. Itu adalah celah dalam bukti, bukan celah dalam model, dan itu seharusnya mengubah cara Anda membeli: Anda tidak bisa memilih di antara ini berdasarkan benchmark, jadi pilihlah berdasarkan properti yang benar-benar bisa Anda verifikasi.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, with the opening paragraphs arguing that the frontier which matters is two-dimensional — capability against cost — and stating that Fugu Ultra v2 pushes peak performance higher without indispensable reliance on the frontier models it orchestrates.

Bobot terbuka versus kumpulan yang tidak diungkapkan

Di sinilah argumen lock-in yang biasa justru terbalik, dan itulah hal yang paling menarik dari pasangan tersebut.

Pitch Sakana untuk Fugu Ultra v2 adalah kedaulatan. Kumpulan model terbuka dan terspesialisasi yang dapat ditukar berarti tidak ada keputusan harga, jadwal penghentian, atau perubahan kebijakan dari satu vendor pun yang dapat menjatuhkan produk Anda, dan rilis ini menyatakan poin tersebut secara eksplisit dengan mencatat bahwa komposisi kumpulan itu berubah di v2. Perusahaan juga menyatakan secara gamblang bahwa skor Fugu Ultra v2 dicapai tanpa Claude Fable 5, Claude Fable 5.1, atau GPT-6 Astra di kumpulan agen — mengklaim kemenangan atas tiga model terkuat yang tersedia sekaligus menegaskan bahwa ia tidak memanggil satu pun dari mereka. Apa pun isi kumpulan itu, menurut perhitungan Sakana sendiri, itu bukan puncak pasar.

Tetapi lindung nilai ini memiliki biaya yang tidak tercantum dalam daftar harga. Anda tidak dapat melihat pool-nya, Anda tidak dapat mengikutsertakan atau mengeluarkan anggota dari tier Ultra, Anda tidak dapat meng-host sendiri bagian mana pun darinya, dan Anda sama sekali tidak dapat menjalankannya di UE/EEA — orkestrasi yang berbasis di Singapura atas bobot milik lab lain adalah profil risiko yang berbeda dari memiliki bobot itu sendiri. Qwen3.8-Max membalikkan hal itu secara persis. Model ini milik satu vendor dan karena itu rentan terhadap keputusan satu vendor, tetapi Alibaba menerbitkan bobot terbuka untuk checkpoint Qwen3.8-2.4T-A95B kelas Max di bawah lisensi khusus, yang berarti jalan keluar itu nyata, bukan sekadar retoris: jika harga atau ketentuannya berubah, model tersebut dapat dilayani dari infrastruktur Anda sendiri. Bagi tim yang ketakutan sebenarnya adalah vendor menarik dukungan secara sepihak, checkpoint yang dapat diunduh adalah jaminan yang lebih kuat daripada janji tentang pool yang tidak boleh Anda periksa.

Ada poin sekunder bagi siapa pun yang menjalankan agen di kedua sistem. Qwen3.8-Max ada di katalog kami dengan harga $2,00 untuk input dan $6,00 untuk output, yang merupakan harga daftar Alibaba dengan markup 0% yang diteruskan — perubahan harga vendor berlaku pada key yang sama pada hari yang sama, dan failover otomatis mencakup jalur penyedia yang terkena rate limit atau mengalami degradasi. Fugu Ultra v2 tidak ada di OrcaRouter. Fugu Ultra v2 sampai kepada Anda melalui API milik Sakana sendiri yang kompatibel dengan OpenAI dan beberapa platform pihak ketiga, dan beralih dari Fugu versi sebelumnya cukup dengan mengubah satu baris parameter. Router bukan pengganti koordinator, dan koordinator bukan pengganti kemampuan untuk failover; jika Anda menginginkan kedua properti tersebut, Anda menjalankan sistem dua vendor dan harus menganggarkan dua tagihan.

Mana yang harus Anda pilih

Pilih Qwen3.8-Max jika Anda membutuhkan model yang dapat Anda perkirakan, verifikasi, dan tinggalkan. Tarif outputnya pada harga daftar sepertiga dari Fugu Ultra v2, tidak ada penurunan tajam pada konteks panjang, model ini menerima gambar, video, dan PDF sedangkan modalitas Fugu pool adalah apa pun yang kebetulan didukung oleh agen-agen yang mendasarinya, model ini menerbitkan checkpoint yang dapat Anda gunakan sebagai cadangan, dijual di mana-mana, dan memiliki entri independen langsung yang mengukur hal-hal yang benar-benar menentukan tagihan Anda — 37,8 token per detik dan angka biaya per tugas yang dapat Anda modelkan sebelum berkomitmen. Kelemahannya sama spesifiknya dan layak disebutkan: model ini lambat, berada di peringkat #154 dari 200 dalam hal kecepatan, sangat bertele-tele pada 180 juta token di indeks, dan Artificial Analysis secara terpisah mengukur tingkat halusinasinya naik dari 23% menjadi 40% dibandingkan generasi sebelumnya, yang merupakan kekhawatiran serius justru untuk pekerjaan otonom multi-langkah yang menjadi sasaran pemasarannya. Siapkan anggaran untuk verifikator, dan manfaatkan diskon cache mendalam secara agresif.

Pilih Fugu Ultra v2 jika pekerjaan Anda berhorizon panjang dan dapat diperiksa, anggaran Anda bersifat eksploratif alih-alih produksi, dan Anda berada di luar UE/EEA. Argumen struktural untuk seorang koordinator itu nyata dan contoh dari vendor sendiri secara konsisten mengarah ke sana — sebuah uji riset otomatis dengan 123 eksperimen selama empat belas jam pada satu H100, pemecah kubus Rubik berbasis Python murni yang menyelesaikan semua 300 kubus teracak sementara dua baseline frontier yang dianonimkan mengalami crash total. Itu adalah contoh yang dipilih vendor dengan baseline yang dianonimkan dan membuktikan lebih sedikit daripada yang tampak, tetapi polanya koheren: pada tugas yang kebenarannya dapat diperiksa dan bagian sulitnya adalah persistensi, menjalankan verifier mengalahkan meminta satu model untuk berusaha lebih keras. Yang Anda beli adalah persistensi itu, dengan tarif lima kali lipat Qwen3.8-Max, dalam sebuah sistem yang kualitasnya tidak dapat Anda audit dan pool-nya tidak dapat Anda pin. Uji pilot dengan cakupan terbatas, instrumentasikan token output per tugas yang diselesaikan alih-alih per token, dan tetapkan batas atas sebelum proses pertama.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the model title, the 'Featured' badge, the identifier qwen/qwen3.8-max, vision, tools, JSON and reasoning capability tags, a 1M-token context window, text and image and video input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, and an OpenAI-compatible base URL with Python and cURL code samples.

Alasan label harganya menunjukkan angka yang salah adalah bahwa kedua produk ini telah menggeser biaya sebuah jawaban menjauh dari biaya token. Fugu Ultra v2 melakukannya dengan menyebar ke model-model yang namanya tidak akan diungkapkannya. Qwen3.8-Max melakukannya dengan berpikir selama 180 juta token. Jika Anda sudah tahu volume token per tugas, perhitungannya sepele dan Anda sebaiknya melakukannya. Sebagian besar tim tidak mengetahui angka itu, dan bagi mereka keputusannya bermuara pada sesuatu yang lebih sederhana: Qwen3.8-Max adalah pilihan yang dapat Anda audit, hitung biayanya, dan tinggalkan, sedangkan Fugu Ultra v2 adalah pilihan yang bertaruh bahwa koordinasi mengalahkan kemampuan. Keduanya dapat dipertahankan. Hanya satu di antaranya yang disertai bukti.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari