
Fugu Max vs GLM-5.3: model nilai dilemahkan oleh model volume
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Fugu Max diberi harga untuk menang dari sisi biaya, dan GLM-5.3 lebih murah pada kedua sumbu tersebut. Koordinator dari Sakana AI diluncurkan pada 11 September 2026 dengan harga $2,00 per juta token input dan $6,00 per juta token output, dirancang untuk mengarahkan setiap tugas ke model termurah yang mampu menanganinya. GLM-5.3 dari Z.ai, yang terdaftar sejak 18 Agustus 2026, berada di posisi $1,26 untuk input dan $3,96 untuk output per juta di OrcaRouter — antara sepertiga hingga dua per lima lebih rendah daripada Fugu Max pada keduanya, dari satu model teks saja dengan jendela konteks 1M yang dipublikasikan dan batas output 128K. GLM-5.3 juga kebetulan menjadi model tersibuk di katalog kami dengan selisih yang jauh. Kombinasi itu — lebih murah per token, dan terbukti membawa lalu lintas produksi dalam skala besar — menjadikan perbandingan ini sebagai yang paling sulit untuk membenarkan premi orkestrasi.
Lebih murah pada kedua sumbu, dengan spesifikasi yang dipublikasikan
Perbandingan ini terasa tidak nyaman bagi Fugu Max bahkan sebelum tolok ukur apa pun dipertimbangkan, karena ini bukan soal menukar kemampuan dengan harga. GLM-5.3 adalah andalan yang nyaris berada di garis terdepan dengan sendirinya — Z.ai mendeskripsikannya sebagai menghasilkan peningkatan pengodean sekitar 50% dibandingkan GLM-5.2 dan menyamai Mythos 5 pada kapabilitas keamanan siber tertentu. Ini bukan model hemat yang ditawarkan sebagai alternatif murah. Ini adalah andalan yang kebetulan diberi harga di bawah orkestrator yang dioptimalkan biaya.
• Harga input — Fugu Max $2,00 per 1 juta token vs GLM-5.3 $1,26 per 1 juta token
• Harga output — Fugu Max $6,00 per 1 juta token vs GLM-5.3 $3,96 per 1 juta token
• Input yang di-cache — Fugu Max $0,25 per 1 juta token vs cache GLM-5.3 diberi harga sebagai diskon dari tarif input dasar
• Konteks — Fugu Max belum dipublikasikan vs GLM-5.3 1 juta token
• Batas output — Fugu Max tidak dipublikasikan vs GLM-5.3 128K token
• Modalitas — Fugu Max tidak dipublikasikan vs GLM-5.3 hanya teks, didokumentasikan demikian
• Tag kemampuan — Fugu Max tidak ada yang dipublikasikan vs penggunaan alat GLM-5.3, mode JSON, penalaran
• Angka benchmark — enam kemenangan Fugu Max yang diklaim tanpa skor vs DeepSWE 46,2 hingga 66,9 yang dilaporkan vendor GLM-5.3 dibanding generasi sebelumnya, ditambah skor kecerdasan Artificial Analysis yang telah dipublikasikan
• Bobot — Fugu Max tertutup, pool tidak diungkapkan vs GLM-5.3 dari lab dengan garis keturunan bobot terbuka
• Lalu lintas yang teramati di OrcaRouter — Fugu Max tidak ada, tidak disertakan vs GLM-5.3 7,962.7M token selama tujuh hari terakhir
Perhatikan apa yang dilakukan dua baris terakhir secara bersamaan. GLM-5.3 berasal dari garis keturunan dengan bobot terbuka, yang merupakan bentuk terkuat yang tersedia dari argumen independensi vendor yang dijual Sakana sebagai seluruh premis Fugu Max. Dan model itu memiliki angka trafik yang dapat diamati satu urutan besaran lebih besar daripada sebagian besar model yang kami layani. Jika pertanyaannya adalah "apa yang saya jalankan untuk pekerjaan produksi yang padat teks dengan tarif rendah," buktinya mengarah ke tempat lain, bukan ke orkestrator.

Argumen volume, dan mengapa itu bukan sekadar kontes popularitas
Angka lalu lintas bukanlah angka kualitas, dan tidak seharusnya dibaca sebagai angka kualitas. Yang benar-benar ditunjukkan oleh 7,96 miliar token dalam tujuh hari adalah bahwa GLM-5.3 telah dijalankan pada skala produksi oleh banyak tim independen, pada beban kerja nyata, dan tidak memicu migrasi massal untuk meninggalkannya. Itu adalah sinyal lemah tentang kualitas dan sinyal kuat tentang kelayakan operasional: latensi stabil, throughput tetap terjaga, API berperilaku baik di bawah beban, dan mode kegagalannya diketahui oleh populasi yang cukup besar sehingga terungkap secara publik. Model yang dirilis pada minggu yang sama dengan Fugu Max tidak memiliki semua itu di belakangnya.
Baris latensi mempertegas poin ini. GLM-5.3 menunjukkan p50 waktu-ke-token-pertama sebesar 4,33 detik di seluruh lalu lintas yang kami layani. Untuk kerja agentik — beban kerja yang menjadi sasaran kedua produk ini — waktu-ke-token-pertama terakumulasi di setiap giliran setiap subagen yang diciptakan koordinator. Orkestrator yang lebih murah yang menciptakan empat agen tidak menjadi lebih murah jika masing-masing menunggu beberapa detik sebelum mengeluarkan apa pun, dan biaya itu tidak pernah muncul di daftar tarif.
Argumen balasan Fugu Max adalah bahwa koordinatornya merutekan ke model paling ringan yang mampu per permintaan, yang secara prinsip berarti banyak tugas tidak pernah menyentuh backend mahal sama sekali. Ekspansi pool Sakana pada rilis ini menambahkan model open-weights dan terspesialisasi termasuk keluarga NVIDIA Nemotron melalui kolaborasi dengan NVIDIA, jadi anak tangga murah dari tangga itu nyata. Pertanyaannya adalah apakah anak tangga tersebut lebih murah daripada $3,96 per juta token keluaran. Untuk sebagian besar tugas teks, tidak — itu standar yang rendah, dan model open-weights yang berjalan pada tarif hosted umumnya hanya melampauinya dengan margin kecil.
Pertanyaan yang layak diajukan sebelum Anda memilih
Apakah sebuah orkestrator lebih murah daripada satu model open-weights? Tidak secara default, dan intuisinya justru berlawanan arah. Orkestrasi menambahkan token sintesis dari koordinator dan, pada eksekusi multi-agen, output dari setiap agen dalam tim. Penetapan harga Fugu dari Sakana menghilangkan skenario terburuk dengan menagih satu tarif campuran berdasarkan model peserta tingkat teratas alih-alih menumpuk agen, yang merupakan konsesi nyata. Namun tarif dasar yang Anda campur adalah $6.00 untuk output, sedangkan model tunggal yang seharusnya Anda panggil adalah $3.96. Orkestrasi menghemat biaya ketika mencegah percobaan ulang, bukan ketika menambah paralelisme demi paralelisme itu sendiri.
Apakah batasan hanya teks penting untuk salah satu dari keduanya? Untuk GLM-5.3 hal itu didokumentasikan, jadi ini adalah batasan yang dapat Anda perhitungkan — tanpa visi, tanpa audio, tanpa video, dan katalog menyatakannya. Untuk Fugu Max, modalitasnya sama sekali tidak dipublikasikan. Itu lebih buruk daripada sebuah batasan, karena Anda tidak dapat mengetahui apakah pipeline yang mengirim PDF akan berfungsi sampai Anda mencobanya. Batasan yang tidak dinyatakan tidak sama dengan batasan yang tidak ada.
Apa yang terjadi pada masing-masing ketika model yang mendasarinya berubah? GLM-5.3 adalah satu model pada satu versi, yang dilatih dan dilayani oleh Z.ai. Jika Z.ai mengubah harganya, perubahan itu dikenakan pada kunci Anda pada hari yang sama melalui OrcaRouter dengan markup 0%, dan Anda dapat melihatnya serta merespons. Perilaku Fugu Max merupakan fungsi dari kumpulan model yang anggotanya tidak diungkapkan oleh Sakana, sehingga penghentian atau perubahan harga dari lab terdepan diam-diam mengubah apa yang Anda beli tanpa nama produknya berubah. Sakana menyajikan ini sebagai resiliensi. Itu resiliensi bagi vendor dan ketidaktransparanan bagi pembeli.

Di mana keputusan perutean sebenarnya dibuat
Kedua hal ini pada dasarnya adalah keputusan perutean — Fugu Max membuatnya di dalam koordinator yang buram, dan Anda membuatnya di lapisan API. OrcaRouter adalah jenis yang kedua: satu API untuk lebih dari 200 model dengan DSL perutean yang memungkinkan Anda menyatakan kebijakan secara eksplisit, failover otomatis saat jalur penyedia mengalami degradasi, dan fusi model saat Anda ingin menggabungkan keluaran secara sengaja alih-alih mempercayakan kotak hitam untuk melakukannya. GLM-5.3 berada di katalog tersebut pada harga daftar Z.ai dengan markup 0%, yang bernilai lebih dari biasanya untuk model dengan lalu lintas sebesar ini di belakangnya: tarif yang Anda lihat adalah tarif yang diterbitkan Z.ai, diteruskan tanpa diubah.
Perbedaan praktisnya adalah auditabilitas. Saat Fugu Max memilih model untuk permintaan Anda, Anda tidak mengetahui sama sekali model mana yang dipilih atau alasannya. Saat Anda menulis kebijakan perutean sendiri, keputusan itu ada di repositori Anda, dapat ditinjau oleh siapa pun yang meninjau kode Anda, dan dapat diubah tanpa menunggu vendor. Bagi tim yang berada di bawah kewajiban kepatuhan atau akuntansi biaya dalam bentuk apa pun, itu bukan perbedaan filosofis.
Putusan
GLM-5.3 memenangkan perbandingan ini dalam hal-hal yang paling penting bagi tim produksi: biayanya lebih murah untuk input dan output, jendela konteks dan batas maksimum outputnya dipublikasikan, batas modalitasnya dinyatakan, ia mendukung penggunaan alat, mode JSON, dan penalaran sebagai kemampuan yang terdokumentasi, ia berasal dari garis keturunan open-weights, dan ia memiliki angka lalu lintas tujuh hari yang mendekati delapan miliar token. Tidak ada tafsir atas bukti publik yang menjadikan Fugu Max sebagai pembelian yang lebih terbukti pada kisaran harga ini.
Fugu Max mempertahankan satu argumen, dan itu argumen yang sah: untuk tugas di mana putaran kedua seorang koordinator menangkap kesalahan yang akan diloloskan putaran pertama, biaya per tugas yang diselesaikan bisa mengalahkan biaya per token. Itu layak untuk pilot dengan cakupan terbatas jika pekerjaan Anda dapat diverifikasi, bervolume tinggi, dan Anda berada di luar UE/EEA — dengan plafon token keluaran yang ditetapkan sebelumnya dan pengukuran token per tugas yang diselesaikan. Jika tidak, model tunggal yang biayanya sepertiga lebih rendah dan telah berjalan di bawah beban produksi selama sebulan adalah jawabannya, dan model itu tersedia di OrcaRouter dengan harga daftar Z.ai dengan tarif penyedia diteruskan.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
