Kartu hero untuk pertandingan Fugu Ultra v2 versus Grok 4.6, yang membandingkan sistem orkestrasi dengan model penalaran berkonteks besar tunggal.
Guides & Insights

Fugu Ultra v2 vs Grok 4.6: Harga Output Lima Kali Lipat, Satu Benchmark yang Sama

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hanya ada satu tolok ukur yang padanya Fugu Ultra v2 dan Grok 4.6 sama-sama menerbitkan angka, yaitu DeepSWE: Sakana AI melaporkan 74,3 untuk Fugu Ultra v2 dalam pengumumannya pada 11 September 2026, sementara materi peluncuran Grok 4.6 dari xAI menempatkan skor DeepSWE v1.1 miliknya sendiri di angka 65,9%. Itu selisih 8,4 poin, dan itulah satu-satunya perbandingan yang bersih yang ditawarkan kedua perusahaan. Segala hal lain yang mungkin Anda bandingkan — Chartography dan SWEFish milik Sakana dengan GPQA Diamond dan CursorBench milik Grok — diukur dengan instrumen berbeda oleh laboratorium berbeda. Jadi pertanyaan yang jujur bukanlah "mana yang lebih pintar." Pertanyaannya adalah apakah keunggulan yang diklaim Fugu Ultra v2 layak dibayar $30 per juta token keluaran, ketika Grok 4.6 hanya menagih $6.

Dua jawaban berbeda untuk masalah yang sama

Grok 4.6 adalah model tunggal, dan merupakan andalan saat ini dari lini Grok — tercantum sebagai "Latest" dalam dokumentasi pengembang milik vendor sendiri, menggantikan Grok 4.5 dengan jendela konteks 500.000 token yang sama, permukaan input teks/gambar/file yang sama, dan harga dasar yang sama. Model ini memiliki batas pengetahuan 1 Februari 2026 dan menyediakan upaya penalaran dalam low, medium, high, dan xhigh, dengan high sebagai default. Satu detail yang mengejutkan banyak orang: penalaran tidak dapat dimatikan. Token berpikir ditagih pada setiap permintaan, yang membuat biaya output sebenarnya Grok 4.6 bergantung pada seberapa keras ia memutuskan untuk berpikir.

Fugu Ultra v2 sama sekali bukan model dalam pengertian biasa. Ini adalah tingkat kemampuan puncak dari lini orkestrasi Sakana AI — satu endpoint yang kompatibel dengan OpenAI yang menguraikan sebuah tugas dan mengirimkannya ke kumpulan model lain, sebagian berbobot terbuka, sebagian terspesialisasi. Kerangka pemikiran Sakana adalah bahwa ia mencapai keluaran tingkat terdepan "tanpa ketergantungan yang mutlak pada model-model terdepan yang diorkestrasinya," dan ia menyatakan secara gamblang bahwa Claude Fable 5, Claude Fable 5.1 dan GPT-6 Astra dikecualikan dari kumpulan tersebut. Anda membayar untuk lapisan penjadwalan, dan untuk setiap token yang dihabiskan oleh sub-agen.

Perbedaan itu bukan sekadar kosmetik. Itulah keseluruhan alasan mengapa selisih harga tersebut ada, dan hanya itulah yang membuat selisih itu dapat dipertahankan.

Kartu tarif, termasuk bagian yang berulang

Input — Fugu Ultra v2 $5,00 per 1 juta vs Grok 4.6 $2,00 per 1 juta. Fugu sudah 2,5× lebih mahal sebelum sub-panggilan apa pun terjadi.

Keluaran — Fugu Ultra v2 $30,00 per 1 juta vs Grok 4.6 $6,00 per 1 juta. Selisih 5×, dan inilah yang menentukan sebagian besar tagihan.

Input yang di-cache — $0,50 per 1 juta di keduanya. Identik. Dua vendor yang tidak memiliki kesamaan lain sama-sama berakhir pada harga baca cache yang sama, yang menjadikan loop agen yang intensif cache sebagai satu-satunya beban kerja yang benar-benar sebanding baris per baris.

Penetapan harga ulang konteks panjang — Grok 4.6 berlipat ganda menjadi $4,00 / $12,00 begitu prompt melewati 200.000 token, dan penetapan harga ulang berlaku untuk seluruh permintaan, bukan hanya kelebihannya. Tier yang dilaporkan Fugu Ultra v2 di atas sekitar 272.000 token input bergeser ke sekitar $10,00 / $45,00, juga untuk seluruh permintaan. Keduanya menghukum prompt panjang; Grok mulai menghukum 72K token lebih awal.

Jendela konteks — Grok 4.6 500K token vs Fugu Ultra v2 1M seperti yang dilaporkan oleh listing pihak ketiga. Halaman pengumuman Sakana sama sekali tidak mencantumkan angka konteks, jadi perlakukan 1M-nya sebagai belum dikonfirmasi oleh vendor.

Baris konteks panjang memiliki dua sisi dan layak dihitung secara matematis. Prompt 300K token dikenakan biaya $4,00 per juta input pada Grok 4.6 dan sekitar $10,00 pada Fugu Ultra v2. Prompt 150K token dikenakan biaya $2,00 pada Grok dan $5,00 pada Fugu. Model Sakana lebih mahal pada setiap panjang prompt — satu-satunya pertanyaan adalah seberapa sering model itu perlu dipanggil.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

Argumen untuk membayar 5× untuk output

Alasan sebuah orkestrator bukanlah bahwa biayanya lebih murah per token. Melainkan bahwa ia membutuhkan lebih sedikit percobaan, dan bahwa token yang ia keluarkan untuk koordinasi lebih murah daripada token yang akan Anda keluarkan untuk kegagalan.

Itu adalah argumen yang nyata, dan Sakana menyatakannya secara eksplisit: Fugu Ultra v2 ditujukan untuk pekerjaan kompleks multi-langkah — riset otonom, pengembangan full-stack — di mana mode kegagalan satu model adalah keluar dari jalur di tengah proses panjang. Jika tarif keluaran $30 memberi Anda tugas yang selesai pada percobaan pertama alih-alih ketiga, premi per token tidak relevan.

Ada bukti pendukung dari sisi vendor sendiri, meskipun bukti itu menguntungkan vendor dan harus dibaca sebagai demikian. Materi peluncuran x​AI untuk Grok 4.6 menyebutkan sekitar 53 giliran dan sekitar 0,5 miliar token masukan untuk menyelesaikan tugas berhorizon panjang, dibandingkan dengan sekitar 103 giliran dan 2,0 miliar token masukan untuk model frontier pesaing — sebuah argumen bahwa Grok sendiri ekonomis per tugas bahkan pada harga per token yang rendah. Kedua perusahaan melakukan langkah yang sama: mendorong Anda menjauh dari daftar tarif dan menuju biaya per pekerjaan yang diselesaikan.

Yang berarti angka penentunya adalah angka yang tidak diterbitkan oleh vendor mana pun, dan Anda harus mengukurnya sendiri: token yang terpakai, dari awal sampai akhir, pada tugas yang serupa dengan tugas Anda.

Di mana masing-masing benar-benar lemah

Titik lemah Grok 4.6 yang dipublikasikan adalah pekerjaan terminal. Skor Terminal-Bench v3.0-nya berada di 26%, jauh di belakang posisi teratas di bidang ini, meskipun model yang sama mencatat 88,4% yang jauh lebih kuat pada Terminal-Bench v2.1 yang lebih lama — itu adalah tes yang berbeda dan mencampuradukkannya adalah kesalahan yang akan Anda lihat di banyak liputan. Ia juga memiliki skor GPQA Diamond tertinggi di kelompoknya, yaitu 94,9%, tetapi GPQA Diamond sejak itu telah dihapus dari indeks Artificial Analysis karena sudah jenuh, sehingga skor tinggi di sana tidak lagi membedakan model-model terdepan seperti yang dilakukannya setahun lalu.

Di sisi independen, Artificial Analysis memberi skor Grok 4.6 sebesar 44 pada v4.3 Intelligence Index miliknya, berada di peringkat #20 dari 200, dengan biaya per tugas $1,86. Angka 61 yang sering beredar berasal dari skala indeks yang telah digantikan dan tidak boleh dikutip tanpa menyebutkan versi mana yang menghasilkannya.

Titik lemah Fugu Ultra v2 adalah verifikasi. Pada saat publikasi, tidak ada satu pun yang diklaim Sakana tentangnya — lima hasil terbaik atau setara terbaik, skor Chartography 48,3 versus 27,3 milik Opus 5 dan 29,5 milik Fable 5, skor DeepSWE 74,3 — yang telah direproduksi secara independen. Tidak ada juga angka latensi atau throughput yang dipublikasikan, yang lebih penting bagi orkestrator daripada bagi model tunggal, karena waktu responsnya sepenuhnya bergantung pada apa yang diputuskan untuk dipanggil. Untuk Fugu Ultra sebelumnya, para penguji secara publik melaporkan proses yang berlangsung hingga sekitar 30 menit; itu adalah model Juni 2026, bukan v2, tetapi itulah mode kegagalan yang harus diuji sebelum Anda menetapkan jalur produksi.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Catatan tentang nama vendor

Satu hal yang perlu diketahui sebelum Anda mencari Grok 4.6 di konsol pengembang: model ini secara konsisten disebut Grok 4.6, tetapi branding vendor di sekitarnya sedang berubah. Dokumentasi xAI sendiri kini mencantumkan nama SpaceXAI, perubahan yang belum diikuti oleh sebagian besar liputan peluncuran. Pengenal model dan permukaan API tidak berubah — Grok 4.6 adalah model OpenAI Responses kelas satu dan langsung masuk ke loop pemanggilan alat yang ada tanpa lapisan terjemahan — tetapi jika Anda mencari kartu model dan brandingnya terlihat salah, itu bukan kesalahan Anda.

Memanggil salah satu dari ini dalam praktik

Grok 4.6 tersedia di OrcaRouter dengan tarif milik penyedia itu sendiri — $2,00 per juta token input dan $6,00 per juta token output, diteruskan tanpa markup, sehingga perubahan harga vendor sampai ke sini pada hari yang sama, bukan menurut jadwal migrasi. Ini kompatibel dengan OpenAI pada URL dasar yang sama seperti semua hal lain di katalog, yang berarti Anda dapat menempatkannya di belakang rantai fallback atau aturan perutean alih-alih melakukan hard-code, dan Anda dapat melakukan A/B terhadapnya dengan model lain tanpa kontrak kedua atau perubahan kode.

Fugu Ultra v2 tidak dirutekan oleh kami. Fugu Ultra v2 tersedia melalui API milik Sakana AI sendiri yang kompatibel dengan OpenAI, dan perusahaan tersebut mengatakan bahwa integrasi Fugu yang sudah ada dapat beralih ke sana hanya dengan mengubah satu parameter. Jika Anda ingin membandingkan keduanya pada beban kerja Anda, susunan termurah adalah membiarkan Grok 4.6 tetap di gateway Anda dan memanggil Fugu Ultra v2 langsung dari Sakana di balik feature flag — keduanya menggunakan format permintaan yang sama, sehingga harness pengujian yang sama dapat berfungsi untuk keduanya.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

Putusan

Grok 4.6 adalah pilihan default yang rasional untuk sebagian besar tim, dan soal harga tidak ada yang mendekatinya. Dengan $2,00 / $6,00, baca cache $0,50, dan jendela 500K, ia menangani penalaran dokumen panjang, agen coding, dan pekerjaan file multimodal pada seperlima tarif output Fugu Ultra v2, serta dinilai dan di-benchmark secara independen. Eksposurnya adalah panjang prompt — tebing 200K menggandakan seluruh permintaan — dan loop agen yang berat terminal, tempat skor yang dipublikasikan tidak kompetitif.

Fugu Ultra v2 baru sepadan dengan harga premiumnya hanya jika Anda memiliki jenis beban kerja tertentu: tugas panjang, multi-langkah, dan berotonomi tinggi, di mana satu model cenderung keluar jalur, dan di mana Anda juga menginginkan properti arsitektural yang dijual Sakana — tingkat kemampuan yang tidak bergantung pada vendor terdepan mana pun untuk tetap tersedia atau tetap murah. Itu memang sesuatu yang wajar diinginkan. Tetapi itu sebuah klaim, belum sebuah pengukuran, dan kesenjangan DeepSWE yang membuatnya terlihat kredibel hanyalah satu tolok ukur dari satu vendor pada hari peluncurannya.

Jika Anda tidak dapat menyebutkan tugas mana milik Anda yang saat ini gagal pada percobaan kedua atau ketiga, Anda belum memiliki angka yang akan membenarkan perbedaan harga. Ukur dulu hal itu. Kartu tarif sudah memberi tahu Anda semua hal lainnya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari