
Claude Fable 5.1 vs Grok 4.6: Sembilan Poin Indeks dan Harga Output Delapan Kali Lipat — Apa yang Sebenarnya Didapat dari Kesenjangan Itu
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Claude Fable 5.1 dan Grok 4.6 adalah dua model frontier tertutup yang mengapit rentang harga generasi saat ini. Flagship baru Anthropic, dirilis 1 September 2026, mengenakan biaya $10,00 per juta token input dan $50,00 per juta token output, dan pada versi saat ini dari Artificial Analysis's Intelligence Index, ia berada di angka 53 — pertama dari 201 model yang dilacak indeks tersebut. Grok 4.6 milik SpaceXAI, yang rilis sejak 12 Agustus, mengenakan biaya $2,00 dan $6,00 untuk unit yang sama dan berukuran 44, peringkat ke-20 dari 201. Sembilan poin indeks memisahkan mereka. Delapan kali harga output memisahkan mereka. Mana dari dua angka tersebut yang harus diperhatikan oleh suatu beban kerja adalah pertanyaan utamanya, dan keduanya menunjuk ke arah yang berbeda tergantung pada apa yang Anda minta model tersebut lakukan.
Sumber, dinyatakan di awal: Artificial Analysis memberi skor ulang pada Intelligence Index-nya pada bulan September, jadi angka-angka di sini diambil dari versi terkini, yang dicatat pada 10 September 2026, bukan dari skala lama yang masih dikutip di banyak liputan Agustus. Skor indeks dari versi yang berbeda tidak dapat dibandingkan, itulah sebabnya angka-angka di bawah ini mungkin terlihat lebih rendah daripada yang Anda baca tentang kedua model saat diluncurkan. Semua yang berlabel "dilaporkan vendor" berasal dari lembar evaluasi lab peluncur itu sendiri dan belum direproduksi oleh pihak netral. Catatan peringatan ini tidak berdampak merata di sini — Grok 4.6 telah menjalani pengawasan pihak luar selama sebulan, sementara Claude Fable 5.1 baru berusia sembilan hari dan sebagian besar yang diketahui publik tentang angka-angka utamanya masih berasal dari pengakuan Anthropic.
Dua lab, dua hal berbeda yang dijual
Rilisan September Anthropic adalah permainan kapabilitas dengan narasi keamanan yang ditempelkan padanya. Claude Fable 5.1 adalah kembaran yang tersedia secara umum dari Claude Mythos 5.1, saudara yang dibatasi keamanan yang hanya menjangkau organisasi keamanan siber dan ilmu hayati yang telah tervetifikasi — model dasar yang sama, pengaman yang berbeda. Yang dijual Anthropic adalah puncak indeks independen, jendela konteks 1 juta token, hingga 128 ribu token keluaran dalam satu respons, dan ekosistem agen yang dibangun di sekitar Claude Code dan aplikasi-aplikasi Claude. Tawarannya lugas: inilah model yang Anda panggil ketika pekerjaannya cukup sulit sehingga jawaban yang salah lebih mahal daripada biaya tokennya.
SpaceXAI menjual sesuatu yang lebih sempit dan, seiring waktu, lebih agresif — model termurah yang masih kelas frontier, dengan harga cukup rendah untuk membuat pengembangan agen di platform lain tampak boros. Grok 4.6 bukanlah peningkatan skala: ia memiliki fondasi yang sama dengan Grok 4.5 dengan sesi pelatihan tambahan yang lebih panjang dan pembelajaran penguatan yang lebih berat, yang menurut vendor memberikan "kecerdasan sebanding dengan GPT-5.6 Sol dan Claude Fable 5." Dengan harga $2/$6, dan masih berada di dua puluh besar indeks, itulah seluruh argumennya. Ini juga sebuah strategi, bukan sekadar harga. SpaceXAI memiliki Cursor, meluncurkan agen browser Grok Bot sehari sebelum model tersebut, dan menjalankan aplikasi obrolan konsumennya sendiri; model frontier dengan harga komoditas adalah bahan bakar bagi semuanya. Aritmetika publik Elon Musk — pendapatan AI yang melampaui segmen perusahaan lainnya, 10 GW komputasi — mengarah ke hal yang sama. Model ini tidak dibanderol untuk memaksimalkan margin API.
Lembar spesifikasi, dimensi demi dimensi
• Harga per 1 juta token — Claude Fable 5.1 $10.00 input / $50.00 output vs Grok 4.6 $2.00 input / $6.00 output.
• Input cache — Claude Fable 5.1 $0.25 per 1M vs Grok 4.6 $0.50, dan Artificial Analysis mencantumkan diskon cache efektif sebesar 98% dibanding 75%.
• Penetapan harga konteks panjang — Claude Fable 5.1 menetapkan harga jendelanya secara flat hingga 1 juta token; Grok 4.6 menghitung ulang harga seluruh permintaan menjadi $4,00 / $12,00 / $1,00 begitu melampaui 200 ribu token input, sehingga diskonnya menipis tepat di tempat proses agen panjang berlangsung.
Konteks dan keluaran — Claude Fable 5.1 memiliki jendela konteks 1M token dan hingga 128K token keluaran, dibandingkan dengan jendela konteks 500K milik Grok 4.6, kontrol upaya penalaran yang berjalan dari rendah hingga xhigh, serta varian yang lebih cepat dengan kecepatan dua kali lipat.
• Skor independen, kecepatan, dan biaya — Artificial Analysis menempatkan Claude Fable 5.1 pada 53 dalam Intelligence Index-nya saat ini (#1 dari 201), 67.2 token output per detik, dan $7.63 per tugas indeks; Grok 4.6 berada di 44 (#20 dari 201), 52.8 token per detik, dan $1.86 per tugas. Keduanya dinilai "sangat bertele-tele" atau "agak bertele-tele" menurut pengukuran tersebut — 190M token output untuk model Claude dibandingkan 94M untuk Grok.
• Klaim tolok ukur vendor — Anthropic melaporkan 52,6% pada Terminal-Bench-Science 0.1 (lebih dari dua kali lipat 24,7% milik Claude Fable 5), 55,8% pada Terminal-Bench 4.0, dan 1.853 pada GDPval-AA v2 untuk Claude Fable 5.1. SpaceXAI melaporkan 65,9% pada DeepSWE v1.1 dan 69,9% pada CursorBench v3.2 untuk Grok 4.6, di samping 26% yang dilaporkan sendiri pada Terminal-Bench v3.0 — satu baris dalam tabel vendor itu sendiri yang terlihat mencolok lemah.
• Di mana masing-masing berjalan — API Anthropic, aplikasi Claude, Claude Code, Amazon Bedrock, Google Cloud, dan Microsoft Foundry vs API SpaceXAI, Cursor, Grok Build, agen Grok Bot, aplikasi konsumen Grok, dan Amazon Bedrock GovCloud.
• Dirilis — Claude Fable 5.1 pada 1 September 2026; Grok 4.6 pada 12 Agustus 2026.

Apa yang sebenarnya diwakili oleh sembilan titik indeks
Pada indeks independen saat ini, peringkat September tidak ambigu: Claude Fable 5.1 di angka 53 dan peringkat pertama dari 201, Grok 4.6 di angka 44 dan peringkat kedua puluh. Indeks yang dinilai ulang memerlukan satu klarifikasi, karena ini adalah hal yang membuat angka-angka minggu peluncuran tampak salah jika dilihat ke belakang: Artificial Analysis menyatakan kembali Indeks Intelijensinya pada September, dan skor yang dipublikasikan kedua model bergerak turun saat itu dilakukan. Selisih sembilan poin itu nyata, tetapi indeks tersebut merupakan gabungan berbobot — sangat condong ke pekerjaan agenik, dengan pengodean, penalaran ilmiah, dan kemampuan umum di belakangnya — sehingga ia memampatkan gambaran per-dimensi yang beragam menjadi satu garis.
Bukti per dimensi lebih berisik dan lebih berguna. Angka Terminal-Bench-Science 0.1 milik Anthropic sendiri — 52,6%, lebih dari dua kali lipat 24,7% generasi sebelumnya — menargetkan secara tepat alur kerja ilmiah dan riset berjangka panjang yang dipedulikan oleh pembeli yang berorientasi agen, dan tidak ada model saat ini yang mendekatinya pada tolok ukur spesifik tersebut. Tabel vendor SpaceXAI paling kuat dalam rekayasa perangkat lunak (65,9% DeepSWE v1.1, 69,9% CursorBench v3.2) dan paling lemah pada loop agen yang sarat terminal, di mana angka 26% milik Grok 4.6 pada Terminal-Bench v3.0 berada di bawah 34,6% GPT-5.6 Sol Max dan 34,1% Claude Fable 5 Max. Kedua tabel dilaporkan oleh vendor dan belum direproduksi; tabel-tabel tersebut menggambarkan di mana setiap lab yakin dirinya kuat, bukan siapa yang menang.

Tulisan kecil pada token murah
Keunggulan harga Grok 4.6 itu nyata, dan pada konteks pendek dan menengah sangat besar: beban kerja yang berat pada output membayar sekitar 83% lebih murah per token yang dihasilkan dibandingkan di Claude Fable 5.1. Namun, kartu tarif memiliki tiga sisi yang biasanya dilewatkan oleh perbandingan model frontier.
Yang pertama adalah ambang batas 200K. Melewati 200.000 token input akan memberi harga baru padaseluruh permintaan menjadi $4/$12, bukan hanya token-token di atas garis tersebut. Untuk proses agen yang panjang yang mengumpulkan konteks — beban kerja yang justru menjadi tujuan penjualan kedua model ini — tarif efektifnya menjadi dua kali lipat tanpa peringatan dan tidak lagi seperlima dari harga Claude. Yang kedua adalah varian yang lebih cepat, yang biayanya dua kali lipat dari tarif dasar dan merupakan satu-satunya cara yang diiklankan untuk memperbaiki kecepatan keluaran model yang di bawah rata-rata. Yang ketiga adalah panggilan alat di sisi server, yang ditagih terpisah per seribu pemanggilan.
Perubahan harga Claude Fable 5.1 pada bulan September justru mengarah ke arah sebaliknya. Harga nominal $10/$50 tidak bergerak, tetapi harga baca cache turun 75% menjadi $0,25 per juta token, dan di situlah sesi agentik yang panjang benar-benar menghabiskan uangnya: membaca ulang keluaran alat, isi file, dan giliran sebelumnya berulang kali. Artificial Analysis menunjukkan diskon cache efektif yang dihasilkan sebesar 98%, dibandingkan 75% untuk Grok. Membayar seperempat dolar per juta token baca-ulang mengubah aritmetika agen selama berjam-jam dengan cara yang tidak pernah terlihat dari tarif utama.
{{1}}Penyeimbang yang jujur adalah verbositas, dan itulah alasan kesenjangan biaya sebenarnya tidak delapan kali lipat.{{/1}} {{2}}Karena model Claude mengeluarkan sekitar dua kali lebih banyak token untuk menyelesaikan tugas indeks yang sama — 190M berbanding 94M milik Grok — ukuran biaya per tugas Artificial Analysis berada di $7,63 untuk Claude Fable 5.1 berbanding $1,86 untuk Grok 4.6.{{/2}} {{3}}Itu adalah faktor sekitar empat, bukan delapan, dan itulah angka yang harus dijadikan acuan dalam merencanakan anggaran.{{/3}}
Perbedaan yang tidak pernah sampai ke meja
Latensi adalah titik di mana kedua model berbeda untuk produk interaktif, dan hasilnya justru kebalikan dari apa yang tersirat oleh label harganya. Artificial Analysis mengukur Claude Fable 5.1 pada {{1}}67,2 token keluaran per detik{{/1}} — di atas rata-rata kelasnya — dibandingkan dengan {{2}}52,8{{/2}} untuk Grok 4.6, yang menurut pengukuran tersebut berada di bawah rata-rata; ringkasan indeks untuk Grok secara tegas menggambarkannya sebagai lebih lambat dibandingkan rekan-rekannya, dan itulah sebabnya SpaceXAI menjual varian yang lebih cepat dengan tarif dua kali lipat. {{3}}Model Anthropic juga, menurut catatan independen yang sama, lebih boros kata dibandingkan keduanya{{/3}}. Jadi {{4}}model yang murah adalah yang lebih lambat, dan model yang mahal menulis lebih banyak dari yang dibutuhkannya{{/4}}: dua biaya yang menarik ke arah yang berlawanan dan keduanya tidak muncul di kartu tarif.
Menghubungi keduanya tanpa berkomitmen pada salah satunya hari ini
Konsekuensi praktis dari selisih sembilan poin, perbedaan biaya per tugas empat kali lipat, dan kartu harga yang penuh tingkatan adalah bahwa sebagian besar tim seharusnya menjalankan keduanya, dan pertanyaan menariknya adalah di mana letak peralihannya. Itu lebih murah daripada yang terdengar: Claude Fable 5.1 dan Grok 4.6 keduanya ada di OrcaRouter dengan harga daftar penyedia mereka tanpa markup — $2/$6 dan $10/$50 di atas adalah angka-angka yang muncul di faktur, dan setiap perubahan harga vendor diteruskan pada hari yang sama, bukan diserap ke dalam margin pengecer. Satu titik akhir mencakup keduanya, sehingga pola eskalasi adalah aturan perutean, bukan kontrak kedua: kirim pekerjaan bervolume tinggi dan berlingkup jelas ke Grok 4.6, eskalasi ke Claude Fable 5.1 saat tugas membutuhkan tingkat penalaran tertinggi, dan biarkan failover otomatis menangani kasus di mana throughput model yang lebih murah terlalu lambat untuk tenggat waktu. DSL perutean mengekspresikan rantai itu di satu tempat, dan fusi model memungkinkan sekelompok model menjawab bersama ketika sebuah tugas cukup penting untuk menginginkan lebih dari satu opini. Kesenjangan harga kemudian berhenti menjadi keputusan yang Anda buat sekali dan menjadi garis yang Anda sesuaikan saat campuran beban kerja Anda bergerak.

Siapa yang harus memilih yang mana
Pilih Claude Fable 5.1 {{1}}ketika biaya jawaban yang salah atau terbengkalai mendominasi biaya token: riset agentik berhorizon panjang, penalaran berat, pekerjaan teregulasi yang mengutamakan batas keamanan Anthropic dan kontrol retensi nol-data bertahapnya, serta apa pun yang berjalan di dalam Claude Code.{{/1}} Pilih Grok 4.6 {{2}}ketika pekerjaan bervolume tinggi, terdefinisi jelas, dan toleran terhadap throughput — coding batch, ekstraksi, generasi, loop agen dengan giliran yang cukup pendek untuk tetap di bawah garis harga ulang 200K — dan ketika Anda membangun agen yang modelnya hanyalah komponen dan biaya per tugas adalah seluruh kasus bisnisnya.{{/2}}
Dua hal yang belum tuntas layak dipantau sebelum salah satu pilihan mengeras. SpaceXAI telah kembali menggoda kehadiran Grok 4.7 dalam waktu dekat, dan jika ia mewarisi tingkat harga yang sama dengan kemampuan yang lebih tinggi, tawaran murah hari ini akan berubah menjadi kelas menengah dalam hitungan minggu. Sementara itu, Anthropic telah menunjukkan ritme yang kurang lebih bulanan dan kesediaan untuk memangkas harga cache tanpa menyentuh tarif utama, yang mengisyaratkan bahwa langkah berikutnya dalam persaingan ini mungkin berada di sisi biaya, bukan pada indeks. Tak satu pun dari kedua hal ini mengubah apa yang dilakukan model saat ini, tetapi keduanya adalah alasan untuk tetap menjadikan ID model sebagai nilai konfigurasi. Pada satu endpoint dengan penetapan harga pass-through dan failover, itu adalah bawaan, bukan sebuah proyek.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
