
Claude Opus 5.5 vs Grok 4.6: Satu Model Membaca, yang Lain Bertindak
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 221 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Claude Opus 5.5 dan Grok 4.6 adalah dua cara termurah untuk membeli model kelas terdepan yang mampu menampung konteks setengah juta token — dan keduanya bukan produk yang sama. Pada satu pengukuran, Grok 4.6 terpaut tiga poin dari plafon absolut: 94,9 pada GPQA Diamond, kumpulan soal sains tingkat pascasarjana tempat model unggulan Anthropic berada di rentang yang sama. Pada pengukuran berikutnya, ia tertinggal tiga puluh delapan poin. Pada Terminal-Bench 4.0, tolok ukur terminal berbasis agen yang meminta model menyelesaikan pekerjaan nyata di shell, Artificial Analysis memberi skor Grok 4.6 sebesar 21,21% dan Claude Opus 5.5 sebesar 59,60%. Itu bukan salah cetak ke arah mana pun, dan seluruh inti dari pasangan ini adalah menjelaskan mengapa kedua angka itu benar sekaligus.
Dua rilis, satu rentang harga, terpaut empat bulan
SpaceXAI merilis Grok 4.6 pada 12 Agustus 2026 sebagai andalan saat ini dari lini Grok, dengan harga $2,00 per juta token input dan $6,00 output, dengan jendela konteks 500.000 token serta input teks, gambar, dan file. Anthropic merilis Claude Opus 5.5 pada 22 September 2026, sekitar enam minggu kemudian, dengan harga $4,00/$20,00 dengan jendela konteks 1.000.000 token dan 128.000 token output. Keduanya mendukung upaya penalaran yang dapat dikonfigurasi, pemanggilan alat, dan output terstruktur; keduanya menyediakan antarmuka obrolan yang kompatibel dengan OpenAI serta format milik vendor masing-masing.
Jadi pembacaan naifnya adalah pertukaran yang bersih: Grok 4.6 setengah harga untuk input dan kira-kira sepertiga untuk output, sementara Claude Opus 5.5 menjawab dengan jendela konteks dua kali lipat. Pertukaran itu nyata, dan dalam pekerjaan dokumen panjang itu mungkin satu-satunya hal yang penting. Itu juga bukan tempat perbedaan menarik berada, karena kedua model telah diukur pada harness independen yang sama dan tidak mendarat di posisi yang sama pada sumbu-sumbu yang penting untuk pekerjaan agentic.
Apa yang katalog katakan tentang sumbu tempat keduanya diukur
Katalog OrcaRouter mencantumkan asal-usul benchmark per baris — setiap angka menyebutkan evaluator asalnya — sehingga pasangan di bawah ini semuanya berasal dari satu sumber untuk kedua model, Artificial Analysis, bukan angka vendor di satu sisi dan pihak ketiga di sisi lain:
• GPQA Diamond — Claude Opus 5.5 tidak tercantum pada sumbu ini dalam katalog kami; Grok 4.6 memperoleh skor 94,9%
• Ujian Terakhir Umat Manusia — 61,4% untuk Claude Opus 5.5 dibandingkan 42,9% untuk Grok 4.6
• SciCode — 66,9% dibandingkan dengan 56,5%
• Recall Konteks Panjang — 84,7% dibandingkan 80,3%
• Terminal-Bench 4.0 — 59.60% dibandingkan 21.21%
• AA Intelligence Index — 57,6 dibandingkan dengan 44,3
Baris GPQA sengaja dibiarkan kosong di sisi Anthropic alih-alih diisi dari materi presentasi vendor. Angka 94,9 milik Grok 4.6 di sana adalah angka terkuat di kartunya dan itu asli — pengukuran independen, bukan klaim SpaceXAI — dan itu mengatakan sesuatu yang nyata tentang model ini: ketika tugasnya adalah pertanyaan yang dirumuskan dengan baik dengan satu jawaban yang dapat dipertahankan, Grok 4.6 tampil di garis terdepan. Bacalah angka itu di samping 21,21% Terminal-Bench 4.0 dan polanya menjadi terbaca. Menghasilkan jawaban yang benar tentang sains dan menjalankan tugas lima langkah di shell terhadap sistem berkas nyata adalah kompetensi yang berbeda, dan Grok 4.6 jauh lebih maju pada yang pertama daripada yang kedua.
Satu catatan tentang pasangan itu sebelum dipakai sebagai vonis: angka Artificial Analysis kedua model dicatat pada tanggal evaluasi yang berbeda, dan milik Grok 4.6 adalah kumpulan yang lebih lama. Perbandingannya adalah antara model yang dievaluasi pada Agustus dan model yang dievaluasi pada September dengan harness yang sendirinya telah direvisi sepanjang rentang waktu itu. Arah selisihnya konsisten di lima sumbu terpisah, itulah sebabnya kami memperlakukannya sebagai sinyal, tetapi nilai poin persisnya harus dibaca sebagai perbandingan Agustus-versus-September, bukan perbandingan pada hari yang sama.
Indeks yang dibuat oleh seseorang yang juga tidak menjual apa pun.
Ada ukuran independen kedua, dan ukuran itu sepakat soal arahnya sekaligus jauh lebih enggan membuat pembedaan yang rinci. Epoch Capabilities Index, yang dibangun oleh Epoch AI sebagai komposit dari lebih dari lima puluh benchmark dan diskalakan ulang sehingga Claude 3.5 Sonnet berada di 130 dan GPT-5 di 150, menempatkan Claude Opus 5.5 pada 167,35 dalam berkas yang kami baca pada 2 Oktober 2026. Grok 4.6 berada di 156,61, dari evaluasi 12 Agustus. Itu adalah selisih 10,74 poin pada skala yang mana sekitar lima poin diamati berkorespondensi dengan penggandaan ukuran horizon waktu METR pada saat peluncuran indeks — lebar, dan jauh di luar interval yang diterbitkan kedua model, yakni 164,0 hingga 172,0 dan 154,66 hingga 158,93, yang sama sekali tidak tumpang tindih.
Perlu dicatat apa yang tidak diselesaikan oleh indeks ini. Indeks ini menempatkan Claude Sonnet 5.5 pada 165,2 dan Claude Fable 5.1 pada 164,82, keduanya di atas Grok 4.6, dan keduanya lebih murah per satu juta token keluaran daripada tarif tingkat kedua Grok 4.6. Siapa pun yang memilih hanya berdasarkan kemampuan per dolar memiliki opsi ketiga dan keempat dalam keluarga vendor yang sama, dan pasangan dalam artikel ini membahas hal lain: apa keunggulan masing-masing dari kedua model tersebut.
Kartu tarif, dan baris yang hanya muncul di salah satunya

Daftar tarif Grok 4.6 memiliki satu tahapan yang tidak dimiliki Claude Opus 5.5: permintaan di atas 200.000 token prompt ditagih dua kali tarif dasar, sehingga input naik dari $2,00 menjadi $4,00 dan output dari $6,00 menjadi $12,00, dengan pembacaan cache bergeser dari $0,50 menjadi $1,00. Claude Opus 5.5 mengenakan biaya $4,00/$20,00 dengan pembacaan cache $0,20 yang seragam di seluruh jendela 1.000.000 token. Inversi itulah konsekuensi praktis dari membeli konteks panjang dari salah satu dari kedua model tersebut, dan itu membalik perbandingan harga tertera begitu beban kerja benar-benar bertumbuh:
• Harga pada 30.000 token masukan — Claude Opus 5.5 adalah yang mahal, sekitar 28 sen untuk 30.000 masukan dan 8.000 keluaran, dibandingkan sekitar 11 sen untuk Grok 4.6
• Harga pada 250.000 token masukan — urutannya terbalik, karena Grok 4.6 telah naik ke tingkatnya yang digandakan sementara Claude Opus 5.5 belum
• Pembacaan cache — $0,20 per juta untuk Claude Opus 5.5 dibandingkan dengan $0,50, naik menjadi $1,00 setelah melewati ambang, untuk Grok 4.6
• Output maksimum — 128.000 token untuk Claude Opus 5.5; batas output Grok 4.6 tidak dicantumkan dalam catatan katalog
Grok 4.6 juga memiliki satu celah yang layak dinyatakan secara terang-terangan daripada dibiarkan ditemukan belakangan. Rekornya sama sekali tidak mencantumkan angka output maksimum — bidang itu belum diukur, bukan nol — sehingga beban kerja yang bergantung pada respons tunggal yang sangat panjang tidak memiliki angka terbit yang bisa dijadikan acuan perencanaan pada sisi perbandingan itu.
Kolom performa yang seharusnya tidak dibaca
Katalog kami juga memuat panel kinerja penyajian per model, dan pada Grok 4.6 itu adalah hal yang paling menyesatkan di halaman. Kartunya menunjukkan latensi p50 sebesar 10.000 milidetik dan tingkat kesalahan 97,58% selama jendela tujuh hari, dengan 26.184 token yang dilayani dalam periode tersebut. Kolom-kolom itu tidak menggambarkan model yang lambat. Kolom-kolom itu menggambarkan model yang nyaris tidak dipanggil: pada tingkat lalu lintas tersebut, sampelnya terlalu tipis untuk membuat distribusi latensi berarti apa pun, dan tingkat kesalahan itu mencerminkan segelintir percobaan, bukan kualitas layanan. Memperlakukan blok tersebut sebagai bukti bahwa Grok 4.6 lambat berarti membaca artefak pengukuran sebagai pengukuran.
Panel Claude Opus 5.5, sebaliknya, memiliki populasi di belakangnya — p50 dalam kisaran 4,4 detik selama jendela tujuh hari dengan sampel harian, dan 156 juta token yang dilayani pada periode yang sama. Bahkan itu pun harus dibaca sebagai apa adanya: trafik playground kami sendiri, yang merupakan sampel dari pengguna kami dan bukan properti dari model.
Yang mana yang harus dirutekan, dan bagaimana cara mengetahuinya pada pekerjaan Anda sendiri
Pemisahan yang digambarkan oleh angka-angka itu cukup stabil untuk dijadikan dasar bertindak. Claude Opus 5.5 adalah pilihan untuk pekerjaan agentik dan berjangka panjang — selisih Terminal-Bench 4.0 sebesar 59,60% berbanding 21,21% adalah pemisahan terbesar pada sumbu mana pun yang diukur pada kedua model, dan itulah sumbu yang memprediksi apakah sebuah model dapat diberi tugas alih-alih pertanyaan. Ini juga pilihannya ketika prompt benar-benar panjang, karena tarifnya tidak berjenjang dan ukuran jendelanya dua kali lipat. Grok 4.6 adalah pilihan untuk pekerjaan berbentuk pertanyaan dalam volume besar: skor GPQA Diamond 94,9% dengan $2,00/$6,00 di dalam 200.000 token pertama adalah penawaran yang sangat bagus untuk beban kerja pengambilan-dan-jawaban yang tidak pernah tumbuh ke tingkat harga yang digandakan.
Keduanya ada di OrcaRouter pada harga daftar penyedia dengan markup 0% — Claude Opus 5.5 seharga $4,00/$20,00 dengan pembacaan cache $0,20, Grok 4.6 seharga $2,00/$6,00 dengan tier di atas 200K yang diterapkan persis seperti yang ditetapkan SpaceXAI — di balik satu kunci, sehingga pembagian di atas dapat diuji pada kumpulan prompt Anda sendiri alih-alih diperdebatkan. Ketika keduanya dirutekan, failover otomatis berada di bawahnya, yang layak dimiliki ketika model yang lebih murah justru yang memegang jalur agentic.
Putusan yang diraih pasangan ini: Grok 4.6 adalah pembaca yang lebih baik dan Claude Opus 5.5 adalah pekerja yang lebih baik. Nilai 94,9 pada GPQA Diamond dan 21,21 pada Terminal-Bench adalah model yang sama yang diukur dua kali, dan mengetahui angka mana di antara keduanya yang paling mirip dengan beban kerja Anda adalah keseluruhan keputusannya.


Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
