
Claude Sonnet 5.5 vs Grok 4.6: Kartu Tarif Mengatakan Satu Hal, Tagihan Token Mengatakan Hal Lain
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 984 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Aritmetika di judul tampak sudah tuntas sebelum artikel dimulai. Grok 4.6 berbiaya $2 per juta token input dan $6 per juta token output; Claude Sonnet 5.5 berbiaya $2 dan $10. Model SpaceXAI lebih murah pada output sebesar 40%, setara pada input, dan telah tersedia secara umum sejak 12 Agustus 2026 — cukup lama sehingga keanehannya terdokumentasi, bukan sekadar rumor. Model Anthropic hadir pada 28 September 2026, sehari sebelum ini ditulis, dan merupakan yang terbaru di tier ini dengan selisih yang jauh.
Lalu Anda sampai pada angka efisiensi independen dan urutannya berbalik. Artificial Analysis mengukur model-model sekelas GPT dan Claude berdasarkan biaya per tugas bersama Intelligence Index miliknya, dan pada revisi v4.3.2 biaya kedua model di sini adalah $1,86 per tugas indeks untuk Grok 4.6 dan $7,60 untuk Claude Sonnet 5.5. Model dengan tarif yang lebih murah justru mahal untuk dioperasikan, empat kali lipat. Mencari tahu mengapa, dan kapan pembalikan itu berlaku dan tidak berlaku, adalah inti dari keseluruhan perbandingan.
Dua model, dua posisi dalam keluarga masing-masing
Grok 4.6 adalah produk unggulan saat ini dari lini Grok — dokumentasi pengembang milik SpaceXAI sendiri mencantumkannya sebagai yang terbaru, dan model ini menggantikan Grok 4.5 dengan jendela konteks 500.000 token yang sama, permukaan input teks, gambar, dan file yang sama, serta harga dasar yang sama. Model ini mendukung upaya penalaran yang dapat dikonfigurasi, pemanggilan alat native, output terstruktur, dan permukaan sampling lengkap, dan sebagai model OpenAI Responses kelas satu, ia langsung masuk ke framework agen yang ada tanpa lapisan penerjemahan. Artificial Analysis menempatkannya pada Intelligence Index 44, peringkat ke-31 dari 216 model yang diukurnya, dengan angka GPQA Diamond sebesar 94,9%.

Claude Sonnet 5.5 adalah entri kedua dalam generasi 5.5 Anthropic dan model yang diposisikan perusahaan sebagai kombinasi terbaik antara kecepatan dan kecerdasan dalam jajarannya. Model ini hadir sebagai claude-sonnet-5-5/ di Claude API dan tiga cloud utama, membawa jendela konteks 1 juta token dengan batas keluaran sinkron 128K, mempertahankan tarif $2 / $10 Claude Sonnet 5 untuk input, output, dan caching, serta tersedia dengan retensi data nol. Pada revisi indeks yang sama, model ini mendapat skor 56 dan menempati peringkat ketiga dari 216.
Jadi, keduanya sebenarnya tidak berada di pasar yang sama. Yang satu adalah model frontier 500.000 token yang telah dijual selama tujuh minggu dengan tarif yang hemat. Yang lainnya adalah tier serbaguna 1 juta token yang biaya per tokennya tidak lebih mahal daripada pendahulunya dan mencetak skor dua belas poin lebih tinggi pada komposit. Perbandingan ini tetap layak dilakukan, karena keduanya adalah model input $2 dan di situlah keputusan pengadaan sebenarnya dimulai.
Kesenjangan empat kali lipat yang tak seorang pun masukkan ke dalam slide
Kartu tarif memberi harga pada token. Tagihan dinyatakan dalam tugas, dan jumlah token yang dihabiskan sebuah model untuk mencapai jawaban adalah pilihan desain, bukan konstanta. Di situlah keduanya berbeda, dan angka yang terukur sangat mencolok:
• Tarif output — Claude Sonnet 5.5 $10 per juta vs Grok 4.6 $6 per juta
• Biaya per tugas Intelligence Index — Claude Sonnet 5.5 $7.60 vs Grok 4.6 $1.86
• Verbositas pada Indeks — Claude Sonnet 5.5 410M token keluaran vs Grok 4.6 94M
• Indeks Kecerdasan — Claude Sonnet 5.5 56 vs Grok 4.6 44, keduanya pada v4.3.2
• Kecepatan output — Grok 4.6 terukur pada 67,7 token per detik dibandingkan median 82,7; Anthropic melaporkan Claude Sonnet 5.5 menghasilkan output 30%+ lebih cepat daripada Claude Sonnet 5, yang diukur Artificial Analysis pada 78,7 token per detik
Pernyataan tentang verbositas adalah mekanismenya. Model yang mengeluarkan token empat kali lebih banyak tidak perlu memiliki laju keluaran 67% lebih tinggi untuk menelan biaya empat kali lebih besar per tugas — tetapi hal itu membantu, dan kedua efek tersebut menunjuk ke arah yang sama di sini. Kerangka Anthropic sendiri mendukung interpretasi itu alih-alih menentangnya: materi peluncurannya mengklaim Claude Sonnet 5.5 "berbiaya hingga 30% lebih rendah per tugas" daripada Claude Sonnet 5 pada harga per token yang sama, yang merupakan klaim tentang jumlah token, bukan laju. Dibandingkan dengan baseline eksternal yang jauh lebih ramping, sifat yang sama menjadi risiko biaya terbesar model tersebut.
Semua ini tidak menghilangkan celah indeks. Dua belas poin komposit adalah perbedaan kemampuan yang nyata, dan tugas yang lebih murah tetapi gagal bukanlah lebih murah. Ini berarti pertanyaan jujurnya bukanlah "tarif mana yang lebih rendah" melainkan "berapa token yang dibutuhkan tugas yang lebih sulit", dan angka itu hanya ada setelah Anda menjalankan beban kerja Anda sendiri.

Konteks, upaya, dan bentuk integrasi
Perbedaan kedua bersifat arsitektural, dan ini menentukan mana dari keduanya yang dapat Anda adopsi tanpa menulis ulang apa pun.

Claude Sonnet 5.5 mengubah enam perilaku dibandingkan Claude Sonnet 5, lima di antaranya bersifat breaking. Mengirimkan thinking: {"type": "disabled"}/ kini mengembalikan 400 dan harus diganti dengan between_tools/. Penggunaan tool yang dipaksa — tool_choice/ berupa "any"/ atau tool bernama — langsung ditolak, sehingga loop yang memaksa pemanggilan yang valid menurut skema harus beralih ke auto/ dengan strict tool use atau structured outputs. Tool computer-use lama computer_20251124/ ditolak di Claude API dan Google Cloud. Blok thinking kini terikat pada model dan akun yang menghasilkannya, sehingga sebuah percakapan dapat membawa penalarannya maju dari Claude Sonnet 5 tetapi tidak menyamping ke keluarga model yang berbeda. Dan tool advisor tidak lagi menerima Claude Opus 4.8, Claude Opus 4.7, atau Claude Sonnet 5 sebagai advisor di balik eksekutor Sonnet 5.5.
Grok 4.6 tidak meminta semua itu. Ini adalah model dengan format OpenAI dengan permukaan sampling yang utuh, dan migrasi dari Grok 4.5 hanyalah perubahan string model. Namun, struktur biayanya sendiri memiliki jebakan, dan ini adalah cerminan dari milik Anthropic: tarif $2 / $6 berlaku hingga 200.000 token input, dan semua yang melebihi itu ditagih sebesar $4 / $12. Claude Sonnet 5.5 mengenakan tarif standar di seluruh jendela 1M.
Letakkan kedua struktur itu berdampingan dan pilihannya tidak lagi soal vendor mana yang lebih murah:
• Prompt singkat, output padat — kebiasaan token Grok 4.6 yang lebih ramping dan laju output yang lebih rendah menang secara meyakinkan
• Input yang sangat panjang — tarif tetap 1M Claude Sonnet 5.5 mulai mengalahkan tier yang berlipat ganda jauh sebelum batas konteks
• Output tunggal besar — batas 128K Sonnet 5.5 menyamai Grok 4.6, dan mencapai 300K pada Message Batches API di balik output-300k-2026-03-24/ header
• Kode berformat OpenAI yang ada — Grok 4.6 tidak memerlukan perubahan; Sonnet 5.5 memerlukan pekerjaan penggunaan alat dan penalaran di atas
Menempatkan keduanya dalam satu kredensial
Memegang perbandingan dua vendor di kepala Anda itu mudah. Menjalankannya justru di situlah biayanya tersembunyi: dua akun, dua set batas, dua permukaan penagihan, dan jumlah token yang harus diukur dua kali sebelum berarti apa pun.
OrcaRouter menyatukan semua itu menjadi satu endpoint yang kompatibel dengan OpenAI yang mencakup lebih dari 200 model, dengan harga daftar penyedia diteruskan apa adanya dan tanpa markup, sehingga perubahan tarif vendor baik di sisi Grok maupun Claude langsung berlaku di sini pada hari yang sama, bukan pada perpanjangan kontrak berikutnya. Seluruh lini Grok 4.x ada di katalog dengan tarif milik vendor itu sendiri, dan Claude Sonnet 5 sudah dapat dirutekan sejak 30 Juni dengan tarif $2 / $10 dari Anthropic — model yang masih menjadi tulang punggung sebagian besar lalu lintas API Claude, terukur pada 150 token keluaran per detik dengan waktu token pertama p50 sekitar lima detik.
Secara khusus, Claude Sonnet 5.5 belum ada di katalog kami. Sampai saat itu tiba, jalur untuk mengaksesnya adalah API milik vendor itu sendiri, dan cara mengujinya tanpa mempertaruhkan beban kerja pada model yang belum diukur secara independen melampaui satu komposit adalah dengan mengirimkan persentase lalu lintas di balik failover otomatis, dengan Grok 4.6 atau Claude Sonnet 5 menangkap apa yang gagal ditanganinya. Mencoba tier yang benar-benar baru adalah keputusan perutean, bukan proyek migrasi.
Apa yang harus dilakukan dengan angka-angka itu
Grok 4.6 adalah model yang lebih baik untuk dipilih saat pekerjaannya singkat, outputnya padat, dan integrasinya sudah kompatibel dengan OpenAI. Secara terukur, model ini lebih hemat per tugas dibandingkan apa pun di rentang harga ini, kontrol sampling-nya tetap utuh, dan ketersediaan selama tujuh minggu berarti mode kegagalannya sudah ditemukan orang lain.
Claude Sonnet 5.5 adalah model yang lebih baik ketika inputnya sangat besar, ketika skor komposit adalah hal yang Anda beli, atau ketika pekerjaannya cukup agentik sehingga selisih indeks dua belas poin dan plafon keluaran 128K lebih penting daripada perbedaan biaya per tugas sebesar empat kali lipat. Daftar periksa migrasinya nyata, dan itu merupakan pekerjaan sehari, bukan sekadar suntingan string model.
Yang bisa menyelesaikannya adalah pengukuran token per tugas pada trafik Anda sendiri, yang dijalankan pada keduanya. Setiap angka dalam artikel ini yang menentukan hasilnya — $1.86 versus $7.60, 94M versus 410M — hanyalah proksi bagi satu angka itu, dan angka itulah satu-satunya di antara semuanya yang bisa Anda hasilkan sendiri.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
