Kartu hero yang dihasilkan untuk perbandingan GPT-6.1 Sol versus Grok 4.7, dengan judul '40% lebih murah per token, 5,2 kali lipat tagihan', dengan tiga lencana bertuliskan 'Output Grok 4.7: $6,00 per 1 juta', 'Output GPT-6.1 Sol: $10,00 per 1 juta' dan 'Token output pada uji indeks: 67 juta vs 240 juta', dan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

GPT-6.1 Sol vs Grok 4.7: Tarif Output Termurah di Antara Semuanya, dan Percakapan Paling Mahal

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Grok 4.7, penerus Grok 4.6 dari xAI, meluncur pada 21 September 2026 dengan harga $2,00 per juta token input dan $6,00 per juta token output. GPT-6.1 Sol, pembaruan kelas menengah dari OpenAI, meluncur delapan hari kemudian pada 29 September dengan harga $2,00 untuk input dan $10,00 untuk output. Tarif inputnya identik, tarif outputnya 40% lebih murah pada Grok 4.7, dan di situlah sebagian besar perbandingan berhenti. Itu adalah tempat yang salah untuk berhenti, karena lembaga independen yang sama kini telah mengukur kedua model secara menyeluruh: Grok 4.7 menghabiskan sekitar 240 juta token output untuk menyelesaikan Artificial Analysis Intelligence Index; GPT-6.1 Sol menghabiskan 67 juta. Kalikan tarif yang lebih murah dengan volume tiga setengah kali lipat, dan model dengan harga per token lebih rendah memakan biaya $3,74 per tugas yang diselesaikan, dibandingkan dengan $0,72.

Dua model, terpaut delapan hari, dan kartu tarif yang terbalik

Grok 4.7 adalah model terkuat xAI untuk pengkodean dan pekerjaan pengetahuan: jendela konteks 500.000 token, hingga 450.000 token keluaran dalam satu respons menurut daftar vendor sendiri, masukan teks, gambar, dan file, serta upaya penalaran yang dapat dikonfigurasi di seluruh low, medium (default), high dan xhigh. xAI belum mengungkapkan jumlah parameter, cutoff prapelatihan dilaporkan sebagai dengan pelatihan tambahan hingga .

GPT-6.1 Sol adalah penyegaran satu tingkat dari OpenAI untuk tier GPT-6 Sol, diposisikan di bawah GPT-6 Astra dan di atas GPT-6 Luna: konteks 1.050.000 token — kira-kira dua kali lipat dari Grok — dengan batas output 128.000 token yang kira-kira sepertiga dari Grok, batas pengetahuan 30 April 2026, dan input teks, gambar, serta file yang sama. Tangga penalarannya berjalan dari rendah hingga maks dengan default sedang, dan tidak lagi menerima tidak ada sama sekali.

Satu baris per dimensi, kedua sisi pada masing-masing:

• Masukan — GPT-6.1 Sol $2.00 per 1 juta vs Grok 4.7 $2.00 per 1 juta; identik
• Keluaran — GPT-6.1 Sol $10.00 per 1 juta vs Grok 4.7 $6.00 per 1 juta; Grok 40% lebih murah
• Masukan cache — GPT-6.1 Sol $0.10 per 1 juta vs Grok 4.7 $0.50 per 1 juta; Sol lima kali lebih murah, kebalikan dari yang tersirat pada baris keluaran
• Jendela konteks — 1.050.000 token vs 500.000
• Keluaran maksimum dalam satu respons — 128.000 token vs 450.000 yang diklaim
• Langkah konteks panjang — seluruh permintaan dihargai ulang di atas 272.000 token masukan dengan 2× masukan dan cache serta 1,5× keluaran vs setiap tarif digandakan di atas 200.000 token masukan, juga untuk seluruh permintaan
• Upaya penalaran — rendah, sedang (default), tinggi, xhigh, maks vs rendah, sedang (default), tinggi, xhigh
• Bobot dan parameter — tertutup, tidak diungkapkan vs tertutup, tidak diungkapkan; keduanya tidak memberi Anda checkpoint
• Intelligence Index pada upaya maksimum yang dipublikasikan — GPT-6.1 Sol 51,8 pada maks vs Grok 4.7 46,4 pada xhigh
• Biaya per tugas indeks, independen — $0,72 vs $3,74
• Token keluaran pada eksekusi indeks — 67 juta vs 240 juta, dibandingkan median papan sekitar 81 juta

Dua baris dalam daftar itu adalah keseluruhan perbandingannya. Tarif output Grok 4.7 benar-benar lebih rendah dan baris cache-nya benar-benar lima kali lebih tinggi; dan ia menghasilkan tiga setengah kali lebih banyak token untuk diukur. Kartu tarif, jika dibaca sendiri, menunjuk ke satu arah. Hasil pengukuran menunjuk ke arah sebaliknya, dengan faktor lima.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Di mana Grok 4.7 sebenarnya unggul

Tidak jujur untuk menyajikan artikel ini sebagai kekalahan telak, karena Grok 4.7 menang dalam evaluasi nyata. Dinilai secara berdampingan pada upaya maksimum yang dipublikasikan di Artificial Analysis v4.3.2 — Grok pada xhigh, Sol pada max, perbedaan konfigurasi yang perlu diingat sepanjang pembahasan ini:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 vs GPT-6.1 Sol Elo 1575.1. Keunggulan Elo 140 poin pada pekerjaan pengetahuan yang bernilai secara ekonomi, dan kemenangan independen tunggal terbesar bagi model dengan tarif lebih murah.
• AutomationBench-AA — Grok 4.7 0.6556 vs GPT-6.1 Sol 0.6487. Secara efektif imbang, secara nominal milik Grok.
• SciCode — Grok 4.7 0.5741 vs GPT-6.1 Sol 0.5417. Keunggulan 3.2 poin dalam pengkodean ilmiah.
• Terminal-Bench 4.0 — Grok 4.7 0.2576 vs GPT-6.1 Sol 0.5606. Defisit 30 poin, dan selisih terbesar dalam pasangan ini.
• Humanity's Last Exam — Grok 4.7 0.4314 vs GPT-6.1 Sol 0.5292.
• AA-LCR v1.1, penalaran konteks panjang — Grok 4.7 0.7667 vs GPT-6.1 Sol 0.83.
• AA-Omniscience — Grok 4.7 32.0 vs GPT-6.1 Sol 41.5.
• GDP.pdf — Grok 4.7 0.20 vs GPT-6.1 Sol 0.31.
• CritPt — Grok 4.7 0.1771 vs GPT-6.1 Sol 0.3171.

Tiga dari sembilan evaluasi jatuh kepada Grok 4.7 atau seri, termasuk yang paling sulit dibantah: GDPval-AA dirancang untuk menilai pekerjaan profesional yang bernilai ekonomis, dan keunggulan Elo 140 poin bukanlah kebetulan. Jika beban kerja Anda adalah jenis yang dibuat untuk diwakili oleh GDPval — analisis yang sarat dokumen, hasil kerja profesional, penilaian yang memiliki jawaban benar — model dengan tarif lebih murah juga merupakan model yang lebih baik di papan peringkat netral, dan penalti biaya per tugas adalah yang Anda bayarkan untuk itu.

Angka peluncuran xAI sendiri terbilang besar dan, seperti semua angka peluncuran vendor, belum direproduksi. CursorBench 4.0 pada 46,3% pada xhigh versus 40,4% milik Grok 4.6; Terminal-Bench 4.0 pada 38,0% versus 20,3%, peningkatan tunggal terbesar yang diklaim dalam rilis ini; DeepSWE v1.1 pada 71,0% pada high versus 65,2%; EEBench pada 64,0% versus 53,0%. Semua itu adalah harness xAI, pengaturan xAI, pelaporan xAI — dan perhatikan bahwa klaim 38,0% pada Terminal-Bench 4.0 berhadapan dengan 0,2576 dari papan independen untuk model yang sama pada benchmark yang sama, yakni jenis selisih yang semestinya Anda duga antara konfigurasi yang disetel vendor dan eksekusi upaya maksimal yang netral.

Angka-angka Open​AI untuk GPT-6.1 Sol layak mendapatkan diskon yang sama dan memiliki kelemahan yang sama. Satu-satunya angka dalam perbandingan ini yang tidak dihasilkan oleh vendor mana pun adalah biaya per tugas yang diselesaikan, karena angka itu dihitung dari konsumsi token yang terukur, bukan dari tabel skor. Itulah angka yang bertahan.

Mengapa 240 juta token menentukan hasilnya

Artificial Analysis menggambarkan verbositas Grok 4.7 dalam ringkasannya sendiri, dan jumlah token di balik uji indeksnya adalah buktinya: 240 juta token keluaran berbanding median papan sekitar 81 juta, kira-kira tiga kali lipat dari yang dihasilkan model tipikal pada suite yang sama. Angka 67 juta milik GPT-6.1 Sol berada jauh di bawah median. Gabungkan kedua rasio itu — volume 3,6× dengan harga 0,6× — dan tarif keluaran yang lebih murah berarti membeli lebih banyak token, bukan tagihan yang lebih kecil, yang persis seperti wujud perbedaan biaya per tugas $3,74 versus $0,72.

Caching mengubah besarnya efek, tetapi tidak arahnya, dan inilah detail yang sering menjebak orang. Input cache Grok 4.7 adalah $0.50 per juta, dibandingkan $0.10 milik Sol — lima kali lebih mahal pada lini tempat riwayat agen yang panjang dan prompt sistem yang berulang berada. Beban kerja yang didominasi pembacaan ulang prefiks besar yang stabil karena itu mendapati kedua model lebih berdekatan daripada yang disiratkan oleh $6 versus $10, dan begitu verbositas Grok diterapkan di atasnya, keduanya lebih berjauhan daripada yang disiratkan oleh tarif input. Lini cache dan lini token menunjuk ke arah yang sama di sini, yang tidak biasa dan membuat pasangan ini lebih bersih daripada yang disiratkan oleh kartu tarif.

Klausul konteks panjang layak diberi harga secara terpisah karena dipicu pada titik yang berbeda. GPT-6.1 Sol menetapkan ulang harga seluruh permintaan di atas 272.000 token input; Grok 4.7 melakukan hal yang sama di atas 200.000. Pada panggilan 250.000 token, Grok sudah berlipat dua — $4,00 dan $12,00 dengan pembacaan cache $1,00 — sementara Sol masih memakai tarif standarnya $2,00 dan $10,00. Antara 200.000 dan 272.000 token, model dengan daftar tarif lebih murah justru menjadi yang lebih mahal dengan selisih besar, dan rentang itu umum dalam pekerjaan dokumen.

Di mana Grok benar-benar menang adalah pada struktur, bukan skor, yakni plafon output. Respons maksimum 450.000 token versus 128.000 milik Sol adalah kelas artefak yang berbeda: seluruh basis kode yang dihasilkan, transkrip panjang, sintesis sepanjang buku dalam satu panggilan. Jika Anda saat ini menabrak batas output, baris itulah yang menentukan perbandingan dan tidak ada apa pun dalam aritmetika biaya di atas yang berlaku — Anda tidak dapat membeli kemampuan yang tidak dimiliki model lain, berapa pun tarifnya.

Keduanya berada pada satu tombol, itulah bagian yang berguna

Grok 4.7 berada di OrcaRouter dengan harga daftar xAI sendiri — $2,00 dan $6,00 per juta token dengan pembacaan cache $0,50 dan tarif bertingkat pada 200.000 token menjadi $4,00 dan $12,00 diteruskan persis seperti yang dicantumkan xAI — dan GPT-6.1 Sol hadir di rute kami pada hari perilisan dengan harga OpenAI, $2,00 dan $10,00 dengan input cache $0,10 dan tarif bertingkat pada 272.000 token tidak berubah. Tidak ada tambahan pada keduanya: platform meneruskan harga daftar penyedia apa adanya, bukan menaikkannya, yang berarti pemotongan harga vendor di sisi mana pun langsung berlaku di sini pada hari yang sama saat berlaku di sana, tanpa faktur kedua dan tanpa reseller di tengah.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

Untuk pasangan tertentu ini, hal itu bernilai lebih daripada sekadar kenyamanan. Kedua model ini tidak sepakat tentang keunggulan masing-masing — Grok 4.7 unggul pada Elo pekerjaan profesional dan pada pengodean ilmiah, GPT-6.1 Sol unggul pada eksekusi terminal, keandalan faktual, dan pengambilan konteks panjang — dan batas antara beban kerja tersebut terlihat di lalu lintas Anda sendiri sebelum terlihat di tolok ukur. Mengirim permintaan berbentuk GDPval ke satu arah dan menjalankan agen berhorizon panjang ke arah lain, di belakang satu endpoint, dengan failover otomatis di kedua arah dan aturan perutean yang Anda ubah dalam konfigurasi alih-alih dalam penerapan, adalah cara yang lebih murah untuk menemukan batas itu daripada proyek evaluasi. Fusi model, di mana panel model menjawab bersama-sama, adalah opsi lain yang ditawarkan platform jika Anda lebih suka tidak memilih per permintaan sama sekali.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

Panggilan

• Pekerjaan agentik dan terminal dengan output panjang, loop prefiks yang di-cache — GPT-6.1 Sol. Tiga puluh poin pada Terminal-Bench 4.0, baris cache lima kali lebih murah dan seperlima biaya per tugas yang diselesaikan.
• Pekerjaan pengetahuan profesional, analisis dokumen, tugas pertimbangan — Grok 4.7 berkat keunggulan 140 poin GDPval-AA Elo, dengan tagihan token dianggarkan, bukan diasumsikan.
• Pengodean ilmiah — Grok 4.7, dengan selisih tipis, pada split SciCode papan peringkat. Periksa hal itu terhadap suite Anda sendiri; 3,2 poin berada dalam rentang yang dapat digeser oleh set prompt yang berbeda.
• Respons tunggal di atas 128.000 token keluaran — Grok 4.7, dan tidak ada aritmetika yang dapat menggantikannya.
• Permintaan antara 200.000 dan 272.000 token masukan — GPT-6.1 Sol, karena Grok 4.7 sudah menggandakan ukuran permintaannya secara keseluruhan dan Sol belum.
• Percakapan termurah yang mungkin — bukan keduanya. Keduanya adalah model dengan harga frontier dan konsumsi token frontier; perbandingannya adalah tentang mana yang menyelesaikan tugas Anda, bukan mana yang murah secara abstrak.
• Jika sebuah perbandingan berakhir dengan "Grok lebih murah per token" — perbandingan itu berakhir satu langkah terlalu cepat. Langkah berikutnya adalah jumlah token, dan itu 240 juta berbanding 67.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari