Kartu judul hero yang dihasilkan untuk artikel berjudul 'Grok 4.7 vs Kimi K3 — harga melawan konteks', dengan subjudul 'Dua model terdepan, dua taruhan berbeda' dan chip statistik bertuliskan harga $2/$6 vs $3/$15, konteks 500K vs 1M, dan bobot terbuka tidak vs ya.
Guides & Insights

Grok 4.7 vs Kimi K3: Setengah Harga, Setengah Konteks, Tidak Ada Bobotnya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ambil satu bulan pekerjaan coding agentik berukuran 300 juta token dan jalankan melalui kedua model pada tarif daftar mereka, maka pilihan itu berhenti terlihat seperti argumen benchmark. Grok 4.7, yang dirilis SpaceXAI pada 21 September 2026, mengenakan biaya $2 per juta token masukan dan $6 per juta token keluaran. Kimi K3, yang dirilis Moonshot AI pada 16 Juli 2026, mengenakan biaya $3 dan $15. Pada bulan hipotetis itu — katakanlah 200 juta token masukan dan 100 juta token keluaran — Grok 4.7 menjadi sekitar $1.000 dan Kimi K3 sekitar $2.100. Selisihnya bukan perbedaan pembulatan; itu setara anggaran satu model lagi. Sebaliknya, Kimi K3 memberi Anda jendela konteks 1.000.000 token alih-alih 500.000, masukan video native serta gambar, dan bobot yang dapat diunduh. Grok 4.7 memberi Anda model tertutup yang lebih cepat dan lebih murah yang secara eksplisit dilatih untuk pekerjaan terminal berhorizon panjang yang juga menjadi target Kimi K3. Keduanya kelas frontier. Keduanya bukan pembelian yang sama.

Kedua model, secara singkat

Grok 4.7 adalah model coding dan pekerjaan pengetahuan terdepan milik SpaceXAI, dibangun di atas model dasar yang lebih besar daripada Grok 4.6 dan diberi proses pembelajaran penguatan yang lebih panjang untuk tugas-tugas yang dapat memakan waktu berjam-jam. Model ini bersifat proprietary — tidak ada bobot, tidak ada pengunduhan — menyediakan jendela konteks 500.000 token, menerima masukan teks dan gambar serta mengembalikan teks, dan mendukung tingkat upaya penalaran dari low hingga xhigh. Klaim utamanya adalah kecepatan dan harga: SpaceXAI memposisikannya sebagai sekitar dua kali lebih cepat daripada model sebanding dengan harga sekitar setengahnya.

Kimi K3 adalah model campuran pakar terbuka unggulan Moonshot AI, model terbuka pertama di kelas tiga triliun parameter: total 2,8 triliun parameter dengan 104 miliar yang aktif per token, dibangun di atas Kimi Delta Attention dan bobot MXFP4 yang sadar kuantisasi. Model ini menerima masukan teks, gambar, dan video, menyajikan konteks 1.000.000 token, menjalankan penalaran yang selalu aktif dengan upaya yang dapat dikonfigurasi, dan bobotnya dapat diunduh di bawah Lisensi Kimi K3 — penggunaan komersial diizinkan, dengan pembatasan. Secara desain, inilah model yang dapat Anda bawa pulang.

Itulah keseluruhan perbedaan struktural di antara keduanya. Yang satu adalah endpoint tertutup yang murah dan cepat. Yang lain adalah artefak terbuka yang lebih mahal, lebih lambat, dengan konteks dua kali lipat. Segala hal di bawah ini adalah konsekuensi dari itu.

Apa yang sebenarnya dibandingkan oleh benchmark

Di sinilah sebagian besar tulisan yang membandingkan Grok 4.7 dengan Kimi K3 keliru, jadi penting untuk berterus terang: angka-angka yang dipublikasikan kedua model sebagian besar tidak mengukur hal yang sama, dan setidaknya ada satu pasangan yang tampak sebanding tetapi sebenarnya tidak.

Mulailah dengan pasangan yang benar-benar menyesatkan. Materi peluncuran Kimi K3 menyebutkan skor Terminal-Bench 2.1 sebesar 88.3. Materi peluncuran Grok 4.7 menyebutkan Terminal-Bench 4.0 pada 38.0%. Itu adalah versi benchmark yang berbeda dengan kumpulan tugas dan penilaian yang berbeda, dan menempatkannya berdampingan akan menyiratkan bahwa Kimi K3 adalah model agentik yang lebih dari dua kali lipat. Ini bukan pembacaan yang dapat dipertahankan, dan tidak seorang pun boleh mengulanginya. Kedua angka itu juga dilaporkan oleh vendor — tidak satu pun telah direproduksi secara independen.

Yang bisa dibandingkan adalah komposit independen, dan di sana keduanya berdekatan. Pada Artificial Analysis Intelligence Index saat ini, versi v4.3.2, Kimi K3 mencetak 44 — peringkat kedua dari 113 model, penempatan tertinggi untuk model dengan bobot terbuka di papan peringkat. Grok 4.7 mencetak 46, peringkat keenam belas dari 655. Terpaut dua poin, dengan penempatan Kimi K3 diraih pada upaya penalaran maksimum. Pada komposit gabungan, model-model ini setara.

• Komposit independen — Grok 4.7 46 pada AA Intelligence Index v4.3.2 vs Kimi K3 44 pada versi yang sama. Imbang dalam praktik.

• Jendela konteks — Grok 4.7 500.000 token vs Kimi K3 1.000.000 token. Keunggulan nyata dan tanpa syarat bagi Kimi K3, dan satu-satunya perbedaan spesifikasi yang tidak disertai catatan.

• Modalitas masukan — Grok 4.7 teks dan gambar vs Kimi K3 teks, gambar, dan video. Kimi K3 lebih luas, jika beban kerja Anda mencakup video.

• Bobot — Grok 4.7 bersifat proprietari, tidak dapat diunduh vs bobot terbuka Kimi K3 di bawah Lisensi Kimi K3. Untuk kebutuhan on-premise atau air-gapped, hanya baris inilah yang penting.

• Harga per juta token — Grok 4.7 $2 untuk input / $6 untuk output vs Kimi K3 $3 untuk input / $15 untuk output, dengan tarif input cache Kimi sebesar $0.30 per juta. Grok 4.7 lebih murah di setiap aspek, dan jauh lebih murah untuk output.

• Kontrol upaya penalaran — Grok 4.7 rendah hingga xhigh vs Kimi K3 yang selalu aktif dengan upaya yang dapat dikonfigurasi. Secara fungsional serupa; perbedaannya adalah Grok 4.7 memungkinkan Anda menurunkan penalaran.

• Bukti agentik yang dilaporkan vendor — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (semuanya dilaporkan vendor) vs Kimi K3 Terminal-Bench 2.1 88,3%, Frontend Code Arena peringkat pertama pada 1.679 Elo (dilaporkan vendor saat peluncuran). Tidak dapat dibandingkan — lihat di atas.

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Ke mana uang itu sebenarnya pergi

Daftar tarif tidak cukup menggambarkan besarnya selisih, karena kedua model mengonsumsi token secara berbeda. Grok 4.7 adalah penalar yang bertele-tele — Artificial Analysis mengukur 240 juta token keluaran yang dihasilkan saat menjalankan Intelligence Index-nya, dibandingkan dengan median 92 juta di seluruh model. Kimi K3 adalah jenis mahal yang sebaliknya: ia adalah model penalaran besar yang selalu aktif, dan pada $15 per juta token keluaran, sifat bertele-tele itulah yang Anda beli.

Model biaya yang jujur bukanlah "$2/$6 versus $3/$15." Melainkan token output per tugas yang diselesaikan, dikalikan dengan tarif output, ditambah token input termasuk setiap percobaan ulang, dikalikan dengan tarif input. Model yang menyelesaikan tugas dalam satu pass panjang dengan biaya $6 per juta bisa mengalahkan model yang membutuhkan tiga percobaan dengan biaya $15 per juta, dan bisa juga kalah darinya jika pass model murah itu cukup panjang. Itu adalah pengukuran yang Anda jalankan di repositori Anda sendiri, bukan pengukuran yang dipublikasikan orang lain untuk Anda.

Satu asimetri perlu diketahui sebelum Anda menjalankannya: Grok 4.6, pendahulu Grok 4.7, menerapkan tebing harga pada 200.000 token masukan, di mana permintaan yang melewati batas tersebut akan dihitung ulang seluruh permintaan dengan tarif dua kali lipat. Pekerjaan konteks panjang di sisi Grok perlu dicek terhadap kartu tarif terkini untuk model yang Anda gunakan, karena jendela 500.000 token dan tebing 200.000 token berinteraksi dengan buruk. Harga Kimi K3 datar, yang merupakan keunggulan yang lebih tidak mencolok di antara keduanya.

Di mana masing-masing rusak

Kedua model memiliki mode kegagalan yang tidak dikedepankan oleh materi peluncuran, dan keduanya adalah kegagalan yang berbeda.

Soal Kimi K3 adalah keandalan di bawah beban berkelanjutan. Pengujian komunitas dan independen saat peluncuran melaporkan bahwa performa agentiknya menurun seiring berjalannya proses — hasil sekali jalan yang kuat, tingkat kelulusan berkelanjutan yang lebih lemah — dan kecepatan outputnya berada di kisaran 37 hingga 38 token per detik, yang lambat untuk coding interaktif. Moonshot juga harus menghentikan sementara langganan konsumen baru tak lama setelah peluncuran karena permintaan melampaui kapasitas, yang menunjukkan sesuatu tentang headroom penyajian di sisi hosted.

Bentuk Grok 4.7 justru sebaliknya: ia cepat, murah, dan tertutup, yang berarti Anda tidak dapat memeriksanya, tidak dapat menjalankannya sendiri, dan tidak dapat melindungi diri dari deprecation. SpaceXAI telah mengumumkan secara publik urutan Grok 4.8, Grok 4.9, dan Grok 5 setelah rilis ini, dan Grok 4.6 hanya bertahan sekitar lima minggu sebelum digantikan. Apa pun yang Anda bangun di atas Grok 4.7 harus dibangun sedemikian rupa sehingga ID model menjadi nilai konfigurasi, bukan asumsi.

Ada pertimbangan ketiga yang bukan merupakan kegagalan salah satu model: tidak ada satu pun yang menjadi jawaban tepat untuk operasi otonom selama dua minggu, dan kedua vendor telah mempertunjukkan persis hal itu. Demo pengkodean otonom 16 hari dan 48 jam yang dipublikasikan dijalankan oleh vendor, pada tugas yang dipilih vendor, tanpa reproduksi independen. Demo-demo itu layak untuk diketahui, tetapi tidak layak untuk dijadikan dasar perencanaan.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Menjalankan keduanya, dan mengapa itulah jawaban yang sebenarnya

Kesenjangan biaya dan kesenjangan konteks mengarah ke arah yang berlawanan, dan itulah argumen untuk tidak memilih salah satu. Kimi K3 sepadan dengan harganya untuk pekerjaan berskala repositori, di mana jendela 1M berarti Anda tidak perlu memecah input, dan untuk apa pun yang harus di-hosting sendiri. Grok 4.7 sepadan dengan harganya untuk volume — loop agen dengan banyak turn, pipeline yang padat pemanggilan tool, dan sesi terminal panjang tempat kecepatan dan biaya output mendominasi.

Kimi K3 tersedia di OrcaRouter, yang menjadikan pemisahan itu sebagai keputusan routing, bukan keputusan pengadaan. Model ini ada di katalog dengan harga list Moonshot, dan karena OrcaRouter meneruskan harga list penyedia dengan markup 0%, pemotongan harga dari vendor langsung aktif di sini pada hari yang sama saat diumumkan, bukan pada pembaruan kontrak berikutnya. Untuk beban kerja ketika tahap konteks panjang dan tahap eksekusi sebaiknya berkolaborasi alih-alih bersaing — satu model memegang seluruh repositori dalam pandangannya, model lain bertindak atasnya — DSL routing menyusun beberapa model ke dalam satu panggilan, dan fusi model memungkinkan sekumpulan model menjawab bersama-sama ketika tugasnya sepadan dengan pengeluaran ekstra. Satu kunci API mencakup Kimi K3 plus 200+ model lainnya, sehingga separuh eksekusi dari pemisahan itu bisa berasal dari model mana pun yang paling murah dan tercepat untuk pekerjaan tersebut, bukan dari model yang kebetulan memegang konteksnya.

Ada satu hal yang perlu diperjelas: bobot terbuka Kimi K3 dapat diunduh, tetapi endpoint yang dihosting itulah yang menjadi tujuan perutean OrcaRouter. Jika kebutuhan Anda benar-benar inferensi on-premise, itu adalah proyek self-hosting di perangkat keras Anda sendiri, bukan keputusan perutean — dan itulah satu-satunya skenario di mana perbandingan ini memiliki satu jawaban yang benar.

Putusan, dan satu angka yang harus dipegang

Jika Anda memilih berdasarkan biaya dan kecepatan, Grok 4.7 menang, dan selisihnya tidak tipis: setengah harga input, kurang dari setengah harga output, penyajian lebih cepat, dan tombol penalaran yang bisa Anda turunkan. Jika Anda memilih berdasarkan konteks, keluasan modalitas, atau kemampuan untuk memiliki model, Kimi K3 menang dengan dasar yang sama. Jika Anda memilih berdasarkan kemampuan saja, komposit independen menyatakan keduanya terpaut dua poin, dan Anda sebaiknya memutuskan berdasarkan evaluasi Anda sendiri, bukan berdasarkan bagan peluncuran salah satu vendor.

Angka yang harus dipertahankan adalah angka dari bagian atas: $2/$6 dibandingkan $3/$15. Segala hal lain dalam perbandingan ini dapat dinegosiasikan, tetapi rasio itu tidak.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari