
LongCat-2.5-Preview vs Grok 4.6: Satu Punya Kartu Benchmark, Satu Punya Penerus
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 610 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 189 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Membandingkan LongCat-2.5-Preview dengan Grok 4.6terasa canggung karena alasan yang tidak ada kaitannya dengan kualitas model mana pun: pertanyaan ini punya masa berlaku. Grok 4.6 dirilis pada 12 Agustus 2026 dan Grok 4.7 dirilis pada 21 September 2026 — enam hari sebelum tulisan ini dibuat — dengan tarif yang sama, $2,00 / $6,00 per juta token, dan jendela konteks 500.000 token yang sama. Sementara itu, LongCat-2.5-Preview hadir di Platform API LongCat milik Meituan pada 25 September 2026 tanpa penerus yang diumumkan sama sekali dan tanpa tolok ukur yang dipublikasikan. Jadi, pilihan sebenarnya bukanlah "model mana yang lebih baik". Pilihan sebenarnya adalah apakah Anda menginginkan kemampuan yang sudah terukur dengan penerus yang sudah terukur pula yang sudah berdiri di belakangnya, atau kemampuan yang belum terukur yang setidaknya merupakan hal terkini.
Kerangka berpikir itu kurang menarik daripada papan skor dan jauh lebih berguna.
Mulailah dengan apa yang sebenarnya sudah ada dalam catatan Grok 4.6
Grok 4.6 adalah model yang terdokumentasi dengan baik. Di katalog kami, model ini memiliki jendela konteks 500.000 token, input teks, gambar, dan file, serta daftar tarif $2,00 per juta token input, $6,00 per juta token output, dan $0,50 per juta token input yang di-cache, meningkat menjadi $4,00 dan $12,00 di atas 200.000 token input. Profil independennya dari Artificial Analysis mencakup Coding Index 76,8 — kelima di antara model yang dilacak indeks tersebut — Intelligence Index 44,3 di peringkat kedelapan belas, GPQA Diamond 94,9%, Humanity's Last Exam 42,9%, SciCode 56,5%, Terminal-Bench v2.1 88,4, dan τ²-Bench untuk perbankan 50,7. Long-Context Recall-nya 80,3.

LongCat-2.5-Preview tidak memiliki semua itu. Entri changelog Meituan untuk 25 September 2026 adalah pemberitahuan ketersediaan bertanggal yang mencantumkan tiga kemampuan yang diklaim — pemahaman gambar, pengodean, dan kompatibilitas dengan "Claude Code dan lingkungan pengembangan arus utama lainnya" termasuk Hermes, OpenClaw, OpenCode, dan Kilo Code — dan tidak ada yang menyerupai hasil. Halaman harga vendor tersebut mencantumkan $0,30 per juta input yang tidak di-cache, $0,006 per juta input yang di-cache, dan $1,20 per juta output, yang secara eksplisit ditandai sebagai diskon waktu terbatas. Jendela konteksnya adalah 1.000.000 token; output maksimumnya adalah 131.072. Jumlah parameter sekitar 1,6 triliun total / 48 miliar aktif berasal dari metadata situs Meituan dan liputan perdagangan China, bukan dari dokumentasi. Tidak ada repositori untuknya di HuggingFace atau di organisasi GitHub Meituan, dan metadata katalog yang disertakan OpenCode mencatat bobot terbuka sebagai false.
Dimensi yang akan sepenuhnya luput dari papan skor
Kedua model ini berbeda pada sesuatu yang tidak diukur oleh tolok ukur mana pun, dan bagi banyak tim, hal itu sendiri sudah menentukan jawabannya: apa yang terjadi pada prompt yang Anda kirim.
Dokumentasi OpenCode sendiri menyatakan bahwa LongCat 2.5 Preview Free dilayani oleh penyedia yang menganut kebijakan tanpa retensi dan tidak menggunakan data Anda untuk pelatihan; tabel privasi Zen memberikan angkanya — pelatihan model "Tidak digunakan", retensi data "0 hari". Tabel privasi yang sama mencantumkan retensi tiga puluh hari untuk Grok 4.6 dan Grok 4.7. Kedua pernyataan itu berasal dari OpenCode, diterbitkan di halaman-halaman OpenCode, dan secara khusus menjelaskan daftar gratis serta daftar perbandingan. Tetapi jika Anda mengarahkan agen ke repositori privat, itulah perbedaan antara percakapan yang tidak perlu Anda lakukan dengan tim legal dan percakapan yang harus Anda lakukan — dan itu sama sekali tidak ada hubungannya dengan model mana yang mendapat skor lebih baik pada SciCode.

Apa yang dapat dan tidak dapat diberikan oleh "measured" kepada Anda
Angka-angka Grok 4.6 lebih baik daripada LongCat-2.5-Preview dalam satu-satunya arti yang penting di sini: angka-angka itu ada. Itu tidak sama dengan mengatakan Grok 4.6 adalah model yang lebih baik. Coding Index-nya sebesar 76,8 berada di bawah generasi Grok 4.7, dan model yang menjadi pembandingnya bukan lagi yang terdepan di keluarganya sendiri. Penerusnya yang telah dipublikasikan memiliki Intelligence Index 46,4 versus 44,3 milik Grok 4.6, dan Long-Context Recall 76,67 versus 80,33 milik Grok 4.6 — jadi penerusnya tidak lebih baik di semua sumbu, yang justru merupakan jenis detail yang disembunyikan oleh nomor generasi.
Ada juga catatan terkait live-serving yang perlu dinyatakan secara gamblang, karena hal itu berlawanan dengan pembacaan yang menyanjung bagi kedua model. Pada sampel playground tujuh hari milik kami sendiri, Grok 4.6 tidak mencatat throughput terukur dan tidak ada lalu lintas token, yang merupakan bentuk ketiadaan data di kolom itu, bukan penilaian atas performa. LongCat-2.5-Preview sama sekali tidak memiliki sampel live-serving dari kami, karena kami tidak merutekannya. Jadi, perbandingan latensi apa pun antara keduanya bersifat sepihak dengan cara yang biasanya ditutupi oleh kata-kata: Anda tidak dapat melakukan benchmark pada model yang tidak Anda kirimi lalu lintas.
Di mana lapisan routing sebenarnya membantu di sini
Tiga dari fakta di atas adalah jenis fakta yang memang dirancang untuk ditangani router, bukan sekadar fakta yang kompatibel dengannya. Kartu tarif Grok 4.6 naik di atas 200.000 token input, sehingga tugas logis yang sama dapat ditagih dengan dua tarif berbeda bergantung pada angka yang sudah diketahui aplikasi Anda sebelum mengirim apa pun. Grok 4.6 memiliki penerus yang telah dipublikasikan dengan tarif identik, yang berarti peralihan dari satu ke yang lain seharusnya cukup dengan perubahan satu baris dan tidak pernah berupa integrasi ulang. Dan properti paling menarik dari LongCat-2.5-Preview — harganya — secara eksplisit ditandai sebagai sementara oleh vendor.
Di OrcaRouter kami menyediakan Grok 4.6 dengan harga daftar xAI dan tanpa markup, sehingga perubahan tarif vendor sampai ke tagihan Anda pada hari yang sama, bukan pada pembaruan berikutnya, dan failover otomatis memindahkan permintaan yang menurun ke penyedia yang sehat tanpa kode Anda perlu tahu siapa yang menjawabnya. DSL perutean menangani kasus penetapan harga berjenjang secara langsung, dan penggabungan model menangani kasus ketika model yang Anda inginkan untuk bacaan panjang bukan model yang Anda inginkan untuk sintesis akhir. LongCat-2.5-Preview bukan salah satu rute kami — kami tidak menyediakannya, dan tidak ada apa pun di sini yang mengklaim sebaliknya. Intinya menyebutkannya bukan untuk mengarahkan Anda ke tempat lain; melainkan bahwa model yang Anda evaluasi alih-alih jalankan seharusnya berada di balik kunci yang sama dengan model yang Anda jalankan, sehingga mengevaluasinya hanya memerlukan satu entri konfigurasi alih-alih satu proyek.

Cara memutuskan
• Pilih Grok 4.6 jika Anda membutuhkan jawaban yang dapat Anda pertanggungjawabkan. Grok 4.6 memiliki kartu independen, profil input yang terdokumentasi, dan harga yang tidak kedaluwarsa. Risiko utamanya bukan kualitas, melainkan relevansi: Grok 4.7 tersedia dengan tarif yang sama, dan biaya tetap bertahan di 4.6 karena inersia adalah selisih antara Intelligence Index 44,3 dan 46,4 yang seharusnya tidak perlu Anda bayar.
• Pilih LongCat-2.5-Preview jika faktor penentunya adalah retensi atau jangkauan. Akses tanpa retensi melalui OpenCode, jendela satu juta token, batas keluaran 131.072 token, dan tarif sekitar sepertujuh dari Grok 4.6 merupakan keunggulan nyata — yang pertama diverifikasi oleh kebijakan privasi pihak ketiga, sisanya hanya diklaim oleh vendor sendiri.
• Jangan memilih di antara keduanya berdasarkan tabel benchmark, karena hanya satu yang ada. Skor coding Grok 4.6 sebesar 76,8 dan daya ingat konteks panjang 80,3 menggambarkan Grok 4.6. Belum ada yang menggambarkan LongCat-2.5-Preview. Siapa pun yang mencetak skor LongCat-2.5-Preview di samping skor Grok 4.6 minggu ini entah mengutip model LongCat yang berbeda atau mengarang angka itu.
• Verifikasi sisi input sebelum Anda membangun di atasnya. Changelog Meituan mengedepankan pemahaman gambar, tetapi contoh respons dalam dokumentasi "Retrieve Model" miliknya sendiri masih menunjukkan input_modalities sebagai ["text"] dengan string modalitas text->text — klaim vendor yang bertentangan dengan kontrak terbitan yang menyatakan sebaliknya. Grok 4.6 menerima teks, gambar, dan file tanpa ambiguitas seperti itu. Dan periksa apakah harness Anda menampilkan bidang reasoning_content yang disisipkan sebelum Anda menyimpulkan apa pun tentang kualitas penalaran LongCat-2.5-Preview; klien yang menghilangkan bidang itu akan gagal secara diam-diam.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
