Kartu judul hero yang dihasilkan bertuliskan 'LongCat-2.5-Preview vs Grok 4.6' dengan overline 'Yang satu punya kartu benchmark, yang lain punya penerus', serta dua panel: 'LongCat-2.5-Preview: konteks 1M, tanpa retensi melalui OpenCode' dan 'Grok 4.6: AA Coding 76.8, Grok 4.7 sudah dirilis'. Logo OrcaRouter di kanan bawah.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6: Satu Punya Kartu Benchmark, Satu Punya Penerus

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Membandingkan LongCat-2.5-Preview dengan Grok 4.6terasa canggung karena alasan yang tidak ada kaitannya dengan kualitas model mana pun: pertanyaan ini punya masa berlaku. Grok 4.6 dirilis pada 12 Agustus 2026 dan Grok 4.7 dirilis pada 21 September 2026 — enam hari sebelum tulisan ini dibuat — dengan tarif yang sama, $2,00 / $6,00 per juta token, dan jendela konteks 500.000 token yang sama. Sementara itu, LongCat-2.5-Preview hadir di Platform API LongCat milik Meituan pada 25 September 2026 tanpa penerus yang diumumkan sama sekali dan tanpa tolok ukur yang dipublikasikan. Jadi, pilihan sebenarnya bukanlah "model mana yang lebih baik". Pilihan sebenarnya adalah apakah Anda menginginkan kemampuan yang sudah terukur dengan penerus yang sudah terukur pula yang sudah berdiri di belakangnya, atau kemampuan yang belum terukur yang setidaknya merupakan hal terkini.

Kerangka berpikir itu kurang menarik daripada papan skor dan jauh lebih berguna.

Mulailah dengan apa yang sebenarnya sudah ada dalam catatan Grok 4.6

Grok 4.6 adalah model yang terdokumentasi dengan baik. Di katalog kami, model ini memiliki jendela konteks 500.000 token, input teks, gambar, dan file, serta daftar tarif $2,00 per juta token input, $6,00 per juta token output, dan $0,50 per juta token input yang di-cache, meningkat menjadi $4,00 dan $12,00 di atas 200.000 token input. Profil independennya dari Artificial Analysis mencakup Coding Index 76,8 — kelima di antara model yang dilacak indeks tersebut — Intelligence Index 44,3 di peringkat kedelapan belas, GPQA Diamond 94,9%, Humanity's Last Exam 42,9%, SciCode 56,5%, Terminal-Bench v2.1 88,4, dan τ²-Bench untuk perbankan 50,7. Long-Context Recall-nya 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview tidak memiliki semua itu. Entri changelog Meituan untuk 25 September 2026 adalah pemberitahuan ketersediaan bertanggal yang mencantumkan tiga kemampuan yang diklaim — pemahaman gambar, pengodean, dan kompatibilitas dengan "Claude Code dan lingkungan pengembangan arus utama lainnya" termasuk Hermes, OpenClaw, OpenCode, dan Kilo Code — dan tidak ada yang menyerupai hasil. Halaman harga vendor tersebut mencantumkan $0,30 per juta input yang tidak di-cache, $0,006 per juta input yang di-cache, dan $1,20 per juta output, yang secara eksplisit ditandai sebagai diskon waktu terbatas. Jendela konteksnya adalah 1.000.000 token; output maksimumnya adalah 131.072. Jumlah parameter sekitar 1,6 triliun total / 48 miliar aktif berasal dari metadata situs Meituan dan liputan perdagangan China, bukan dari dokumentasi. Tidak ada repositori untuknya di HuggingFace atau di organisasi GitHub Meituan, dan metadata katalog yang disertakan OpenCode mencatat bobot terbuka sebagai false.

Dimensi yang akan sepenuhnya luput dari papan skor

Kedua model ini berbeda pada sesuatu yang tidak diukur oleh tolok ukur mana pun, dan bagi banyak tim, hal itu sendiri sudah menentukan jawabannya: apa yang terjadi pada prompt yang Anda kirim.

Dokumentasi OpenCode sendiri menyatakan bahwa LongCat 2.5 Preview Free dilayani oleh penyedia yang menganut kebijakan tanpa retensi dan tidak menggunakan data Anda untuk pelatihan; tabel privasi Zen memberikan angkanya — pelatihan model "Tidak digunakan", retensi data "0 hari". Tabel privasi yang sama mencantumkan retensi tiga puluh hari untuk Grok 4.6 dan Grok 4.7. Kedua pernyataan itu berasal dari OpenCode, diterbitkan di halaman-halaman OpenCode, dan secara khusus menjelaskan daftar gratis serta daftar perbandingan. Tetapi jika Anda mengarahkan agen ke repositori privat, itulah perbedaan antara percakapan yang tidak perlu Anda lakukan dengan tim legal dan percakapan yang harus Anda lakukan — dan itu sama sekali tidak ada hubungannya dengan model mana yang mendapat skor lebih baik pada SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Apa yang dapat dan tidak dapat diberikan oleh "measured" kepada Anda

Angka-angka Grok 4.6 lebih baik daripada LongCat-2.5-Preview dalam satu-satunya arti yang penting di sini: angka-angka itu ada. Itu tidak sama dengan mengatakan Grok 4.6 adalah model yang lebih baik. Coding Index-nya sebesar 76,8 berada di bawah generasi Grok 4.7, dan model yang menjadi pembandingnya bukan lagi yang terdepan di keluarganya sendiri. Penerusnya yang telah dipublikasikan memiliki Intelligence Index 46,4 versus 44,3 milik Grok 4.6, dan Long-Context Recall 76,67 versus 80,33 milik Grok 4.6 — jadi penerusnya tidak lebih baik di semua sumbu, yang justru merupakan jenis detail yang disembunyikan oleh nomor generasi.

Ada juga catatan terkait live-serving yang perlu dinyatakan secara gamblang, karena hal itu berlawanan dengan pembacaan yang menyanjung bagi kedua model. Pada sampel playground tujuh hari milik kami sendiri, Grok 4.6 tidak mencatat throughput terukur dan tidak ada lalu lintas token, yang merupakan bentuk ketiadaan data di kolom itu, bukan penilaian atas performa. LongCat-2.5-Preview sama sekali tidak memiliki sampel live-serving dari kami, karena kami tidak merutekannya. Jadi, perbandingan latensi apa pun antara keduanya bersifat sepihak dengan cara yang biasanya ditutupi oleh kata-kata: Anda tidak dapat melakukan benchmark pada model yang tidak Anda kirimi lalu lintas.

Di mana lapisan routing sebenarnya membantu di sini

Tiga dari fakta di atas adalah jenis fakta yang memang dirancang untuk ditangani router, bukan sekadar fakta yang kompatibel dengannya. Kartu tarif Grok 4.6 naik di atas 200.000 token input, sehingga tugas logis yang sama dapat ditagih dengan dua tarif berbeda bergantung pada angka yang sudah diketahui aplikasi Anda sebelum mengirim apa pun. Grok 4.6 memiliki penerus yang telah dipublikasikan dengan tarif identik, yang berarti peralihan dari satu ke yang lain seharusnya cukup dengan perubahan satu baris dan tidak pernah berupa integrasi ulang. Dan properti paling menarik dari LongCat-2.5-Preview — harganya — secara eksplisit ditandai sebagai sementara oleh vendor.

Di OrcaRouter kami menyediakan Grok 4.6 dengan harga daftar xAI dan tanpa markup, sehingga perubahan tarif vendor sampai ke tagihan Anda pada hari yang sama, bukan pada pembaruan berikutnya, dan failover otomatis memindahkan permintaan yang menurun ke penyedia yang sehat tanpa kode Anda perlu tahu siapa yang menjawabnya. DSL perutean menangani kasus penetapan harga berjenjang secara langsung, dan penggabungan model menangani kasus ketika model yang Anda inginkan untuk bacaan panjang bukan model yang Anda inginkan untuk sintesis akhir. LongCat-2.5-Preview bukan salah satu rute kami — kami tidak menyediakannya, dan tidak ada apa pun di sini yang mengklaim sebaliknya. Intinya menyebutkannya bukan untuk mengarahkan Anda ke tempat lain; melainkan bahwa model yang Anda evaluasi alih-alih jalankan seharusnya berada di balik kunci yang sama dengan model yang Anda jalankan, sehingga mengevaluasinya hanya memerlukan satu entri konfigurasi alih-alih satu proyek.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Cara memutuskan

• Pilih Grok 4.6 jika Anda membutuhkan jawaban yang dapat Anda pertanggungjawabkan. Grok 4.6 memiliki kartu independen, profil input yang terdokumentasi, dan harga yang tidak kedaluwarsa. Risiko utamanya bukan kualitas, melainkan relevansi: Grok 4.7 tersedia dengan tarif yang sama, dan biaya tetap bertahan di 4.6 karena inersia adalah selisih antara Intelligence Index 44,3 dan 46,4 yang seharusnya tidak perlu Anda bayar.

• Pilih LongCat-2.5-Preview jika faktor penentunya adalah retensi atau jangkauan. Akses tanpa retensi melalui OpenCode, jendela satu juta token, batas keluaran 131.072 token, dan tarif sekitar sepertujuh dari Grok 4.6 merupakan keunggulan nyata — yang pertama diverifikasi oleh kebijakan privasi pihak ketiga, sisanya hanya diklaim oleh vendor sendiri.

• Jangan memilih di antara keduanya berdasarkan tabel benchmark, karena hanya satu yang ada. Skor coding Grok 4.6 sebesar 76,8 dan daya ingat konteks panjang 80,3 menggambarkan Grok 4.6. Belum ada yang menggambarkan LongCat-2.5-Preview. Siapa pun yang mencetak skor LongCat-2.5-Preview di samping skor Grok 4.6 minggu ini entah mengutip model LongCat yang berbeda atau mengarang angka itu.

• Verifikasi sisi input sebelum Anda membangun di atasnya. Changelog Meituan mengedepankan pemahaman gambar, tetapi contoh respons dalam dokumentasi "Retrieve Model" miliknya sendiri masih menunjukkan input_modalities sebagai ["text"] dengan string modalitas text->text — klaim vendor yang bertentangan dengan kontrak terbitan yang menyatakan sebaliknya. Grok 4.6 menerima teks, gambar, dan file tanpa ambiguitas seperti itu. Dan periksa apakah harness Anda menampilkan bidang reasoning_content yang disisipkan sebelum Anda menyimpulkan apa pun tentang kualitas penalaran LongCat-2.5-Preview; klien yang menghilangkan bidang itu akan gagal secara diam-diam.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari