Kartu judul hero yang dihasilkan bertuliskan 'LongCat-2.5-Preview vs GLM-5.2' dengan overline 'Jendela 1M yang sama, hanya satu di antaranya yang diukur', dan dua panel: 'LongCat-2.5-Preview: konteks 1M, $0.30 / $1.20 per 1M, tidak ada benchmark yang dipublikasikan' dan 'GLM-5.2: konteks 1M, AA Long-Context Recall 78.33'. Logo OrcaRouter di kanan bawah.
Guides & Insights

LongCat-2.5-Preview vs GLM-5.2: Dua Jendela Token 1M, Salah Satunya Diukur

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

LongCat-2.5-Preview dan GLM-5.2 membawa angka utama yang sama: jendela konteks satu juta token. Kebetulan tunggal itu melakukan semua pekerjaan dalam sebagian besar perbandingan yang ditulis minggu ini, dan itu tidak cukup untuk membandingkan dua model. GLM-5.2 telah tercatat sejak 16 Juni 2026 dengan profil benchmark publik, kartu tarif yang dipublikasikan, dan skor recall konteks panjang dari evaluator independen. LongCat-2.5-Preview muncul di LongCat API Platform milik Meituan pada 25 September 2026 dengan kartu tarif diskon, jumlah parameter yang dilaporkan oleh liputan perdagangan Tiongkok, dan tidak ada benchmark publik dalam bentuk apa pun. Satu jendela diukur. Yang lain ditegaskan. Semua yang ada di bawah ini memisahkan kedua kategori tersebut, karena lembar spesifikasi dan hasil tes bukanlah jenis fakta yang sama.

Ini adalah versi jujur dari pertarungan ini, dan ini lebih berguna daripada versi yang menyanjung.

Apa yang sebenarnya telah diterbitkan oleh masing-masing pihak

Catatan perubahan Meituan memuat entri bertanggal — "Versi: 2026-09-25, LongCat-2.5-Preview Kini Tersedia" — yang mencantumkan tiga kemampuan yang diklaim: pemahaman gambar, pengkodean, dan kompatibilitas dengan "Claude Code dan lingkungan pengembangan arus utama lainnya", menyebut Hermes, OpenClaw, OpenCode, dan Kilo Code. Halaman harga vendor menyatakan tarif bayar sesuai pemakaian sebesar $0.30 per juta token masukan yang tidak di-cache, $0.006 per juta token masukan yang di-cache, dan $1.20 per juta token keluaran, yang ditandai di halaman itu sendiri sebagai diskon waktu terbatas. Jendela konteksnya adalah satu juta token dan keluaran maksimumnya 131,072. Sekitar 1,6 triliun total parameter dengan sekitar 48 miliar yang aktif per token, pada tulang punggung mixture-of-experts, berasal dari metadata situs Meituan sendiri dan dari liputan perdagangan Tiongkok tentang daftar tersebut — bukan dari dokumentasi API. Tidak ada laporan teknis, tidak ada kartu model, dan tidak ada tabel tolok ukur yang menyertai semua itu. Tidak ada repositori LongCat-2.5-Preview di HuggingFace dan tidak ada repositori dengan nama itu di organisasi GitHub Meituan; metadata katalog model yang disertakan dengan OpenCode mencatat bobot terbuka sebagai false.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

GLM-5.2 milik Z.ai berada di posisi yang berlawanan. Ini adalah rilis Juni dengan daftar tarif yang kami sediakan pada harga daftar: $1,40 per juta token masukan, $0,26 per juta token masukan yang di-cache, dan $4,40 per juta token keluaran di katalog kami, dengan jendela konteks 1.000.000 token dan keluaran maksimum 128.000 token. Skor yang dipublikasikannya berasal dari dua tempat berbeda, dan perbedaan ini penting: angka Z.ai sendiri untuk AIME 2026, HMMT February 2026, GPQA-Diamond, dan suite FrontierSWE dilaporkan oleh vendor; angka Coding Index dan Intelligence Index yang dimuat katalog kami bersumber dari Artificial Analysis, yang menjalankan evaluasinya sendiri.

Satu-satunya dimensi di mana mereka benar-benar setara

Kedua model sama-sama mengklaim konteks tepat 1.000.000 token. Hanya satu di antaranya yang memiliki skor terpublikasi yang menguji apakah sebuah model masih dapat menggunakan apa yang ada di dalamnya. Artificial Analysis mencatat angka Long-Context Recall sebesar 78,33 untuk GLM-5.2. LongCat-2.5-Preview tidak memiliki angka yang setara, dari siapa pun. Asimetri itulah keseluruhan pertarungannya dalam satu baris: jendela satu juta token adalah pernyataan tentang kapasitas arsitektur, bukan tentang apakah model mengambil informasi dengan benar pada token 900.000. Kapasitas itu murah untuk dicetak dan mahal untuk diverifikasi, itulah sebabnya setiap vendor mencetaknya dan hampir tidak ada dari mereka yang mempublikasikan tes recall tersebut.

Jadi, jika pekerjaan konteks panjang adalah alasan Anda memilih di antara keduanya, Anda sedang memilih antara satu opsi dengan skor recall yang dipublikasikan dan satu opsi tanpa itu — dan opsi tanpa itu juga merupakan opsi dengan profil benchmark yang belum diukur. Itu bukan argumen yang menentangnya. Itu adalah argumen yang menentang memperlakukan keduanya sebagai dapat dipertukarkan hanya berdasarkan bilangan bulat yang sama.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

Seperti apa selisih harga pada pekerjaan nyata

Kartu tarifnya tidak berdekatan, dan arahnya bukan yang orang harapkan dari penantang open-weights Tiongkok terhadap laboratorium terdepan Barat. LongCat-2.5-Preview kira-kira 4,7 kali lebih murah untuk input tanpa cache dan 3,7 kali lebih murah untuk output dibandingkan GLM-5.2 — rasio yang merupakan aritmetika pada dua kartu yang diterbitkan, bukan pengukuran. Pada proses pemrosesan dokumen 500.000 token yang menulis kembali 20.000 token, itu sekitar 17 sen versus sekitar 79 sen. Kedua model harus membaca dokumen yang sama. Hanya satu dari mereka yang memiliki skor terbitan untuk apakah ia akan tetap memperhatikan di akhir dokumen itu.

Ada peringatan kedua yang pantas disebut dalam napas yang sama: Meituan menyebut daftar tarifnya sendiri sebagai diskon waktu terbatas. Angka $0.30 adalah angka promosi, dan vendor tidak menyebutkan apa yang menyusul setelahnya. Model biaya yang dibangun di atas harga promosi memiliki tanggal kedaluwarsa yang tidak dapat Anda baca. Itu adalah alasan untuk menjaga migrasi antarpenyedia tetap murah, bukan alasan untuk menghindari model tersebut.

Di OrcaRouter, rute yang kami layani berada di balik satu kuncidengan harga daftar penyedia tanpa markup, sehingga perubahan harga vendor sampai ke tagihan Anda pada hari yang sama, bukan pada perpanjangan berikutnya, dan failover otomatis memindahkan permintaan yang menurun ke penyedia yang sehat tanpa aplikasi Anda menyadarinya. GLM-5.2 adalah salah satu rute kami. LongCat-2.5-Preview bukan — kami tidak melayaninya, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim sebaliknya. Z.ai juga telah bergerak maju sejak Juni: GLM-5.3 sudah aktif di katalog kami per 18 Agustus 2026, jadi perbandingan yang dibingkai sebagai "model baru versus model saat ini" sudah membingkai GLM-5.2 sebagai pemain yang bertahan, bukan sebagai yang terdepan.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Apa yang akan menyelesaikan ini, dan apa yang tidak.

• Skor Long-Context Recall untuk LongCat-2.5-Preview, dari Meituan atau dari evaluator independen. Sampai itu ada, jendela 1M-nya hanyalah klaim tanpa pengujian yang menyertainya, dan 78,33 milik GLM-5.2 adalah satu-satunya angka dalam perbandingan yang berbicara tentang pertanyaan yang sama.

• Kartu tarif vendor tanpa penanda waktu terbatas. Harga diskon memberi tahu Anda berapa biaya model selama promosi, bukan berapa biaya sesungguhnya.

• Tabel benchmark dalam bentuk apa pun. Bukan posisi papan peringkat — hanya uji evaluasi yang dipublikasikan, sehingga perbandingan tidak lagi sekadar lembar spesifikasi versus halaman hasil.

• Konfirmasi input gambar. Changelog menyajikan pemahaman gambar sebagai tambahan utama, tetapi contoh respons dalam dokumentasi "Retrieve Model" milik Meituan sendiri masih menunjukkan input_modalities sebagai ["text"] dengan string modalitas text->text. Contoh itu mungkin hanya sudah usang. Meskipun demikian, itu adalah kontrak yang diterbitkan vendor, jadi perlakukan input gambar sebagai yang diklaim, bukan yang tersedia. GLM-5.2, sebaliknya, adalah input teks dan output teks di katalog kami tanpa modalitas gambar sama sekali — jadi pada dimensi ini tidak ada model yang memberi Anda jawaban terverifikasi, dan salah satunya memberi Anda klaim.

• Angka Anda sendiri. Kesenjangan antara apa yang dipublikasikan dan apa yang Anda butuhkan ditutup dengan menjalankan kedua model pada tugas Anda, dan jendela gratis pada LongCat-2.5-Preview membuatnya murah saat ini. Jejak penalaran yang tiba dalam bidang reasoning_content yang disisipkan adalah detail harness yang harus diperiksa terlebih dahulu, karena perkakas yang diam-diam membuangnya akan kehilangan sebagian besar kegunaan model tanpa memunculkan error.

Bagaimana posisi perbandingan setelah ini

Jika Anda membutuhkan keputusan hari ini dan keputusan itu melibatkan konteks panjang, GLM-5.2 adalah pilihan yang benar-benar dapat Anda evaluasi: model ini memiliki recall yang dipublikasikan, skor pemrograman independen 68,8 dan Intelligence Index 33,7 dari Artificial Analysis, serta harga yang dapat Anda anggarkan. Angka-angka itu menggambarkan model yang kompeten, bukan yang terdepan — penerus dari Z.ai sendiri, GLM-5.3, mengunggulinya dalam skor — tetapi angka-angka itu menggambarkan sesuatu. LongCat-2.5-Preview adalah proposisi yang lebih murah, berkonteks lebih besar, dan sama sekali belum terukur, yang kualitas paling menariknya, yakni harganya, secara eksplisit bersifat sementara. Sikap yang benar terhadapnya bukanlah skeptisisme. Sikap yang benar adalah evaluasi dua minggu dengan harness penilaian Anda sendiri yang disertakan, yang dijalankan sebelum tarif promosi itu hilang.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari