
LongCat-2.5-Preview vs Kimi K3: Pertanyaan Recall Konteks Panjang yang Belum Bisa Dijawab oleh Siapa Pun
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 610 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 189 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Kimi K3 memperoleh skor 88,67 pada Long-Context Recall. Itu adalah angka tertinggi dari model mana pun di katalog kami untuk pertanyaan spesifik apakah suatu model masih menggunakan informasi yang terkubur jauh di dalam input yang panjang. LongCat-2.5-Preview sama sekali tidak memiliki skor Long-Context Recall — dari Artificial Analysis, dari Meituan, dari siapa pun. Dan LongCat-2.5-Preview adalah model yang mengiklankan jendela satu juta token sebagai fitur utamanya. Ketidaksesuaian itu, sebuah model yang klaim utamanya adalah konteks panjang dan yang tidak memiliki pengukuran konteks panjang, adalah seluruh inti perbandingan ini. Segala hal lainnya sekunder.
Ada baiknya kita tepat mengenai apa yang angka yang hilang itu berarti dan tidak berarti, karena mudah untuk bergeser dari "tidak terukur" ke "mungkin buruk", dan tidak ada arah pun yang didukung.
Apa yang masing-masing dari kedua model nyatakan secara resmi
Kimi K3 dari MoonshotAI dirilis pada 15 Juli 2026. Katalog kami memuatnya dengan jendela konteks 1.048.576 token, masukan teks dan gambar, serta daftar harga $3,00 per juta token masukan, $0,30 per juta masukan cache, dan $15,00 per juta keluaran. Profil independennya dari Artificial Analysis mencatat: Coding Index 76,2, peringkat kesembilan; Intelligence Index 43,6, peringkat kesembilan belas; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench perbankan 46,0. Dan Long-Context Recall 88,67, yang terbaik yang kami miliki.

LongCat-2.5-Preview milik Meituan muncul di LongCat API Platform pada 25 September 2026. Entri changelog-nya menyebutkan tiga kemampuan yang diklaim — pemahaman gambar, coding, dan kompatibilitas dengan "Claude Code dan lingkungan pengembangan arus utama lainnya", yang mencantumkan Hermes, OpenClaw, OpenCode, dan Kilo Code. Halaman harga memberikan $0,30 per juta input yang tidak di-cache, $0,006 per juta input yang di-cache, dan $1,20 per juta output, yang ditandai sebagai diskon waktu terbatas. Jendela konteks 1.000.000; output maksimum 131.072. Angka parameter total ~1,6T / ~48B aktif berasal dari metadata situs Meituan dan liputan perdagangan Tiongkok, bukan dari dokumentasi. Tidak ada tabel benchmark, tidak ada kartu model, tidak ada laporan teknis, tidak ada repositori di HuggingFace atau di organisasi GitHub Meituan, dan metadata katalog yang mencatat bobot terbuka sebagai false.
Mengapa angka yang hilang lebih penting di sini daripada di pertandingan mana pun lainnya
Recall Konteks Panjang bukanlah satu skor di antara banyak skor bagi kedua model ini. Skor inilah yang menguji hal yang keduanya jual. Jendela satu juta token adalah pernyataan tentang kapasitas arsitektur; recall mengukur apakah model masih dapat mengambil dan menggunakan fakta yang ditempatkan pada token 900.000, bukan token 900. Vendor menerbitkan yang pertama karena itu adalah spesifikasi. Evaluator independen menerbitkan yang kedua karena itu adalah ujian, dan sebagian besar model tidak tampil sebaik yang disiratkan oleh ukuran jendela mereka dalam ujian itu.
Jadi, posisi yang jujur lebih sempit daripada yang terdengar. Skor 88,67 Kimi K3 tidak berarti Kimi K3 adalah model konteks panjang yang lebih baik daripada LongCat-2.5-Preview. Ini berarti Kimi K3 adalah model yang pertanyaannya telah diajukan dan dijawab. LongCat-2.5-Preview bisa jadi lebih baik. Bisa jadi jauh lebih buruk. Intinya, saat ini tidak ada orang di luar Meituan yang tahu, dan jendela 1M yang tercetak di halaman harga bukanlah bukti ke arah mana pun.

Gambaran biaya, dengan peringatan aritmetika yang sama
Berdasarkan tarif yang dipublikasikan, LongCat-2.5-Preview 10 kali lebih murah untuk input yang tidak di-cache dan 12,5 kali lebih murah untuk output dibandingkan Kimi K3. Pembacaan 500.000 token yang menuliskan kembali 20.000 token berkisar sekitar $1,80 pada Kimi K3 dan sekitar 17 sen pada LongCat-2.5-Preview. Keduanya merupakan perhitungan dari harga daftar alih-alih pengukuran, dan angka LongCat memiliki catatan tambahan yang tidak dimiliki angka Kimi: Meituan menyebut tarifnya sendiri sebagai diskon untuk waktu terbatas, sehingga angka yang bertahan setelah promosi tidak diketahui.
Bandingkan itu dengan pertanyaan cakupan. Jika Anda memproses input 500.000 token dan recall model Anda pada kedalaman itu tidak terukur, selisih biayanya bukanlah penghematan — itu adalah harga dari tingkat kegagalan yang tidak diketahui. Permintaan senilai 17 sen yang secara diam-diam melewatkan bagian relevan lebih mahal daripada permintaan senilai $1,80 yang menemukannya, karena Anda tetap membayar untuk proses ulang dan debugging, apa pun yang terjadi. Inilah bentuk spesifik dari risiko tersebut, dan inilah sebabnya tolok ukur yang hilang merupakan masalah biaya dan bukan sekadar masalah pemasaran.
Apa yang harus dilakukan saat nomor tersebut tidak ada
Buat milik Anda sendiri. Ini adalah kasus langka di mana periode gratis benar-benar cocok untuk celah tersebut: LongCat-2.5-Preview tidak memerlukan biaya untuk dipanggil melalui OpenCode selama periode yang tidak disebutkan panjangnya, dengan kebijakan tanpa retensi yang didokumentasikan OpenCode — pelatihan model "Tidak digunakan", retensi data "0 hari" — yang berarti Anda dapat mengarahkannya ke repositori privat tanpa percakapan pemrosesan data terlebih dahulu. Buat pengujian jarum dalam tumpukan jerami pada kedalaman yang benar-benar Anda gunakan, jalankan pada kedua model, dan Anda akan mendapatkan angka yang belum diterbitkan oleh kedua vendor. Dua hal yang perlu diperiksa sebelum Anda mempercayai hasilnya: bahwa harness Anda menampilkan bidang reasoning_content yang berselang-seling yang dikembalikan model, dan bahwa input gambar benar-benar berfungsi, karena catatan perubahan Meituan mengklaimnya sementara contoh "Retrieve Model" miliknya sendiri masih menunjukkan input_modalities sebagai ["text"] dengan string text->text.

Peran OrcaRouter dalam hal ini
Kami menyediakan Kimi K3 dengan harga daftar MoonshotAI dengan tanpa markup. LongCat-2.5-Preview bukan salah satu rute kami — kami tidak menyediakannya, dan tidak ada apa pun dalam tulisan ini yang boleh ditafsirkan sebagai klaim bahwa kami menyediakannya.
Untuk perbandingan khusus ini, bagian yang berguna dari sebuah router bukanlah harganya. Melainkan bahwa model yang sedang Anda evaluasi dan model yang Anda andalkan dapat berada di balik kunci yang sama. Recall 88,67 milik Kimi K3 menjadikannya model yang akan Anda gunakan untuk melewatkan pass konteks panjang hari ini; LongCat-2.5-Preview adalah model yang ingin Anda uji terhadapnya, karena jika recall-nya tetap terjaga pada seperdua belas dari harga output, ekonomi pekerjaan dokumen panjang akan berubah. Fusi model adalah mekanismenya yang membuat itu konkret alih-alih teoretis: pass pengambilan konteks panjang dan langkah sintesis akhir dapat berupa dua model berbeda dalam satu permintaan, sehingga model murah yang belum terukur dan model mahal yang sudah terukur tidak harus menjadi pilihan salah satu. Failover otomatis kemudian menangani kasus ketika salah satunya mengalami penurunan, yang lebih penting dari biasanya ketika salah satu dari dua kandidat Anda tidak memiliki riwayat serving yang dapat Anda periksa.
Putusan itu, dinyatakan dengan ketidakpastiannya sendiri yang melekat.
Jika minggu ini Anda membutuhkan pekerjaan konteks panjang yang andal, Kimi K3 adalah pilihan yang dapat dipertahankan: recall 88,67 adalah angka terbaik yang tersedia untuk kemampuan persis yang dimaksud, dan profilnya yang lebih luas — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — solid, bukan spektakuler, semuanya bersumber secara independen. Jika Anda bersedia menghabiskan satu sore untuk membuat evaluasi Anda sendiri, LongCat-2.5-Preview adalah taruhan yang lebih menarik: jendela satu juta token, batas keluaran 131.072 token, akses tanpa retensi, dan daftar tarif yang satu orde besaran lebih rendah daripada milik Kimi K3, semuanya bertumpu pada klaim vendor yang belum diuji secara publik oleh siapa pun.
Yang tidak dapat dibenarkan adalah memperlakukan keduanya sebagai setara karena keduanya mencantumkan satu juta token. Salah satunya memiliki angka yang melekat pada jendela itu, dan yang lainnya memiliki harga. Itu adalah jenis bukti yang berbeda, dan kesenjangan di antara keduanya adalah satu-satunya hal yang sebenarnya menjadi pokok perbandingan ini.
