
LongCat-2.5-Preview vs Qwen3.8-Max: Sepertujuh Harga dan Nol di Papan Skor
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 610 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 189 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Meituan menempatkan LongCat-2.5-Preview di platform API-nya pada 25 September 2026 dengan entri changelog, daftar tarif, dan tanpa tolok ukur apa pun — lalu menetapkan harganya sekitar sepertujuh dari yang dikenakan Qwen3.8-Max untuk panggilan yang sama. Itu bukan selisih yang kecil, dan bukan pula selisih yang aman. Qwen3.8-Max, model unggulan vendor tersebut, telah tersedia secara umum sejak 3 Agustus 2026, memiliki peringkat Artificial Analysis yang independen, menerbitkan snapshot bertanggal yang dapat Anda sematkan berdasarkan nama, dan menagih 6,7× lebih mahal untuk input serta 5× lebih mahal untuk output. Pertanyaan yang harus dijawab oleh perbandingan ini bukanlah model mana yang lebih baik — belum ada pihak di luar Meituan yang berada dalam posisi untuk menjawabnya. Pertanyaannya adalah apa yang Anda beli dengan selisih itu, dan apakah selisih itu layak dibeli.
Apa yang sebenarnya telah diterbitkan oleh masing-masing pihak
Mulailah dengan provenans, karena itulah hal yang membedakan keduanya lebih tajam daripada tolok ukur mana pun.
LongCat-2.5-Preview hadir dengan entri bertanggal di changelog milik Meituan sendiri — kata-kata vendor: "Versi: 2026-09-25 — LongCat-2.5-Preview Kini Tersedia" — halaman harga yang mencantumkannya sebagai model pay-as-you-go platform saat ini, dan panduan memulai cepat yang mencakup kedua format wire. Akun Meituan sendiri di X mendeskripsikannya sebagai "1,6T parameter. ~48B aktif. Jendela konteks 1M token. Multimodal secara native." Selain itu, tidak ada yang bisa dibaca. Tidak ada repositori di meituan-longcat, organisasi Hugging Face, yang mencakup model ini — repositori terbaru organisasi ini adalah LongCat-Flash-Lite-Sparse, dari 31 Juli — dan katalog model OpenCode, yang menyediakannya, mencatatnya sebagai closed-weight. Tidak ada kartu model, tidak ada laporan teknis, tidak ada lisensi, tidak ada tabel parameter yang diterbitkan vendor, dan tidak ada evaluasi independen di mana pun: per 27 September tidak ada halaman LongCat-2.5-Preview di Artificial Analysis.
Qwen3.8-Max adalah kasus yang berlawanan dalam hampir segala hal. Model ini tersedia secara umum pada 3 Agustus 2026 dengan kartu tarif yang dipublikasikan, dan Alibaba merilis penyegaran bernama, Qwen3.8-Max-0902, pada 2 September. Artificial Analysis mengukurnya: Intelligence Index 45,4, peringkat ke-15 dari 145 model, dan Coding Index 76,2, peringkat ke-9 dari 138. Model ini mencatat GPQA Diamond 92,8%, Humanity's Last Exam 43,1%, SciCode 52,1%, Long-Context Recall 80,3%, Terminal-Bench 2.1 pada 88,8%, dan τ-bench banking pada 47,8%. Itu adalah model yang terukur dengan bukti untuk setiap angkanya.
Jadi, ringkasan jujur dari kolom bukti itu berat sebelah dengan cara yang sama sekali tidak ada kaitannya dengan kemampuan. Salah satu dari model ini dapat dievaluasi sebelum Anda berkomitmen. Model lainnya hanya bisa dicoba.
Kartu tarif, baris demi baris
Keduanya adalah model satu juta token dengan plafon output yang sama, jadi lembar spesifikasinya bertemu persis di titik ketika lembar spesifikasi justru paling tidak berguna:
• Input tanpa cache — LongCat-2.5-Preview $0,30 per 1 juta vs Qwen3.8-Max $2,00 per 1 juta, selisih 6,7×.
• Input yang di-cache — $0,006 per 1 juta vs $0,25 per 1 juta, selisih 41,7×.
• Output — $1,20 per 1 juta vs $6,00 per 1 juta, selisih 5×.
• Jendela konteks — 1.048.576 token vs 1.000.000 token. Secara fungsional, keduanya seri.
• Output maksimum — 131.072 token pada keduanya. Identik.
• Skor independen — tidak ada yang dipublikasikan vs AA Intelligence 45,4 dan AA Coding 76,2.
Setiap angka LongCat di sana berasal dari halaman harga Meituan sendiri, dan halaman tersebut memberi label pada seluruh kolom "Discounted Price (limited-time)". Angka Qwen3.8-Max adalah tarif daftar Alibaba, dibaca dari kartu model kami sendiri, dengan cache read sebesar $0,25 dan cache write sebesar $2,50 per juta. Snapshot Artificial Analysis bertanggal 2 September 2026.
Baris input yang di-cache adalah yang harus dicermati. Perbedaan 42× pada pembacaan cache adalah angka tunggal terbesar dalam perbandingan ini, dan itu berada pada dimensi yang benar-benar menjadi tempat beban kerja agen beroperasi. Loop agen yang mengirim ulang prompt sistem dan skema tool sebesar 100.000 token pada setiap giliran membayar tarif cache untuk sebagian besar tokennya, bukan tarif input utama.
Panggilan 150.000 token, diberi harga untuk kedua arah
Ambil permintaan yang plausibel berbentuk agen: 150.000 token masukan, 50.000 di antaranya dilayani dari cache, dan jawaban 4.000 token. Pada tarif diskon Meituan, panggilan itu biayanya $0,0501. Pada tarif resmi Qwen3.8-Max, panggilan yang identik biayanya $0,3365 — 6,7× lebih mahal, atau $50 versus $337 untuk seribu panggilan sehari. Dorong komposisinya sepenuhnya di-cache, yang merupakan kondisi tunak untuk prompt yang berulang, dan rasionya melebar menjadi 12,3×: $0,006 versus $0,074 per panggilan.
Tidak ada apa pun dalam aritmetika itu yang bergantung pada LongCat-2.5-Preview menjadi bagus. Itulah tepatnya masalahnya. Pengganda yang ditawarkan kepada Anda itu nyata, dan kata yang dilekatkan padanya di halaman vendor sendiri adalah "limited-time", tanpa tanggal berakhir dan tanpa harga pengganti yang dinyatakan. Diskon 6,7× tanpa masa kedaluwarsa yang dipublikasikan adalah pos anggaran yang tidak dapat Anda masukkan ke dalam rencana; itu adalah pos anggaran yang Anda pantau.
Ada juga asimetri perutean yang perlu dinyatakan secara gamblang. Qwen3.8-Max adalah rute yang kami layani — qwen/qwen3.8-max dan yang dipin qwen/qwen3.8-max-0902 — pada harga daftar Alibaba tanpa markup, sehingga perubahan harga vendor berdampak ke sisi kami pada hari yang sama, bukan beberapa minggu kemudian. LongCat-2.5-Preview bukan salah satu rute kami, dan kami tidak akan berpura-pura sebaliknya; pada sisi murah dari perbandingan ini, Anda berurusan dengan API Meituan sendiri dan platform apa pun yang Anda gunakan untuk mengaksesnya.
Satu klaim yang dibantah oleh API Meituan sendiri
Inilah temuan yang seharusnya menentukan pertandingan bagi siapa pun yang beban kerjanya bukan teks murni.
Catatan perubahan Meituan mencantumkan pemahaman gambar sebagai tambahan utama pada generasi 2.5: "Pemahaman Multimodal: Kemampuan pemahaman gambar baru, mampu mengurai konten gambar, mendukung tanya jawab lintas modal, peringkasan konten, dan penalaran visual yang kompleks." Postingan X mengatakan "multimodal secara native." Itu semua adalah klaim vendor, dan jika berdiri sendiri, semuanya wajar untuk dijadikan pertimbangan dalam keputusan.
Kemudian situs dokumentasi yang sama menerbitkan contoh respons untuk mengambil metadata model itu sendiri, dan model yang dikembalikannya hanya teks. Untuk id "LongCat-2.5-Preview", payload menunjukkan context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], dan string modalitas text->text. Tidak ada entri gambar. Bukan di snapshot lama — melainkan di contoh yang diuraikan pada halaman yang mendokumentasikan endpoint tersebut.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
Itu tidak membuktikan bahwa model tidak dapat melihat. Itu membuktikan bahwa vendor belum menyelaraskan prosanya dengan skema API-nya sendiri, dan itu berarti pembeli tidak dapat menagih beban kerja visi berdasarkan kalimat changelog itu sampai ada yang menyelesaikannya. Bandingkan dengan sisi lain: katalog kami mencantumkan Qwen3.8-Max menerima input teks, gambar, dan video, dengan visi termasuk di antara kemampuan yang dideklarasikannya, dan ada tabel benchmark independen di balik model itu. Jika tugas Anda adalah pemahaman dokumen, triase tangkapan layar, atau analisis bingkai video, kolom yang mahal adalah kolom dengan modalitas input yang terverifikasi dan kolom yang murah adalah kolom dengan modalitas yang belum terselesaikan. Satu baris itu saja dapat menghapus seluruh 6,7×.
Ke apa Pratinjau tidak dapat disematkan
Alibaba merilis snapshot bertanggal. qwen/qwen3.8-max-0902adalah build beku bernama dengan harga $2/$6 yang sama seperti model dasar, yang berarti aturan perutean yang menyebutnya akan terus mengembalikan bobot yang sama bulan depan. Perubahan perilaku hadir sebagai id baru yang dapat Anda adopsi sesuai jadwal Anda sendiri.
LongCat-2.5-Preview tidak memiliki handle semacam itu. Id modelnya adalah id pratinjau, tidak ada sufiks snapshot, tidak ada riwayat versi di platform, dan tidak ada entri changelog yang memberi tahu Anda bahwa bobotnya berubah — hanya bahwa diskonnya "terbatas waktu". Ini adalah pratinjau dalam arti biasa: hal yang berada di bawah nama itu diperbolehkan berubah, dan Anda akan mengetahuinya dari output Anda alih-alih dari catatan rilis.
Cara termurah untuk membeli bukti yang hilang adalah jendela yang dibuka Meituan di sisi lain dari ini: OpenCode mencantumkan LongCat-2.5-Preview sebagai gratis untuk periode terbatas, dengan penyedia mengikuti kebijakan tanpa retensi dan tidak melatih model menggunakan data Anda, dan pada 26 September dikatakan bahwa jendela tersebut berlangsung selama dua minggu. Input gratis, output gratis, pembacaan cache gratis. Itu adalah cara yang sah untuk membangun tabel benchmark yang belum diterbitkan oleh siapa pun — jalankan korpus evaluasi Anda sendiri terhadapnya, dan Anda mendapatkan angka, sementara vendor hanya memberi Anda sebuah kalimat. Yang tidak dimilikinya adalah harga yang bisa Anda jadikan dasar perencanaan: dua minggu akan berakhir, dan angka di baliknya adalah milik Meituan untuk ditetapkan.
Siapa yang harus memilih yang mana?
Pilihlah Qwen3.8-Max ketika beban kerja itulah alasan Anda membeli model tersebut sejak awal. Jika masukannya berupa gambar atau video, jika jawabannya harus dapat direproduksi dari build ke build, jika indeks independen merupakan persyaratan pengadaan, atau jika tugasnya adalah jenis pengkodean agentik yang dijadikan proksi oleh Terminal-Bench dan Coding Index, 6,7× adalah harga untuk dapat memeriksa pekerjaan Anda. Pada satu kunci, ia juga berada di belakang rantai fallback, sehingga model yang dinilai dapat menyerap hari buruk bagi model yang tidak dinilai tanpa Anda menjalankan dua integrasi.

Pilih LongCat-2.5-Preview ketika beban kerja bervolume tinggi, berkonteks pendek, hanya teks, dan internal — klasifikasi, ekstraksi, peringkasan, penulisan ulang massal — dan ketika biaya jika salah adalah percobaan ulang, bukan pelanggan. Untuk bentuk itu, baris input yang di-cache bukanlah diskon, melainkan keseluruhan ekonomi pekerjaan tersebut, dan 42× adalah angka yang sepadan dengan upaya mengukurnya. Gunakan jendela gratis untuk menghasilkan tolok ukur yang belum ada. Jangan memigrasikan jalur kritis ke sana.
Apa yang akan mengubah putusan ini, berdasarkan urutan bobotnya: evaluasi independen atas LongCat-2.5-Preview; tanggal berakhir yang dipublikasikan dan harga pengganti untuk diskon tersebut; riwayat versi dengan snapshot bertanggal; dan penyelesaian soal apakah daftar modalitas hanya teks atau tidak. Salah satu saja dari hal-hal itu membuat kolom murah lebih dari sekadar diskon. Sampai setidaknya satu terwujud, perbandingan ini bukan pertandingan antara dua model — melainkan pertandingan antara harga yang dapat Anda verifikasi dan kemampuan yang tidak dapat Anda verifikasi.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
