Qwen 3.8 vs Kimi K3: Dua Raksasa Tiongkok, dan Kini Salah Satunya Lebih Murah
Guides & Insights

Qwen 3.8 vs Kimi K3: Dua Raksasa Tiongkok, dan Kini Salah Satunya Lebih Murah

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ini adalah dua model frontier Tiongkok paling berpengaruh pada tahun 2026, dan keduanya sepupu dekat: keduanya sistem sparse Mixture-of-Experts yang sangat besar, keduanya berkonteks 1M-token, keduanya multimodal, keduanya menjanjikan bobot terbuka. Kimi K3 dari Moonshot sebenarnya adalah yang lebih besar dari keduanya, dengan total parameter 2,8T dibandingkan Qwen yang 2,4T — pengingat yang berguna bahwa jumlah parameter bukanlah peringkat.

Hingga 3 Agustus 2026, perbandingan ini timpang dalam hal tertentu: Kimi K3 memiliki Artificial Analysis Intelligence Index teraudit sebesar 57,1, peringkat #1 LMArena untuk kode frontend, harga yang dipublikasikan, serta bobot yang dirilis, sementara Qwen3.8-Max hanya memiliki klaim 2,4T dan tidak ada yang lain. GA mengubah perhitungan ekonomi secara tegas. Qwen kini mempublikasikan $2 / $6 per juta token dibandingkan dengan $3 / $15 milik Kimi — yang menjadikan model yang lebih besar dan lebih terbukti sebagai yang lebih mahal dengan selisih yang lebar.

Catatan untuk para pengembang — cara tercepat untuk menyelesaikan ini adalah dengan menjalankan keduanya pada prompt Anda sendiri. OrcaRouter menyediakan lebih dari 200 model di balik satu endpoint yang kompatibel dengan OpenAI, sehingga Anda dapat mengadu Qwen 3.8 Max dengan Kimi K3 pada tugas yang sama tanpa harus mengintegrasikan dua SDK.

Kesimpulan singkat. Kimi K3 masih menang pada bukti: hasil audit AA Intelligence Index sebesar 57.1 (#3), posisi #1 LMArena frontend-code dengan skor 1679, dan bobot terbuka yang benar-benar siap. Qwen3.8-Max tetap tidak dinilai oleh setiap evaluator independen. Tetapi GA memberikan Qwen dua keunggulan nyata. Dari sisi harga, sekarang jauh lebih murah — $2 / $6 dibandingkan $3 / $15, artinya 2,5× lebih murah untuk output. Dan dalam satu-satunya uji pihak ketiga head-to-head yang ada, Qwen kalah pada skor utama 80 berbanding 83 sambil menjadi agen dengan perilaku yang jelas lebih baik: 354 sitasi repo berbanding 274, 22 permintaan gateway berbanding 53, dan nol panggilan alat yang gagal berbanding dua. Kimi untuk kualitas hasil audit; Qwen untuk eksekusi agentik yang lebih murah dan lebih bersih.

Poin-poin penting

Kimi K3 adalah model yang lebih besar2.8T MoE berbanding 2.4T milik Qwen, sekitar 400B lebih banyak — yang merupakan argumen yang baik untuk tidak memperlakukan jumlah parameter sebagai proksi kemampuan.

Qwen3.8-Max telah GA sejak 3 Agustus 2026 dengan harga $2 / $6 per 1M flat, dibandingkan dengan harga Kimi K3 $3 / $15 (AA blended ~$2.31). Qwen kini 2.5× lebih murah pada output.

Kimi K3 menempati peringkat teraudit: AA Intelligence Index 57.1 (#3), hanya kalah dari Fable 5 dan GPT-5.6 Sol, serta LMArena frontend-code #1 (1679). Qwen3.8-Max masih belum mendapat skor.

Dalam satu-satunya uji langsung (Trilogy AI), Kimi mengungguli Qwen 83 berbanding 80 secara keseluruhan — tetapi Qwen membuat lebih banyak kutipan repo (354 vs 274), lebih sedikit permintaan gateway (22 vs 53), dan memiliki nol panggilan alat yang gagal (vs dua), dengan peringkat penggunaan alat 9/10 berbanding 8/10 milik Kimi.

Qwen kini melaporkan angka agen dan pemrograman: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (dari 40.7 pendahulunya) — semuanya dilaporkan Alibaba.

Waktu keterbukaan masih berpihak pada Kimi: bobotnya pada dasarnya sudah siap; milik Qwen dijanjikan minggu ini, dengan belum ada lisensi atau repositori.

Catatan akurasi: semua angka kualitas Qwen3.8-Max dilaporkan oleh Alibaba dan belum diverifikasi pihak ketiga. Angka Kimi K3 berasal dari Artificial Analysis dan LMArena. Perbandingan head-to-head adalah satu pengujian tunggal oleh Trilogy AI dan harus dibaca sebagai satu titik data, bukan peringkat umum. Harga Qwen mengacu pada kartu tarif GA dan menggantikan diskon pratinjau bulan Juli.

Spesifikasi dan harga, berdampingan

Berikut adalah data konkret, setiap angka diatribusikan pada sumbernya.

• Pembuat / status — Qwen3.8-Max: Alibaba; GA (3 Agustus 2026); Kimi K3: Moonshot; rilis open-weight

• Arsitektur — Qwen3.8-Max: ~2.4T total, sparse MoE (parameter aktif masih belum diungkapkan); Kimi K3: 2.8T MoE, visi native (Artificial Analysis)

• Jendela konteks — Qwen3.8-Max: 1M token (983,616 dengan berpikir; output maksimum 131,072); Kimi K3: 1M token (Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: Belum diskor; Kimi K3: 57.1 — #3 (Artificial Analysis)

• Arena / papan peringkat — Qwen3.8-Max: Belum dinilai publik; Kimi K3: Kode frontend #1, 1679 (LMArena)

• Skor yang dilaporkan vendor — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (dilaporkan Alibaba); Kimi K3: statusnya diukur oleh pihak ketiga

• Harga (input / output) — Qwen3.8-Max: $2.00 / $6.00 per 1M, flat; input cache $0.25; Kimi K3: $3 / $15 per 1M (AA blended ~$2.31), cache hit $0.30

• Bobot terbuka — Qwen3.8-Max: Dijanjikan minggu ini (belum ada lisensi); Kimi K3: Bobot terbuka; bobot siap

• Kecepatan — Qwen3.8-Max: p50 TTFT 1,64s (telemetri OrcaRouter 7 hari); Kimi K3: bertele-tele dan lambat (~34s TTFT, menurut AA)

Dua hal membingkai perbandingan ini, dan salah satunya berbalik sepenuhnya pada 3 Agustus.

Pertama, hubungan harga berbalik. Sepanjang Juli, Kimi K3 adalah model dengan harga riil dan Qwen adalah model dengan kupon diskon. Sekarang keduanya mempublikasikan tarif, dan model yang lebih terbukti dan lebih besar adalah yang lebih mahal: $3 / $15 dibanding $2 / $6. Pada output — tempat penalaran dan pembuatan kode menghabiskan biaya — Kimi 2,5× lebih mahal. Qwen juga mengenakan tarif tetap di seluruh konteks 1M-token, dan input cache-nya sebesar $0,25 sedikit lebih rendah daripada tarif cache-hit Kimi sebesar $0,30. Untuk beban kerja bervolume tinggi, ekonomi Qwen kini jelas lebih baik.

Kedua, kesenjangan bukti tidak berubah, dan itulah alasan Kimi masih menang. Intelligence Index 57.1 milik Kimi K3 menempatkannya di peringkat ketiga secara keseluruhan, hanya di belakang Fable 5 dan GPT-5.6 Sol — itu adalah penilaian evaluator netral. LMArena frontend-code #1 miliknya pada 1679 adalah hasil crowdsourced dari banyak perbandingan buta. Terminal-Bench 86.6 dan GPQA Diamond 92.6 milik Qwen adalah angka nyata, tetapi milik Alibaba sendiri, pada harness yang belum pernah dijalankan orang lain. Satu jangkar yang berguna: pendahulunya, Qwen3.7-Max, mencetak 46 pada indeks AA melawan 57.1 milik Kimi, jadi Qwen membutuhkan lompatan generasi yang besar hanya untuk menyamakan kedudukan.

Ada juga detail latensi yang patut dicatat, karena ini bertentangan dengan cerita yang selama ini ada. Artificial Analysis mengukur Kimi K3 sekitar 34 detik time-to-first-token — benar-benar lambat. Telemetri GA OrcaRouter menunjukkan p50 TTFT Qwen3.8-Max sebesar 1,64 detik. Pengukuran tersebut berasal dari sumber yang berbeda dan bukan merupakan perbandingan terkontrol, tetapi hal ini mempersulit asumsi era pratinjau bahwa Qwen adalah yang lebih lambat di antara keduanya.

Satu-satunya tes head-to-head, baca dengan saksama.

Ini adalah satu-satunya pertandingan dalam seri ini di mana pihak ketiga telah menguji kedua model tersebut pada tugas yang sama, sehingga layak dibaca secara saksama daripada sekadar diringkas menjadi pemenang.

Trilogy AI menjalankan tugas pemahaman arsitektur — memahami repositori nyata dan mencapai kesimpulan arsitektur yang benar — dan menilai hasilnya:

• Skor keseluruhan — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100

• Kutipan repo — Qwen3.8-Max: 354; Kimi K3: 274

• Permintaan gateway — Qwen3.8-Max: 22; Kimi K3: 53

• Panggilan alat gagal — Qwen3.8-Max: 0; Kimi K3: 2

• Peringkat penggunaan alat — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10

• Tingkat cache hit — Qwen3.8-Max: >90%; Kimi K3: >90%

Kimi memenangkan headline dengan tiga poin. Tetapi lihatlah kolom proses, karena untuk rekayasa agentik, kolom-kolom itu lebih penting daripada skor. Qwen mencapai kesimpulan arsitektur inti yang sama menggunakan kurang dari setengah permintaan gateway sambil menghasilkan 29% lebih banyak kutipan grounding dan — detail yang seharusnya menarik minat siapa pun yang membangun agen — nol panggilan alat yang gagal dibandingkan dua milik Kimi.

Panggilan alat yang gagal adalah yang sebenarnya merusak agen produksi. Mereka berjenjang: panggilan yang salah format menghasilkan kesalahan yang harus diinterpretasikan model, yang menghabiskan giliran, yang berisiko menyebabkan kesalahan lebih lanjut. Model yang membuat 22 permintaan bersih di mana model lain membuat 53 dengan dua kegagalan lebih murah dan lebih dapat diprediksi untuk dioperasikan, bahkan jika skornya tiga poin lebih rendah pada jawaban. Digabungkan dengan tingkat output Qwen yang 2,5× lebih murah, ekonomi operasional dari proses tersebut sangat mendukung Qwen.

Peringatannya adalah bahwa ini satu tugas, satu penilai, satu run. Ini bukan paket tolok ukur dan tidak dapat digeneralisasi. Indeks 57.1 Kimi dan peringkat #1 frontend didasarkan pada bukti yang jauh lebih banyak daripada tes tunggal ini. Kesimpulan yang benar bersifat sempit: pada setidaknya satu tugas agentik yang realistis, Qwen adalah pengguna alat yang lebih disiplin meskipun sedikit kalah dalam kualitas keluaran.

Biaya dalam praktik: eksekusi agentik pada volume besar.

Ambil contoh agen analisis repositori: 250.000 token konteks kode per proses, 12.000 token keluaran.

Qwen3.8-Max: 0.25M × $2 = $0.50, ditambah 0.012M × $6 = $0.072. ≈ $0.57 per proses.

Kimi K3: 0.25M × $3 = $0.75, ditambah 0.012M × $15 = $0.18. ≈ $0.93 per proses.

• Pada 1,500 run/hari: Qwen ≈ $858/hari; Kimi ≈ $1,395/hari — kira-kira selisih $16,000/bulan.

• Dengan caching pada repo yang stabil: input cache Qwen sebesar $0.25/1M membuat biaya run menjadi ≈ $0.14; tingkat cache-hit Kimi sebesar $0.30 membuatnya menjadi ≈ $0.26.

Kesenjangan ini nyata di kedua ujungnya, dan hasil Trilogy memperparahnya: jika Qwen benar-benar menggunakan kurang dari setengah permintaan gateway untuk menyelesaikan pekerjaan yang sebanding, perbedaan biaya efektif pada tugas-tugas agentik lebih lebar daripada yang disarankan oleh kartu tarif saja.

Kedua model menagih token berpikir sebagai output, sehingga konfigurasi yang berat pada penalaran lebih mahal daripada perkiraan naif di kedua sisi — tetapi tarif $6 Qwen membuat penalti tersebut 2,5× lebih kecil.

Keterbukaan: hampir setara, waktu yang berbeda

Inilah sumbu di mana keduanya paling mirip dan perbedaannya murni soal kesiapan. Bobot Kimi K3 terbuka dan pada dasarnya sudah siap. Bobot Qwen3.8-Max dijanjikan dalam minggu ini, tanpa teks lisensi, kartu model, atau repositori — dan lisensi adalah yang menentukan apakah Anda dapat menggunakan model secara komersial sama sekali.

Secara praktis, tidak ada satu pun dari model unggulan tersebut yang dapat di-host sendiri oleh tim normal. Qwen dengan 2,4T kira-kira 1,2TB dalam 4-bit dibandingkan sekitar 141GB per H200; Kimi dengan 2,8T bahkan lebih besar. Keduanya membutuhkan delapan atau lebih akselerator kelas atas, dan jumlah parameter aktif Qwen yang tidak diungkapkan Alibaba berarti Anda bahkan tidak dapat memperkirakan throughput Qwen.

Itulah sebabnya yang diumumkan secara bersamaan, Qwen3.8-27B, menjadi penting di sini. Juga bersifat open-weights dan dilaporkan berjalan sekitar 17GB VRAM, itu memberikan keluarga Qwen kisah on-premise yang sejati yang tidak diberikan oleh flagship 2.4T maupun 2.8T. Jika open-weights adalah alasan Anda sebenarnya untuk memilih di antara keduanya, 27B mengubah perhitungan lebih dari salah satu raksasa itu.

FAQ

Apakah Qwen 3.8 lebih baik daripada Kimi K3?

Bukan berdasarkan bukti yang diaudit. Kimi K3 memegang AA Intelligence Index independen sebesar 57,1 (#3) dan posisi #1 frontend-code LMArena, sementara Qwen3.8-Max belum diberi skor oleh evaluator pihak ketiga mana pun. Dalam satu tes langsung yang tersedia, Kimi menang 83 berbanding 80. Keunggulan Qwen adalah harga (output 2,5× lebih murah) dan, dalam tes yang sama, penggunaan alat yang lebih bersih.

Model mana yang lebih besar?

Kimi K3, dengan total parameter 2,8T dibandingkan Qwen3.8-Max yang 2,4T — kira-kira 400B lebih banyak. Namun, tidak ada satu pun yang mengungkapkan cukup detail agar hal itu bermakna: Alibaba belum pernah memublikasikan jumlah parameter aktif Qwen, yang merupakan angka yang sebenarnya menentukan biaya serving dalam model Mixture-of-Experts.

Yang mana yang lebih murah?

Qwen3.8-Max, jelas, sejak GA. Ia memasang harga $2 / $6 per 1M, dibandingkan dengan $3 / $15 milik Kimi K3 — 33% lebih murah untuk input dan 2.5× lebih murah untuk output. Tarif Qwen seragam di seluruh konteks 1M, dan input cache-nya sebesar $0.25 sedikit lebih rendah dari tingkat cache-hit Kimi yang $0.30.

Apa yang sebenarnya ditunjukkan oleh tes head-to-head itu?

Dalam tugas pemahaman arsitektur Trilogy AI, Kimi mendapat skor 83 dan Qwen 80. Namun Qwen menghasilkan 354 sitasi repositori dibanding 274 milik Kimi, menggunakan 22 permintaan gateway dibanding 53, mencatat nol panggilan alat yang gagal dibanding dua, dan meraih 9/10 untuk penggunaan alat dibanding 8/10 milik Kimi. Kimi memberikan jawaban yang lebih baik; Qwen adalah agen yang lebih disiplin. Ini hanya satu tugas, jadi anggap saja sebagai titik data, bukan peringkat.

Apakah Qwen 3.8 Max sudah keluar dari pratinjau?

Ya, pada 3 Agustus 2026, dengan kartu tarif yang dipublikasikan dan endpoint yang kompatibel dengan OpenAI dan DashScope. Kampanye kredit Qoder bulan Juli tidak lagi menjelaskan bagaimana produk itu dijual.

Mana yang lebih cepat?

Mungkin Qwen sekarang, yang membalikkan asumsi era pratinjau. Artificial Analysis mengukur Kimi K3 pada sekitar 34 detik time-to-first-token; telemetri GA 7 hari OrcaRouter menunjukkan Qwen3.8-Max pada p50 TTFT 1.64 detik. Sumbernya berbeda dan bukan perbandingan terkontrol, tetapi kedua model memiliki reputasi verbositas, dan TTFT terukur Kimi memang lambat.

Bisakah saya self-host salah satunya?

Tidak realistis pada skala flagship — {{1}}model 2.4T dan 2.8T membutuhkan delapan atau lebih GPU kelas H200{{/1}}. Bobot model Kimi sudah tersedia hari ini; bobot model Qwen dijanjikan dalam minggu ini, tetapi lisensinya belum ada. Untuk opsi on-premise yang sesungguhnya, {{2}}Qwen3.8-27B yang diumumkan secara bersamaan (dilaporkan sekitar 17GB VRAM){{/2}} adalah pilihan yang praktis dalam keluarga Qwen.

Intinya

Qwen 3.8 vs Kimi K3 adalah pertarungan terdekat dalam seri ini, dan ketersediaan umum membaginya secara rapi dalam dua sumbu. Kimi K3 mempertahankan mahkota kualitas berdasarkan hal-hal yang diukur wasit: 57,1 pada Indeks Kecerdasan, peringkat ketiga secara keseluruhan, dan posisi teratas kode frontend LMArena. Itu bukan klaim — itu adalah hasil, dan Qwen tidak memiliki satupun yang setara.

Apa yang Qwen menangkan pada 3 Agustus adalah aspek ekonominya, dan Qwen menang telak: $2 / $6 berbanding $3 / $15, dengan tarif tetap per satu juta token, plus caching yang sedikit lebih murah. Tambahkan temuan Trilogy bahwa Qwen menyelesaikan tugas agentic yang sebanding dengan setengah permintaan gateway dan nol panggilan alat yang gagal, dan Qwen tampak sebagai model yang lebih efisien secara operasional bahkan di sisi yang kurang akurat. Pantau dua peristiwa: skor Intelligence Index independen pertama untuk Qwen3.8-Max, dan rilis bobot model dengan lisensi. Jika skor Qwen mendekati 57,1 milik Kimi, selisih harga membuat sangat sulit membenarkan Kimi untuk pekerjaan bervolume besar. Sampai saat itu, Kimi adalah model yang Anda percaya dan Qwen adalah model yang mampu Anda jalankan — dan cara jujur untuk memilih adalah berdasarkan repositori Anda sendiri.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari