
Qwen 4 Max vs Kimi K3: janji open-weights bertemu dengan realisasi open-weights
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Moonshot AI merilis Kimi K3 pada 16 Juli 2026 lalu melakukan hal yang hanya dibicarakan sebagian besar lab: menerbitkan bobotnya. Checkpoint berparameter 2,8 triliun itu mendarat pada 27 Juli 2026 di bawah lisensi MIT yang Dimodifikasi, sebelas hari setelah peluncuran. Sementara itu, konferensi Yunqi pada 22 September 2026 digunakan untuk mengumumkan Qwen 4 Max sebagai andalan keluarga Qwen 4 bertingkat empat yang mencakup Qwen 4 27B berbobot terbuka — tingkat yang dijanjikan, bukan dikirim. Kedua fakta itu adalah perbandingannya. Segala hal lain tentang Qwen 4 Max saat ini tidak diketahui, dan jarak antara tingkat terbuka yang dijanjikan dan yang telah dikirim adalah tempat perbandingan ini benar-benar memiliki sesuatu untuk dikatakan.
Apa yang Kimi K3 tawarkan pada Juli
Kimi K3 adalah campuran-pakar (mixture-of-experts) berparameter 2,8 triliun yang mengaktifkan 16 dari 896 pakar per token, sehingga sekitar 104 miliar parameter bekerja pada setiap langkah tertentu. Model ini memiliki jendela konteks 1.048.576 token pada sisi input maupun output dan menerima masukan teks, gambar, dan video dengan keluaran teks. API pihak pertamanya mencantumkan harga $3,00 per juta token input, $15,00 per juta token output, dan $0,30 per juta token input yang di-cache, dan tarif pihak ketiga lebih rendah dari itu.
Arsitektur adalah bagian yang digaungkan oleh pratinjau Alibaba sendiri. Kimi K3 dibangun di atas Kimi Delta Attention dan Attention Residuals, yang menurut klaim Moonshot memberikan efisiensi penskalaan sekitar 2,5 kali lebih baik daripada Kimi K2 dan decoding hingga 6,3 kali lebih cepat pada konteks sejuta token. Itu adalah masalah yang sama yang dituju QSA milik Qwen — membuat atensi terjangkau pada panjang ekstrem — yang berarti kedua keluarga ini tidak bersaing pada skala, melainkan pada desain sparse-attention siapa yang lebih awet.
Skor yang dipublikasikan Moonshot saat peluncuran, dilaporkan vendor dan belum dapat direproduksi pada saat itu:
• Indeks Kecerdasan Artificial Analysis — 57, saat itu berada di peringkat ketiga di bawah Claude Fable 5 dan GPT-5.6 Sol. Angka tersebut tercatat pada revisi indeks yang lebih awal; indeks itu sejak saat itu telah dibangun ulang dua kali, sehingga angka itu merupakan pembacaan historis, bukan angka terkini
• Frontend Code Arena — tempat pertama pada 1.679 Elo, unggul atas kedua model yang mengalahkannya pada indeks umum
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42, di atas Opus 4.8 dan GPT-5.6 Sol
• DeepSearchQA — 0,95, peringkat pertama, dan MATH-Vision 0,98, juga peringkat pertama
• GPQA-Diamond — 0.94
Materi peluncuran Moonshot sendiri mengakui bahwa K3 masih tertinggal dari Claude Fable 5 dan GPT-5.6 Sol dalam hal kemampuan secara keseluruhan, dan itu adalah kalimat yang lebih berguna daripada klaim peringkat pertama mana pun di atasnya. Bentuk angka yang menarik adalah bahwa model yang berada di peringkat ketiga pada indeks umum justru finis pertama dalam kode frontend dan pertama dalam penelusuran horizon panjang — profil yang menunjukkan bahwa indeks agregat menyembunyikan perkakas terspesialisasi alih-alih menggambarkan model yang bersifat umum.

Apa yang telah dijanjikan Alibaba, dan berapa nilai sebuah janji
Pengumuman Qwen 4 menyebut empat tingkatan. Qwen 4 Max sebagai unggulan, Qwen 4 Flash untuk throughput, Qwen 4 Plus sebagai opsi menengah yang seimbang, dan Qwen 4 27B sebagai tingkatan lokal dengan bobot terbuka. Pimpinan Qwen LLM Liu Da Yiheng menggambarkan keluarga ini sebagai dilatih dengan arsitektur generasi baru dan mengatakan akan segera hadir. Tidak ada tanggal, tidak ada kartu model, tidak ada pengenal API, tidak ada daftar cloud, tidak ada harga, dan tidak ada skor yang dipublikasikan untuk salah satu dari keempatnya.
Dua hal spesifik tentang pengumuman itu sering dilaporkan secara keliru, dan keduanya penting bagi siapa pun yang mencoba merencanakan berdasarkan hal itu:
• Angka parameter 5 triliun hingga 10 triliun yang dikaitkan dengan liputan Qwen 4 bukanlah spesifikasi Qwen 4. Angka itu termasuk dalam peta jalan Qwen 4.5 dan Qwen 5. Tidak ada jumlah parameter dalam bentuk apa pun yang telah dipublikasikan untuk Qwen 4 Max
• Keberlanjutan nama tier tidak berarti spesifikasinya ikut diteruskan. Jendela konteks, harga, dan lisensi Qwen 4 Max tidak diketahui; angka Qwen3.8-Max yang dirilis — 1.000.000 token dengan $2,00 dan $6,00 per juta — menggambarkan model yang berbeda
Alasan mengapa tingkat 27B adalah yang menarik sama sekali tidak ada hubungannya dengan tolok ukur. Itu adalah satu-satunya tingkat dalam lini Qwen 4 yang secara historis dirilis dengan bobot terbuka, dan generasi Qwen 3.8 menunjukkan apa yang dibukanya: dalam beberapa hari setelah bobot 27B tersedia, komunitas telah menghasilkan konversi MLX, kuantisasi NVFP4, dan berbagai fine-tune dari segala macam jenis. 27B yang diumumkan adalah komitmen terhadap ekosistem hilir, dan itu adalah pengiriman yang paling dapat diprediksi di peta jalan.
Namun, prediktabilitas tidak terwujud. Bobot Kimi K3 adalah file yang bisa Anda unduh hari ini. Bobot Qwen 4 27B hanyalah satu baris dalam sebuah presentasi konferensi.
Bobot terbuka dan bobot yang dapat dijalankan adalah klaim yang berbeda
Ada jebakan dalam memperlakukan Kimi K3 sebagai jawaban bobot terbuka, dan hal ini layak dinyatakan secara gamblang karena merupakan klaim berlebihan yang paling umum dalam liputan tentang model-model terdepan Tiongkok. Mixture-of-experts berparameter 2,8 triliun adalah artefak berskala pusat data. Bobot yang dipublikasikan berarti Anda diizinkan menjalankannya, dapat memeriksanya, dapat menyetel halusnya, dan dapat mengkuantisasinya. Itu tidak berarti Anda dapat menjalankannya di stasiun kerja. Pelayanan efisien untuk checkpoint sebesar itu membutuhkan puluhan akselerator, dan pekerjaan kuantisasi yang menyusul sebuah rilis terbuka — varian bergaya NVFP4 dan REAP yang beredar dalam hitungan minggu — sama-sama soal membuat model dapat dilayani dan membuatnya lebih kecil.
Jadi pembacaan yang jujur atas lisensi Kimi K3 memang lebih sempit namun tetap signifikan: ini adalah model terdepan yang dapat diaudit, dimodifikasi, dan di-host sendiri, di bawah lisensi Modified MIT, untuk organisasi yang memiliki perangkat keras guna menjalankannya. Itu adalah aset strategis yang nyata sekaligus kurang cocok bagi siapa pun yang membaca "open weights" sebagai "bisa berjalan di laptop saya".
Peringatan yang sama akan berlaku untuk Qwen 4 27B jika dan ketika dirilis — dan peringatan itu berlaku lebih longgar, karena tier bobot terbuka 27B benar-benar berskala lokal sedangkan model andalan 2,8T tidak. Itulah tepatnya sebabnya tier Qwen 4 27B lebih patut mendapat perhatian daripada tier Max dalam perbandingan ini, meskipun tier Max-lah yang dijadikan sorotan utama oleh pengumuman tersebut.

Pertanyaan komersial yang mendasari pertanyaan lisensi
Tarif pihak pertama Kimi K3 sebesar $3,00 untuk input dan $15,00 untuk output per juta token adalah posisi premium, dan Moonshot telah secara eksplisit menyatakan bahwa harga itu sengaja ditetapkan di atas segmen murah pasar Tiongkok. Dibandingkan Qwen3.8-Max pada $2,00 dan $6,00, itu berarti satu setengah kali tarif input dan dua setengah kali tarif output — selisih yang cukup besar sehingga suatu beban kerja harus mempertimbangkan kekuatan spesifik Kimi K3, termasuk kode frontend dan pencarian horizon panjang, agar premi itu layak dibayar.
OrcaRouter merutekan kimi/kimi-k3 bersama keluarga Qwen 3.8 pada satu endpoint yang kompatibel dengan OpenAI dengan markup 0%, yang berarti tarif daftar vendor adalah yang ditagihkan kepada Anda, bukan padanan yang sudah dinaikkan markalnya. Dalam perbandingan di mana selisih harga merupakan faktor 2,5 pada output, tidak adanya margin platform bukanlah detail pembulatan — lapisan sepuluh persen pada tarif output $15,00 adalah $1,50 per juta token, yang lebih besar daripada seluruh biaya input model yang lebih murah dalam pertandingan ini. Endpoint yang sama membawa failover otomatis dan DSL perutean untuk menyatakan kebijakan secara eksplisit, yang merupakan cara Anda mencoba model dengan profil Kimi K3 pada sebagian lalu lintas produksi tanpa mempertaruhkan seluruh jalur pada vendor yang belum pernah Anda jalankan sebelumnya.
Yang tidak disediakan OrcaRouter adalah Qwen 4 Max atau tier Qwen 4 mana pun, karena tidak satu pun dari mereka sudah ada sebagai produk.

Apa yang harus diperhatikan, dan apa yang harus diabaikan
Tiga sinyal akan mengubah perbandingan ini, dan sinyal-sinyal itu cukup spesifik untuk diperhatikan:
• Bobot Qwen 4 27B. Bukan tabel benchmark dari tier Max — checkpoint 27B, lisensinya, dan ukurannya. Itulah rilis yang akan memberi tahu Anda apakah komitmen bobot terbuka Alibaba pada generasi ini sama nyatanya dengan yang terakhir
• Lisensi Qwen 4 Max, jika ada. Jika Alibaba mempublikasikan bobot untuk produk unggulannya seperti yang dilakukannya untuk Qwen3.8-Max, argumen bobot terbuka dalam pertarungan ini tidak lagi menjadi keunggulan Kimi dan menjadi seri
• Pembacaan independen yang baru terhadap Kimi K3. Skor peluncuran Moonshot dilaporkan sendiri dan indeks Artificial Analysis telah dibangun ulang dua kali sejak itu, sehingga angka 57 dan Elo Frontend Code Arena keduanya perlu di-basis ulang sebelum dibandingkan dengan apa pun yang terkini
Yang harus diabaikan adalah tabel spesifikasi Qwen 4 Max apa pun yang muncul sebelum Alibaba menerbitkan kartu model, dan klaim apa pun bahwa bobot terbuka Kimi K3 membuatnya dapat dijalankan secara lokal. Kedua kesalahan itu sudah beredar. Sementara itu, perbandingan yang bisa Anda gunakan adalah antara dua model yang sudah ada: Kimi K3 dengan tarif premium, bobot yang sudah tersedia, dan profil pengkodean yang benar-benar berbeda, serta Qwen3.8-Max dengan tarif output kurang dari setengahnya, jendela satu juta token yang rata, dan bobotnya sendiri. Itu adalah pilihan nyata, dengan harga di kedua sisi, dan tidak perlu menunggu slide konferensi menjadi sebuah produk.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
