Kartu hero yang dihasilkan berjudul 'Qwen 4 Max vs Kimi K3' dengan subjudul 'Janji open-weight bertemu dengan realisasi open-weight' dan tiga lencana pil bertuliskan 'Bobot dijanjikan, belum dikirim', 'Bobot K3 rilis 27 Juli 2026' dan 'Lisensi MIT yang dimodifikasi'. Baris footer berbunyi 'Alibaba Yunqi Conference, Hangzhou'. Gaya editorial vektor datar di latar belakang putih dengan lapisan gradien biru ke cyan dan logo OrcaRouter dikomposisikan di kanan bawah.
Engineering & Research

Qwen 4 Max vs Kimi K3: janji open-weights bertemu dengan realisasi open-weights

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Moonshot AI merilis Kimi K3 pada 16 Juli 2026 lalu melakukan hal yang hanya dibicarakan sebagian besar lab: menerbitkan bobotnya. Checkpoint berparameter 2,8 triliun itu mendarat pada 27 Juli 2026 di bawah lisensi MIT yang Dimodifikasi, sebelas hari setelah peluncuran. Sementara itu, konferensi Yunqi pada 22 September 2026 digunakan untuk mengumumkan Qwen 4 Max sebagai andalan keluarga Qwen 4 bertingkat empat yang mencakup Qwen 4 27B berbobot terbuka — tingkat yang dijanjikan, bukan dikirim. Kedua fakta itu adalah perbandingannya. Segala hal lain tentang Qwen 4 Max saat ini tidak diketahui, dan jarak antara tingkat terbuka yang dijanjikan dan yang telah dikirim adalah tempat perbandingan ini benar-benar memiliki sesuatu untuk dikatakan.

Apa yang Kimi K3 tawarkan pada Juli

Kimi K3 adalah campuran-pakar (mixture-of-experts) berparameter 2,8 triliun yang mengaktifkan 16 dari 896 pakar per token, sehingga sekitar 104 miliar parameter bekerja pada setiap langkah tertentu. Model ini memiliki jendela konteks 1.048.576 token pada sisi input maupun output dan menerima masukan teks, gambar, dan video dengan keluaran teks. API pihak pertamanya mencantumkan harga $3,00 per juta token input, $15,00 per juta token output, dan $0,30 per juta token input yang di-cache, dan tarif pihak ketiga lebih rendah dari itu.

Arsitektur adalah bagian yang digaungkan oleh pratinjau Alibaba sendiri. Kimi K3 dibangun di atas Kimi Delta Attention dan Attention Residuals, yang menurut klaim Moonshot memberikan efisiensi penskalaan sekitar 2,5 kali lebih baik daripada Kimi K2 dan decoding hingga 6,3 kali lebih cepat pada konteks sejuta token. Itu adalah masalah yang sama yang dituju QSA milik Qwen — membuat atensi terjangkau pada panjang ekstrem — yang berarti kedua keluarga ini tidak bersaing pada skala, melainkan pada desain sparse-attention siapa yang lebih awet.

Skor yang dipublikasikan Moonshot saat peluncuran, dilaporkan vendor dan belum dapat direproduksi pada saat itu:

• Indeks Kecerdasan Artificial Analysis — 57, saat itu berada di peringkat ketiga di bawah Claude Fable 5 dan GPT-5.6 Sol. Angka tersebut tercatat pada revisi indeks yang lebih awal; indeks itu sejak saat itu telah dibangun ulang dua kali, sehingga angka itu merupakan pembacaan historis, bukan angka terkini

• Frontend Code Arena — tempat pertama pada 1.679 Elo, unggul atas kedua model yang mengalahkannya pada indeks umum

• Terminal-Bench 2.1 — 88.3

• SWE-Marathon — 42, di atas Opus 4.8 dan GPT-5.6 Sol

• DeepSearchQA — 0,95, peringkat pertama, dan MATH-Vision 0,98, juga peringkat pertama

• GPQA-Diamond — 0.94

Materi peluncuran Moonshot sendiri mengakui bahwa K3 masih tertinggal dari Claude Fable 5 dan GPT-5.6 Sol dalam hal kemampuan secara keseluruhan, dan itu adalah kalimat yang lebih berguna daripada klaim peringkat pertama mana pun di atasnya. Bentuk angka yang menarik adalah bahwa model yang berada di peringkat ketiga pada indeks umum justru finis pertama dalam kode frontend dan pertama dalam penelusuran horizon panjang — profil yang menunjukkan bahwa indeks agregat menyembunyikan perkakas terspesialisasi alih-alih menggambarkan model yang bersifat umum.

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

Apa yang telah dijanjikan Alibaba, dan berapa nilai sebuah janji

Pengumuman Qwen 4 menyebut empat tingkatan. Qwen 4 Max sebagai unggulan, Qwen 4 Flash untuk throughput, Qwen 4 Plus sebagai opsi menengah yang seimbang, dan Qwen 4 27B sebagai tingkatan lokal dengan bobot terbuka. Pimpinan Qwen LLM Liu Da Yiheng menggambarkan keluarga ini sebagai dilatih dengan arsitektur generasi baru dan mengatakan akan segera hadir. Tidak ada tanggal, tidak ada kartu model, tidak ada pengenal API, tidak ada daftar cloud, tidak ada harga, dan tidak ada skor yang dipublikasikan untuk salah satu dari keempatnya.

Dua hal spesifik tentang pengumuman itu sering dilaporkan secara keliru, dan keduanya penting bagi siapa pun yang mencoba merencanakan berdasarkan hal itu:

• Angka parameter 5 triliun hingga 10 triliun yang dikaitkan dengan liputan Qwen 4 bukanlah spesifikasi Qwen 4. Angka itu termasuk dalam peta jalan Qwen 4.5 dan Qwen 5. Tidak ada jumlah parameter dalam bentuk apa pun yang telah dipublikasikan untuk Qwen 4 Max

• Keberlanjutan nama tier tidak berarti spesifikasinya ikut diteruskan. Jendela konteks, harga, dan lisensi Qwen 4 Max tidak diketahui; angka Qwen3.8-Max yang dirilis — 1.000.000 token dengan $2,00 dan $6,00 per juta — menggambarkan model yang berbeda

Alasan mengapa tingkat 27B adalah yang menarik sama sekali tidak ada hubungannya dengan tolok ukur. Itu adalah satu-satunya tingkat dalam lini Qwen 4 yang secara historis dirilis dengan bobot terbuka, dan generasi Qwen 3.8 menunjukkan apa yang dibukanya: dalam beberapa hari setelah bobot 27B tersedia, komunitas telah menghasilkan konversi MLX, kuantisasi NVFP4, dan berbagai fine-tune dari segala macam jenis. 27B yang diumumkan adalah komitmen terhadap ekosistem hilir, dan itu adalah pengiriman yang paling dapat diprediksi di peta jalan.

Namun, prediktabilitas tidak terwujud. Bobot Kimi K3 adalah file yang bisa Anda unduh hari ini. Bobot Qwen 4 27B hanyalah satu baris dalam sebuah presentasi konferensi.

Bobot terbuka dan bobot yang dapat dijalankan adalah klaim yang berbeda

Ada jebakan dalam memperlakukan Kimi K3 sebagai jawaban bobot terbuka, dan hal ini layak dinyatakan secara gamblang karena merupakan klaim berlebihan yang paling umum dalam liputan tentang model-model terdepan Tiongkok. Mixture-of-experts berparameter 2,8 triliun adalah artefak berskala pusat data. Bobot yang dipublikasikan berarti Anda diizinkan menjalankannya, dapat memeriksanya, dapat menyetel halusnya, dan dapat mengkuantisasinya. Itu tidak berarti Anda dapat menjalankannya di stasiun kerja. Pelayanan efisien untuk checkpoint sebesar itu membutuhkan puluhan akselerator, dan pekerjaan kuantisasi yang menyusul sebuah rilis terbuka — varian bergaya NVFP4 dan REAP yang beredar dalam hitungan minggu — sama-sama soal membuat model dapat dilayani dan membuatnya lebih kecil.

Jadi pembacaan yang jujur atas lisensi Kimi K3 memang lebih sempit namun tetap signifikan: ini adalah model terdepan yang dapat diaudit, dimodifikasi, dan di-host sendiri, di bawah lisensi Modified MIT, untuk organisasi yang memiliki perangkat keras guna menjalankannya. Itu adalah aset strategis yang nyata sekaligus kurang cocok bagi siapa pun yang membaca "open weights" sebagai "bisa berjalan di laptop saya".

Peringatan yang sama akan berlaku untuk Qwen 4 27B jika dan ketika dirilis — dan peringatan itu berlaku lebih longgar, karena tier bobot terbuka 27B benar-benar berskala lokal sedangkan model andalan 2,8T tidak. Itulah tepatnya sebabnya tier Qwen 4 27B lebih patut mendapat perhatian daripada tier Max dalam perbandingan ini, meskipun tier Max-lah yang dijadikan sorotan utama oleh pengumuman tersebut.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

Pertanyaan komersial yang mendasari pertanyaan lisensi

Tarif pihak pertama Kimi K3 sebesar $3,00 untuk input dan $15,00 untuk output per juta token adalah posisi premium, dan Moonshot telah secara eksplisit menyatakan bahwa harga itu sengaja ditetapkan di atas segmen murah pasar Tiongkok. Dibandingkan Qwen3.8-Max pada $2,00 dan $6,00, itu berarti satu setengah kali tarif input dan dua setengah kali tarif output — selisih yang cukup besar sehingga suatu beban kerja harus mempertimbangkan kekuatan spesifik Kimi K3, termasuk kode frontend dan pencarian horizon panjang, agar premi itu layak dibayar.

OrcaRouter merutekan kimi/kimi-k3 bersama keluarga Qwen 3.8 pada satu endpoint yang kompatibel dengan OpenAI dengan markup 0%, yang berarti tarif daftar vendor adalah yang ditagihkan kepada Anda, bukan padanan yang sudah dinaikkan markalnya. Dalam perbandingan di mana selisih harga merupakan faktor 2,5 pada output, tidak adanya margin platform bukanlah detail pembulatan — lapisan sepuluh persen pada tarif output $15,00 adalah $1,50 per juta token, yang lebih besar daripada seluruh biaya input model yang lebih murah dalam pertandingan ini. Endpoint yang sama membawa failover otomatis dan DSL perutean untuk menyatakan kebijakan secara eksplisit, yang merupakan cara Anda mencoba model dengan profil Kimi K3 pada sebagian lalu lintas produksi tanpa mempertaruhkan seluruh jalur pada vendor yang belum pernah Anda jalankan sebelumnya.

Yang tidak disediakan OrcaRouter adalah Qwen 4 Max atau tier Qwen 4 mana pun, karena tidak satu pun dari mereka sudah ada sebagai produk.

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

Apa yang harus diperhatikan, dan apa yang harus diabaikan

Tiga sinyal akan mengubah perbandingan ini, dan sinyal-sinyal itu cukup spesifik untuk diperhatikan:

• Bobot Qwen 4 27B. Bukan tabel benchmark dari tier Max — checkpoint 27B, lisensinya, dan ukurannya. Itulah rilis yang akan memberi tahu Anda apakah komitmen bobot terbuka Alibaba pada generasi ini sama nyatanya dengan yang terakhir

• Lisensi Qwen 4 Max, jika ada. Jika Alibaba mempublikasikan bobot untuk produk unggulannya seperti yang dilakukannya untuk Qwen3.8-Max, argumen bobot terbuka dalam pertarungan ini tidak lagi menjadi keunggulan Kimi dan menjadi seri

• Pembacaan independen yang baru terhadap Kimi K3. Skor peluncuran Moonshot dilaporkan sendiri dan indeks Artificial Analysis telah dibangun ulang dua kali sejak itu, sehingga angka 57 dan Elo Frontend Code Arena keduanya perlu di-basis ulang sebelum dibandingkan dengan apa pun yang terkini

Yang harus diabaikan adalah tabel spesifikasi Qwen 4 Max apa pun yang muncul sebelum Alibaba menerbitkan kartu model, dan klaim apa pun bahwa bobot terbuka Kimi K3 membuatnya dapat dijalankan secara lokal. Kedua kesalahan itu sudah beredar. Sementara itu, perbandingan yang bisa Anda gunakan adalah antara dua model yang sudah ada: Kimi K3 dengan tarif premium, bobot yang sudah tersedia, dan profil pengkodean yang benar-benar berbeda, serta Qwen3.8-Max dengan tarif output kurang dari setengahnya, jendela satu juta token yang rata, dan bobotnya sendiri. Itu adalah pilihan nyata, dengan harga di kedua sisi, dan tidak perlu menunggu slide konferensi menjadi sebuah produk.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari