
GPT-6 Luna vs Kimi K3: Throughput Empat Kali Lipat, Harga Sepertiga Puluh, Satu Pengecualian Nyata
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Two models, both released within the last three months, both positioned as the cheap tier of a frontier family, and both wrong about what "cheap tier" means in the same way — which is not at all. Kimi K3 is Moonshot AI's open-weight flagship, public under a Modified MIT licence since July 27, 2026, priced at $3.00 per million input tokens and $15.00 per million output with cache reads at $0.30. GPT-6 Luna is the vendor's volume tier, generally available since September 22, 2026 at $0.10 and $0.50 with cache reads at a cent. Thirty times on input, thirty times on output, and a licence on one side that the other cannot offer at any price.
Daftar harga bukanlah yang menentukan pasangan ini, karena perbedaannya tidak cukup dekat untuk perlu dijadikan penentu. Yang menentukan adalah angka yang tidak dicantumkan kedua vendor di judul utama: kecepatan keluaran yang terukur. Kimi K3 menghasilkan 38,7 token per detik. GPT-6 Luna menghasilkan 153,9. Itu selisih empat kali lipat, dan untuk beban kerja apa pun ketika model menjadi komponen di dalam sebuah loop, bukan endpoint yang diajak bicara oleh seseorang, perbedaan throughput empat kali lipat mengubah arsitektur, bukan tagihan.
Apa sebenarnya keduanya ini
Kimi K3 adalah model mixture-of-experts berparameter 2,8 triliun dengan 104 miliar parameter aktif per token, jendela konteks 1.048.576 token, batas keluaran 1.048.576 token, dan bobot yang dipublikasikan di Hugging Face di bawah lisensi MIT yang Dimodifikasi. Model ini adalah model open-weight dengan skor tertinggi di papan peringkat independen — peringkat pertama dari 112 model open-weight — dan menempati posisi teratas di papan peringkat WebDev Code Arena dengan 1.679 Elo. Moonshot melaporkan 88,3% pada Terminal-Bench 2.0, yang merupakan angka dari vendor dan tidak direproduksi secara independen.
GPT-6 Luna adalah tingkat kecil dari generasi GPT-6 OpenAI, berada di bawah GPT-6 Sol pada $2.00/$10.00 dan jauh di bawah andalan GPT-6 Astra pada $10.00/$50.00. Masukan teks dan gambar, keluaran teks, jendela 1.050.000 token dengan masukan maksimum 922.000 dan batas keluaran 128.000 token, serta upaya penalaran yang dapat dipilih dari none hingga low, medium, high, xhigh, dan max dengan medium sebagai nilai bawaan. Model ini bersifat tertutup, berpengenal tunggal, dan tersedia bagi siapa pun yang memiliki kunci API.
Yang satu adalah unduhan. Yang satu adalah endpoint. Keduanya dihargai berdasarkan volume. Itulah bentuk perbandingannya.
Kartu-kartunya, baris demi baris
Satu baris per dimensi, kedua sisi pada masing-masing:
• Masukan per 1 juta — GPT-6 Luna $0,10 vs Kimi K3 $3,00
• Output per 1 juta — GPT-6 Luna $0.50 vs Kimi K3 $15.00
• Input cache per 1 juta — GPT-6 Luna $0.01 vs Kimi K3 $0.30, sepersepuluh dari tarif inputnya sendiri di kedua kartu
• Klausul konteks panjang — GPT-6 Luna menggandakan input dan cache serta menaikkan output 1,5× di atas 272.000 token input, diterapkan pada keseluruhan permintaan, sedangkan Kimi K3 tidak mempublikasikan klausul setara di kartunya
• Jendela konteks — GPT-6 Luna 1.050.000 token dengan input maksimum 922.000 vs Kimi K3 1.048.576 token
• Output maksimum — GPT-6 Luna 128.000 token vs Kimi K3 1.048.576 token, delapan kali batas atas
• Indeks Kecerdasan, independen — GPT-6 Luna 37 pada upaya maksimal vs Kimi K3 44 pada upaya maksimal, revisi indeks yang sama
• Skor upaya default — GPT-6 Luna 29 pada pengaturan medium defaultnya vs Kimi K3 yang diukur pada pengaturan maksimalnya
• Biaya per tugas Index, independen — GPT-6 Luna sekitar $0.07 vs Kimi K3 $2.00
• Token keluaran pada uji indeks — GPT-6 Luna 150M vs Kimi K3 160M, terhadap median papan sebesar 88M; keduanya jauh lebih bertele-tele daripada model median papan tersebut
• Kecepatan output, independen — GPT-6 Luna 153.9 token/detik vs Kimi K3 38.7 token/detik
• Bobot — GPT-6 Luna tertutup, hanya API vs Kimi K3 publik di Hugging Face sejak 27 Juli 2026
• Lisensi — GPT-6 Luna tidak berlaku dibandingkan Kimi K3 Modified MIT, yang bukan instrumen yang sama dengan MIT
• Total parameter — GPT-6 Luna tidak diungkapkan vs Kimi K3 2.800 miliar, di antaranya 104 miliar aktif per token
• Bukti menonjol — pemanggilan alat dan loop agentik GPT-6 Luna dengan sepersepuluh sen per seribu token masukan yang di-cache vs Kimi K3 Code Arena WebDev #1 pada 1.679 Elo, Terminal-Bench 2.0 88,3% dilaporkan vendor, skor open-weight teratas di papan independen
• Di OrcaRouter — GPT-6 Luna tidak ada di katalog kami vs Kimi K3 dapat dirutekan dengan harga daftar Moonshot

Throughput adalah spesifikasi yang tak pernah dijadikan berita utama.
Model dengan kecepatan 38,7 token per detik dan model dengan kecepatan 153,9 token per detik bukanlah produk yang sama dengan label harga yang berbeda. Itu adalah produk yang berbeda.
Ambil tugas di mana model harus menghasilkan jawaban 1.500 token — ringkasan, ekstraksi terstruktur, patch kode beserta penjelasannya. Pada 153,9 token per detik, jawaban itu memerlukan sekitar sepuluh detik. Pada 38,7, diperlukan sekitar tiga puluh sembilan detik. Tidak ada dari angka tersebut yang mencakup waktu penalaran atau latensi jaringan, jadi kesenjangan di dunia nyata lebih lebar daripada empat kali lipat secara proporsional, bukan lebih sempit.
Sekarang masukkan itu ke dalam loop. Agen yang melakukan tiga puluh panggilan model untuk menyelesaikan satu tugas — merencanakan, memilih alat, membaca hasil, memutuskan langkah berikutnya, mengulang — menghasilkan mungkin 15.000 token keluaran di seluruh panggilan tersebut. GPT-6 Luna menghabiskan sekitar 97 detik untuk menghasilkan. Kimi K3 menghabiskan sekitar 388 detik. Itulah perbedaan antara tugas yang ditunggu pengguna dan tugas yang dijadwalkan pengguna, dan tidak ada tingkat permisif lisensi yang dapat mengubahnya.
Bertele-tele memperparah masalah kecepatan, bukan mengimbanginya. Kimi K3 menghasilkan 160 juta token output saat menyelesaikan indeks independen, dibandingkan 150 juta milik GPT-6 Luna — jadi pada evaluasi itu, model yang lebih lambat juga menghasilkan token sedikit lebih banyak, bukan lebih sedikit. Kedua model sama-sama bertele-tele; keduanya hanya tidak sama-sama cepat, dan pada kartu yang dihargai berdasarkan output, bertele-tele menjadi mahal dua kali.
Patut dikatakan secara terus terang bahwa ini bukan cacat pada Kimi K3. Model 2,8 triliun parameter dengan 104 miliar parameter aktif melakukan lebih banyak pekerjaan per token daripada model kelas kecil, dan angka throughput adalah pengukuran atas pekerjaan tersebut. Pertanyaan yang relevan adalah apakah beban kerja Anda membutuhkan pekerjaan itu. Jika ya, 38,7 token per detik adalah harga yang harus dibayar untuk kemampuan tersebut. Jika tidak, Anda membayar untuk pertimbangan yang tidak Anda minta, tiga puluh kali lipat.
Di mana tujuh poin K3 berada
Kimi K3 mencetak 44 pada Intelligence Index independen dengan upaya maksimum. GPT-6 Luna mencetak 37 pada pengaturan yang sama. Tujuh poin, pada komposit di mana satu poin masih berada dalam derau pengujian ulang — dan keduanya terpaut sekitar dua puluh delapan kali dalam biaya per tugas yang diselesaikan, $2,00 versus sekitar $0,07.
Tujuh poin itu tidak terdistribusi secara merata. Reputasi Kimi K3 terkonsentrasi pada coding dan pada pekerjaan perangkat lunak agentik, dan itulah alasan model ini ada: papan peringkat WebDev Code Arena menempatkannya di peringkat pertama dengan 1,679 Elo, dan angka Terminal-Bench 2.0 dari vendor sebesar 88.3% adalah pengukuran agen coding. Posisi coding GPT-6 Luna sendiri merupakan langkah mundur, bukan maju — Coding Agent Index-nya berada di 41, dua poin di bawah GPT-5.6 Luna yang digantikannya, dengan penurunan terkonsentrasi pada SWE-Atlas-QnA dan DeepSWE v1.1. Jika pekerjaan Anda adalah agen yang menulis perangkat lunak terhadap repositori nyata, itu adalah selisih indeks tujuh poin dan regresi generasional dua poin yang menunjuk ke arah yang sama, dan argumen untuk tier murah menjadi jauh lebih lemah.
Wilayah di mana ketujuh poin itu tidak berlaku adalah kelas pekerjaan yang menjadi sasaran harga GPT-6 Luna. Klasifikasi, ekstraksi, perutean, peringkasan massal, loop dalam sebuah agen yang membutuhkan jawaban cepat ya-atau-tidak — pada tugas-tugas itu, kedua model akan menghasilkan output yang sama yang dapat digunakan hampir sepanjang waktu, dan perbedaannya tidak akan bertahan saat diuji dengan set evaluasi Anda sendiri. Indeks ini mengukur komposit yang memberi bobot besar pada penalaran jangka panjang dan coding, dan tidak satu pun dari keduanya merupakan hal yang dibutuhkan oleh keputusan perutean.
Satu catatan penting yang layak disertakan pada angka indeks di kedua sisi: papan ini adalah evaluasi bergulir dan revisinya penting. Snapshot sebelumnya dari papan peringkat yang sama menempatkan Kimi K3 jauh lebih tinggi daripada 44 yang ditunjukkan rekaman kami hari ini, karena komposit, harness, dan kumpulan model semuanya berubah. Perbandingan apa pun yang bersandar pada selisih persis antara dua model pada indeks bergulir sedang bersandar pada sesuatu yang tidak akan tetap stabil. Pembacaan yang jujur adalah bahwa keduanya berada dalam pita kemampuan yang berdekatan pada batas atasnya, dan indeks tidak dapat memberi tahu Anda mana yang lebih baik untuk tugas Anda.
Pengecualian: apa yang sebenarnya Anda dapatkan dari Modified MIT
Lisensi Kimi K3 adalah satu dimensi yang tidak dapat dijawab GPT-6 Luna pada harga berapa pun, dan hal itu layak mendapat ketelitian lebih daripada yang biasanya didapat oleh frasa "bobot terbuka".
Bobot-bobotnya tersedia untuk publik di Hugging Face dan lisensinya adalah Modified MIT, bukan MIT. Perbedaan itu penting: lisensi Modified MIT biasanya menyertakan syarat-syarat — umumnya berupa kewajiban untuk menampilkan atribusi ketika model digunakan dalam suatu produk di atas skala tertentu — dan siapa pun yang berencana membangun produk komersial di atas bobot-bobot tersebut sebaiknya membaca instrumen yang sebenarnya, bukan nama keluarga yang mirip dengannya. Ini bukan alasan untuk menghindarinya. Ini alasan untuk tidak menyebutnya sebagai MIT dalam dokumen pengadaan.
Yang diperoleh dari mengunduh itu nyata dan terbatas. Ini memberikan batas bawah biaya, dalam artian kapasitas GPU tetap dapat mengalahkan tagihan berbasis pemakaian pada volume yang cukup. Ini memberikan kemandirian dari peta jalan vendor — model yang Anda host tidak bisa dinyatakan usang dan ditarik dari bawah kaki Anda. Ini memberikan kemampuan untuk melakukan fine-tuning pada distribusi data Anda sendiri. Dan ini memberikan opsi untuk menjaga prompt tetap berada di dalam batas Anda sendiri, yang bagi sebagian tim mengakhiri perbandingan sebelum harga disebutkan.
Yang menjadi biaya adalah perangkat kerasnya. Model mixture-of-experts dengan 2,8 triliun parameter dan 104 miliar parameter aktif bukanlah model yang bisa dijalankan di sebuah workstation. Melayaninya pada throughput produksi adalah komitmen berskala klaster dengan biaya modal, biaya operasional, dan profil latensi yang Anda miliki, bukan Anda sewa. Itu bukan argumen untuk menentang self-hosting Kimi K3 — melainkan argumen bahwa perbandingan yang tepat bukanlah $15,00 per juta token keluaran versus $0,00, tetapi $15,00 per juta token keluaran versus biaya penuh per token yang mencakup silikon dan orang-orangnya. Bagi sejumlah kecil organisasi, angka itu lebih rendah. Bagi sebagian besar, tidak, dan titik peralihannya lebih jauh daripada yang terasa karena lisensinya.
Menjalankan salah satunya, atau keduanya
Kimi K3 tersedia di OrcaRouter dengan harga daftar Moonshot, di bawah penetapan harga pass-through yang berarti perubahan tarif vendor langsung berlaku di sisi kami pada hari yang sama. Failover otomatis adalah bagian yang membuktikan kegunaannya khususnya untuk model ini: endpoint Kimi K3 yang di-hosting sendiri atau pihak ketiga yang menurun performanya adalah skenario yang tepat ketika Anda ingin rute berpindah tanpa deployment, dan model 38,7 token per detik memiliki ruang lebih sedikit untuk menyerap upstream yang lambat dibandingkan model yang cepat.
GPT-6 Luna tidak ada dalam katalog kami pada saat penulisan ini dan diakses melalui API milik OpenAI sendiri, jadi tim yang menginginkan keduanya menjalankan satu kunci untuk Kimi K3 bersama apa pun yang sudah digunakan untuk OpenAI. Ini juga pasangan yang membuat routing DSL melakukan sesuatu yang tidak bisa dilakukan oleh pemisahan hard-coded: aturan yang mengirim pekerjaan pengodean dan berhorizon panjang ke Kimi K3 serta segala hal yang dikonsumsi program dan pendek ke GPT-6 Luna mengekspresikan batas yang bergeser setiap kali salah satu vendor merilis, dan batas itu bergeser sebagai konfigurasi, bukan sebagai jalur kode. Fusi model adalah konfigurasi lain yang layak disebut di sini — panel yang terdiri dari satu model lambat yang cermat dan satu model cepat yang murah yang menjawab bersama-sama, dengan anggota yang murah menangani volume dan yang mahal mengadili kasus-kasus yang penting, adalah bentuk yang sangat cocok untuk pasangan model ini, karena asimetri biaya di antara keduanya cukup besar sehingga mengeluarkan satu panggilan Kimi K3 untuk sebagian kecil trafik tetap terjangkau.

Yang mana, dan kapan
Gunakan GPT-6 Luna jika beban kerja Anda bervolume tinggi, dikonsumsi oleh program, dan sensitif terhadap latensi. Klasifikasi, ekstraksi, perutean, peringkasan massal, loop inti sebuah agen. Dengan $0.10/$0.50 dengan pembacaan cache satu sen dan throughput empat kali lipat Kimi K3, hitungannya tidak dekat dan perbedaan latensinya bukan marginal. Setel parameter effort secara eksplisit, karena nilai bawaannya adalah medium dan angka 37 yang menonjol adalah angka upaya maksimum, dan jaga panggilan panjang tetap di sisi yang benar dari batas 272.000 token.
Ambil Kimi K3 jika Anda memerlukan bobotnya, jika pekerjaan Anda adalah pengodean agentik terhadap repositori nyata yang posisi WebDev-nya dan laporan vendor sebesar 88,3% pada Terminal-Bench 2.0 menjadi bukti yang penting, jika Anda memerlukan batas keluaran di atas 128.000 token, atau jika organisasi Anda tidak dapat mengirim prompt ke endpoint tertutup. Terimalah 38,7 token per detik sebagai bagian dari kesepakatan, dan bacalah ketentuan Modified MIT alih-alih mengasumsikannya.
Kesalahan yang diundang oleh perbandingan ini adalah menganggap laju tiga puluh kali lipat sebagai jawaban atas pertanyaan tentang kapabilitas. Itu adalah jawaban atas pertanyaan tentang token. Pertanyaan tentang kapabilitas ditentukan oleh apakah Anda membutuhkan bobot atau kecepatan, dan kedua jawaban itu mengarah ke arah yang berlawanan.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
