
GPT-6.1 Sol vs Kimi K3: Unduhannya Ada, dan Itu Tetap Bukan Pilihan Murah
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Kimi K3 adalah contoh tandingan yang biasanya menyelesaikan argumen semacam ini. Moonshot AI merilis model 2,8 triliun parameter pada Juli 2026 dan menerbitkan bobotnya — moonshotai/Kimi-K3 ada di Hugging Face, tanpa pembatasan, dengan lebih dari satu juta unduhan dan revisi terakhir pada September. Jadi tidak ada tanda bintang "terbuka secara prinsip, ditahan untuk penguatan keamanan" di sini, tidak ada penundaan dua minggu yang harus ditunggu. GPT-6.1 Sol, yang dirilis OpenAI pada 29 September 2026, bersifat tertutup dan hanya API dan akan selalu begitu. Dan di papan peringkat independen, model yang dapat diunduh mencetak skor 43,6 berbanding 51,8 milik model tertutup, sementara biayanya $2,00 per tugas indeks yang diselesaikan berbanding $0,72. Bobot terbuka seharusnya menjadi jalan keluar yang murah; dalam pasangan ini, bobot terbuka justru merupakan sisi mahal dari pertukaran tersebut, dan alasannya bukan lisensinya.
Apa yang dimaksud dengan masing-masing model
Kimi K3 adalah model sparse mixture-of-experts dengan total 2.800 miliar parameter dan sekitar 104 miliar — sekitar 3,7% — aktif per token. Model ini membawa jendela konteks 1.048.576 token, menerima teks dan gambar sebagai masukan, dan mengembalikan teks. Checkpoint yang dipublikasikan adalah artefak FP8 dan merupakan unduhan yang benar-benar besar; penerapan produksi di perangkat keras Anda sendiri adalah keputusan klaster, bukan keputusan stasiun kerja. Klaim arsitektur Moonshoot adalah skema linear-attention hibrida yang dikatakannya jauh lebih cepat pada decoding konteks panjang, ditambah pekerjaan residual dan routing yang membuat model berparameter 2,8 triliun dapat dilayani.
GPT-6.1 Sol adalah penyegaran kelas menengah OpenAI — di bawah GPT-6 Astra, di atas GPT-6 Luna — dengan jendela 1.050.000 token, batas keluaran 128.000 token, masukan teks, gambar, dan file, serta batas pengetahuan 30 April 2026. Penalaran berjalan rendah hingga maks dengan sedang sebagai default; tingkat tidak ada yang diterima GPT-6 Sol sebelumnya ditolak mentah-mentah, dan catatan migrasi OpenAI sendiri mengarahkan pengembang ke rendah sebagai gantinya. Harganya $2,00 dan $10,00 per juta token dengan masukan cache $0,10.
Satu baris per dimensi, kedua sisi pada masing-masing:
• Masukan — GPT-6.1 Sol $2,00 per 1 juta vs Kimi K3 $3,00 per 1 juta
• Keluaran — GPT-6.1 Sol $10,00 per 1 juta vs Kimi K3 $15,00 per 1 juta
• Masukan yang di-cache — GPT-6.1 Sol $0,10 per 1 juta vs Kimi K3 $0,30 per 1 juta
• Jendela konteks — 1.050.000 token vs 1.048.576 token; selisih 0,1%, tidak material
• Keluaran maksimum — 128.000 token pada keduanya
• Total dan parameter aktif — tidak diungkapkan vs total 2.800 miliar, 104 miliar aktif per token
• Modalitas — masukan teks, gambar, dan berkas, keluaran teks vs masukan teks dan gambar, keluaran teks
• Bobot — tertutup, hanya API vs terbuka, tanpa pembatasan, lebih dari 1 juta unduhan
• Klausul konteks panjang — menetapkan harga ulang seluruh permintaan di atas 272.000 token masukan dengan tarif 2× untuk masukan dan cache serta 1,5× untuk keluaran vs tidak ada klausul yang setara pada kartu yang diterbitkan
• Indeks Kecerdasan, independen, upaya maksimum — 51,8 vs 43,6
• Biaya per tugas indeks, independen — $0,72 vs $2,00
• Token keluaran pada uji indeks — 67 juta vs 160 juta, dibandingkan median papan peringkat 140 juta untuk kelas perbandingannya
Satu-satunya evaluasi yang dimenangkan K3, dan mengapa itu penting
Sebelum aritmetika, pengecualiannya, karena itu nyata. Dinilai evaluasi demi evaluasi pada upaya maksimal di Artificial Analysis v4.3.2, GPT-6.1 Sol memimpin tujuh dari sepuluh dan tidak seri sama sekali, tetapi model yang memenangkan evaluasi penalaran konteks panjang adalah K3:
• AA-LCR v1.1 — Kimi K3 0.887 vs GPT-6.1 Sol 0.830. Keunggulan enam poin pada evaluasi yang dirancang khusus untuk penalaran atas masukan panjang.
• SciCode — Kimi K3 0.595 vs GPT-6.1 Sol 0.542. K3 juga unggul dalam pemrograman ilmiah.
• Terminal-Bench 4.0 — Kimi K3 0.126 vs GPT-6.1 Sol 0.561. Selisih 43 poin ke arah sebaliknya, dan sejauh ini merupakan perbedaan terbesar dalam pasangan ini.
• Humanity's Last Exam — Kimi K3 0.469 vs GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 vs GPT-6.1 Sol 41.5; dalam hal keandalan faktual, keduanya bukan model dengan kelas yang sama.
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 vs GPT-6.1 Sol Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 vs GPT-6.1 Sol 0.860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583, 0.22 dan 0.234; Sol 0.649, 0.310 dan 0.317.
Hasil AA-LCR adalah hasil yang layak ditanggapi serius karena itulah satu-satunya angka yang bertentangan dengan narasi biaya per tugas, dan ia menunjuk pada beban kerja di mana jawaban yang tampak murah salah di kedua arah. Jika lalu lintas Anda berupa input yang sangat panjang, jawaban yang dihasilkan moderat, dan penggunaan ulang yang berat atas prefiks yang stabil — bentuk di mana verbositas tidak pernah sampai merugikan — kombinasi K3 berupa skor konteks panjang kelas atas, input gambar, dan checkpoint yang dapat diunduh lebih cocok daripada milik Sol, dan angka biaya per tugas untuk run indeks tidak berlaku bagi Anda. Itulah versi jujurnya dari "bobot terbuka layak mendapat premi": kadang model terbuka memang sekadar model yang lebih baik untuk pekerjaan itu, dan di sini ia unggul pada satu sumbu.
Perlu juga disebutkan apa kesamaan kedua kemenangan itu. K3 kuat ketika suatu tugas dapat dijawab dalam satu tindakan membaca atau menalar yang panjang, dan lemah ketika tugas itu harus dieksekusi dalam banyak langkah kecil lalu diperiksa. Kesenjangan Terminal-Bench sebesar 43 poin dan kesenjangan omniscience sebesar 22 poin adalah temuan yang sama yang dilihat dari dua sudut: eksekusi agentik yang berkelanjutan bukanlah hal yang menjadi sasaran optimasi checkpoint ini.
Aritmetika, itulah yang sebenarnya memutuskannya.
Daftar tarif K3 adalah 1,5× milik Sol pada setiap baris dan biaya terukurnya per tugas indeks yang diselesaikan adalah 2,8×, dan perbedaan antara 1,5 dan 2,8 sepenuhnya dijelaskan oleh volume token. Pengukuran dewan sendiri adalah 160 juta token keluaran untuk K3 dibandingkan 67 juta untuk Sol pada rangkaian sepuluh evaluasi yang sama. K3 menghasilkan 2,4 kali keluaran dengan 1,5 kali harga, dan 2,4 × 1,5 adalah 3,6 — angka $2,00 versus $0,72 milik dewan sedikit lebih ramah daripada rasio murninya karena kontribusi input dan cache sedikit mengimbanginya, tetapi arahnya tidak diperdebatkan.
Pemasaran Moonshoot sendiri justru bertentangan dengan hal ini dengan cara yang layak dicermati. Perusahaan mengklaim K3 menghasilkan lebih sedikit token keluaran daripada pendahulunya, dan kerja arsitektur — skema attention, desain residual — diarahkan tepat pada biaya decoding konteks panjang. Kedua hal itu bisa saja benar sementara model tersebut masih dua kali lebih bertele-tele daripada median benchmark pada suite umum. Kedua klaim itu membahas hal yang berbeda: efisiensi relatif terhadap Kimi sebelumnya, dan efisiensi relatif terhadap bidang ini. Hanya yang kedua yang menjadi dasar penagihan Anda, dan itulah yang diukur oleh dewan independen.
Caching meredamnya. Kedua tarif input yang di-cache adalah sepersepuluh dari tarif input modelnya yang tidak di-cache — $0.30 untuk K3, $0.10 untuk Sol — jadi baris cache tidak mengubah urutannya, tetapi itu berarti beban kerja yang berat permintaan dan ringan jawaban mempersempit selisihnya menjadi kira-kira rasio kartu tarif, bukan rasio tugas yang terukur. Dan klausul konteks panjang Sol berdampak sebaliknya: di atas 272.000 token input, ia menetapkan harga ulang seluruh permintaan pada $4.00 dan $15.00 dengan cache sebesar $0.20, yang merupakan satu-satunya rentang tempat kartu tarif flat K3 menang mutlak. Itu layak diketahui karena dua alasan, sebab ini juga rentang tempat skor konteks panjang K3 menjadi angka terbaik dalam perbandingan ini.

Apa nilai sebenarnya dari open weights di sini
Tiga hal, dan layak dipisahkan karena "bobot terbuka" biasanya dipakai sebagai satu argumen padahal jumlahnya tiga.
Yang pertama adalah bahwa Anda dapat pergi. Jika Moonshoot diakuisisi, mengubah lisensi untuk versi mendatang, menyatakan K3 usang, atau menaikkan harga API-nya, checkpoint yang sudah Anda unduh akan tetap berjalan. Itu bukan hal hipotetis bagi lab ini: Moonshoot menangguhkan langganan baru dalam waktu sekitar 48 jam setelah rilis sebelumnya untuk melindungi kualitas layanan bagi pelanggan berbayar yang sudah ada, yang merupakan demonstrasi nyata bahwa akses API adalah keputusan kebijakan, bukan hak milik. Tidak satu pun dari ini muncul dalam tabel biaya per tugas, dan semuanya nyata.
Yang kedua adalah bahwa Anda dapat mem-pin. Revisi tetap yang di-fine-tune, berjalan di dalam batas yang Anda kendalikan, adalah sesuatu yang dapat ditunjukkan kepada auditor dan tidak dapat disediakan oleh API. Untuk lalu lintas yang diatur regulasi, itu lebih bernilai daripada daftar tarif.
Yang ketiga — yang biasanya diasumsikan — adalah bahwa ini akan lebih murah. Ternyata tidak. Checkpoint tersebut adalah artefak FP8 berparameter 2,8 triliun, dan panduan penerapan yang dipublikasikan dibingkai seputar konfigurasi multi-akselerator, bukan satu node. Tim yang sudah mengoperasikan kelas klaster itu memiliki opsi yang nyata di sini dan kalkulasinya berubah sepenuhnya, karena biaya marjinal sebuah token menjadi listrik. Tim yang tidak mengoperasikannya sedang membandingkan tagihan API dengan pembelian modal, dan tagihan API menang dengan selisih yang lebar. Ringkasan jujurnya adalah bahwa bobot terbuka di sini memberi Anda kemampuan untuk pergi, bukan kemampuan untuk menjalankannya dengan murah.
Keduanya pada satu tombol, itulah bagian yang membuat pertukaran ini berguna.
Kimi K3 tersedia di OrcaRouter dengan harga daftar milik Moonshoot sendiri — $3,00 dan $15,00 per juta token dengan pembacaan cache $0,30, tidak berubah dari daftar harga vendor — dan GPT-6.1 Sol hadir di rute kami dengan harga OpenAI pada hari peluncuran, $2,00 dan $10,00 dengan input yang di-cache sebesar $0,10 dan tingkat 272.000 token diteruskan persis seperti yang tercantum. Tidak ada tambahan pada keduanya. Platform meneruskan harga daftar penyedia alih-alih menaikkannya, sehingga perubahan tarif Moonshoot dan perubahan tarif OpenAI sama-sama muncul di sisi kami pada hari yang sama saat muncul di sisi vendor, tanpa kontrak kedua atau reseller perantara.

Alasan yang lebih penting bagi pasangan ini dibandingkan sebagian besar pasangan lain adalah bahwa kedua model tersebut termasuk dalam mode kegagalan yang berbeda. GPT-6.1 Sol adalah model yang Anda jalankan untuk eksekusi berkelanjutan, loop alat, dan keandalan faktual; Kimi K3 adalah model yang Anda jalankan untuk input yang sangat panjang ketika Anda menginginkan skor konteks panjang terbaik dan Anda menginginkan checkpoint sebagai lindung nilai terhadap keputusan bisnis orang lain. Itu bukan pilihan yang bersaing, melainkan dua rute pada lalu lintas yang sama. Menempatkan keduanya di belakang satu endpoint, dengan failover otomatis di antara keduanya dan aturan yang memindahkan pekerjaan input panjang ke K3 dan pekerjaan eksekusi ke Sol, adalah yang mengubah "kami memiliki fallback open-weight" dari sebuah baris dalam dokumen desain menjadi sesuatu yang berfungsi pada pukul tiga pagi dalam panggilan yang sedang gagal.

Di mana masing-masing berada
• Agen terminal, pengodean berskala repo, eksekusi multi-langkah — GPT-6.1 Sol, pada selisih 43 poin di Terminal-Bench 4.0. Ini bukan selisih tipis.
• Jawaban ketika halusinasi berbiaya mahal — GPT-6.1 Sol, pada selisih 22 poin di AA-Omniscience.
• Input sangat panjang dengan jawaban yang dihasilkan singkat — Kimi K3. Skor penalaran konteks panjang terbaik dalam perbandingan ini, input gambar, dan kecenderungan bertele-tele yang tidak pernah mendapat kesempatan untuk muncul.
• Hosting mandiri atau stack inferensi yang harus bisa Anda bekukan — Kimi K3, dan hanya jika Anda sudah mengoperasikan perangkat kerasnya. Checkpoint adalah hasil yang diserahkan; ekonomi untuk menjalankannya terpisah.
• Lindung nilai terhadap vendor yang mengubah ketentuannya — Kimi K3, dan ini satu-satunya argumen yang tidak dapat dijawab oleh GPT-6.1 Sol pada harga berapa pun.
• Memilih berdasarkan kartu tarif — baik K3 maupun Sol bukanlah pilihan murah dalam perbandingan ini, dan keduanya juga bukan pilihan murah di lini GPT-6. Jika tagihan adalah masukan penentu, model yang Anda inginkan ada lebih jauh ke bawah daftar harga, bukan di tabel perbandingan ini.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
