
Intern-S2-397B vs Kimi K3: Model Sains 397B dan Raksasa Penalaran 2,8T
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Intern-S2-397B dan Kimi K3 berada di sisi berlawanan dari garis bobot terbuka yang akan menentukan sisa tahun 2026: spesialis ilmiah yang dapat diunduh versus generalis konteks panjang yang terbukti secara independen. Intern-S2-397B adalah model multimodal ilmiah dengan 403 miliar parameter yang dirilis InternLM di bawah Apache-2.0 pada 13 September 2026 — tanpa daftar tarif, tanpa skor independen, dan jalur visi yang dilatih pada halaman mentah literatur ilmiah. Kimi K3 adalah model unggulan mixture-of-experts milik Moonshot AI dengan 2,8 triliun parameter yang diluncurkan pada Juli 2026 dengan harga $3,00 per juta token masukan dan $15,00 per juta token keluaran, membuka bobotnya pada 27 Juli di bawah lisensi Modified MIT, dan telah melalui enam minggu evaluasi independen. Hal yang tidak biasa dari pertarungan ini adalah kedua model memiliki ambisi jangka panjang yang sama — terus mengerjakan tugas besar yang berantakan — dan menyelesaikannya ke arah yang berlawanan.
Keduanya ambisius, mekanisme yang berlawanan
Ambisi itu sama: setiap model ingin menjadi hal yang terus berjalan ketika tugasnya panjang. Mereka mencapainya dengan cara yang berbeda, dan perbedaannya bersifat arsitektural.
Jawaban Kimi K3 adalah konteks. Jendela 1.048.576 token pada input maupun output berarti seluruh repositori, seluruh ruang data, atau loop agen lima puluh langkah dapat berada dalam satu percakapan. Tumpukan inferensi Mooncake milik Moonshot dilaporkan mempertahankan tingkat cache-hit di atas 90% pada beban kerja pengodean, yang membuat harga output $15 per juta dapat bertahan dalam praktik. Kimi K3 mengekspos kontrol reasoning_effort tingkat atas dan tidak menerima parameter sampling apa pun, bernalar pada kedalaman maksimum secara default, dan mengharapkan Anda memutar ulang reasoning_content dan tool_calls sebelumnya secara verbatim dalam loop alat multi-turn atau kualitas akan menurun.
Jawaban Intern-S2-397B adalah spesialisasi plus kontrol tingkat bobot. Konteksnya — penalaran teks 256K dan multimodal 64K, keduanya angka dari kartu model — adalah kategori jendela yang berbeda, cukup untuk makalah substansial atau sesi riset panjang tetapi tidak untuk kumpulan kerja sejuta token. Yang ditawarkannya sebagai gantinya adalah jalur visi yang membaca literatur ilmiah secara native — gambar, tata letak, notasi simbolik, dan prosa sekaligus — serta masukan deret waktu yang menghasilkan prakiraan, di samping kemampuan berpikir yang aktif secara default dan dapat dialihkan per permintaan. Jika tugas panjang Anda bersifat ilmiah, model ini dilatih tepat untuk itu; jika tugas panjang Anda adalah basis kode, ini bukan model dengan jendela sejuta token untuk itu.
• Konteks — Kimi K3: 1.048.576 token masuk dan keluar vs Intern-S2-397B: 256K teks / 64K multimodal.
• Skala — Kimi K3: total 2,8T, ~104B aktif per token vs Intern-S2-397B: total 403B, 512 pakar / 10 aktif.
• Permukaan kontrol — Kimi K3: dial reasoning_effort, tanpa parameter sampling vs Intern-S2-397B: toggle enable_thinking plus kontrol penuh tingkat bobot di bawah Apache-2.0.
• Input — Kimi K3: teks, gambar vs Intern-S2-397B: teks, gambar, deret waktu.
• Bobot — Kimi K3: terbuka di bawah Modified MIT (27 Juli) vs Intern-S2-397B: terbuka di bawah Apache-2.0 (13 September).
• Bukti independen — Kimi K3: enam minggu skor pihak ketiga vs Intern-S2-397B: belum ada.
Asimetri bukti adalah perbedaan yang sesungguhnya
Kimi K3 telah melewati uji independen yang ketat dan keluar dengan skor yang bisa Anda jadikan pijakan. Artificial Analysis menempatkannya di pertengahan 40-an pada Intelligence Index saat ini, dengan GPQA Diamond di awal 90-an, HLE di pertengahan 40-an, recall konteks panjang yang diukur secara independen sebesar 88,7, dan skor coding di pertengahan 70-an. Model ini memegang posisi teratas di Frontend Code Arena (Elo di kisaran 1670-an) dan mencetak 91,2 pada BrowseComp, angka tertinggi pada benchmark pengambilan berhorizon panjang tersebut — meskipun Moonshot sendiri memperingatkan bahwa K3 "masih tertinggal dari model proprietary paling kuat," dan beberapa barisnya pada hari peluncuran masih dilaporkan vendor.
Bukti Intern-S2-397B adalah tabel peluncurannya sendiri, dijalankan melalui OpenCompass, VLMEvalKit, dan AgentCompass, yang diterbitkan beberapa jam sebelum Anda membaca ini. Setiap angka berasal dari vendor sendiri dan belum direproduksi: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54, dan TerminalBench 2.1 pada 64.04 — angka yang ditunjukkan kartu itu kalah dari generasi tertutup yang lebih tua dengan selisih lebar. Baris-baris ilmiahnya adalah angka yang memperkuat argumen seorang spesialis: 55.71 pada Biology-Instructions, 63.28 pada SciReasoner 1.5, 53.95 pada Mol-Instructions, 62.35 pada MolecularIQ. Kedua basis bukti tidak bersentuhan, itulah sebabnya perumusan yang jujur untuk pertarungan ini bukan "siapa yang menang" melainkan "jenis bukti seperti apa yang dibutuhkan beban kerja Anda."

Berapa biaya masing-masing, edisi open-weights
Kedua model memiliki bobot terbuka, yang mengubah pertanyaan biaya dari kisah biasa terukur-versus-gratis menjadi perbandingan dua proposisi hosting. Kimi K3 memiliki harga API yang dipublikasikan — $3.00 / $15.00 per juta token pada daftar Moonshot, diteruskan di OrcaRouter dengan markup 0%, dengan harga cache-read di atasnya — dan juga dapat diunduh: rilis bobot terbuka 96-shard yang membutuhkan perangkat keras kelas supernode, 64 atau lebih akselerator, untuk melayani. Audiens praktis untuk K3 yang di-host sendiri adalah tim dengan anggaran pusat data. Intern-S2-397B tidak memiliki harga API yang dipublikasikan sama sekali; kartu model menunjuk ke API Intern resmi, dan ekonomi sebenarnya adalah yang di-host sendiri: sekitar 807 GB bobot di 188 shard dalam BF16, node multi-GPU yang serius, dengan build FP8 memangkas jejak sekitar setengahnya.
Kedua model dapat dipanggil melalui sambungan yang sama jika Anda melakukan perutean: Kimi K3 ada di OrcaRouter pada harga daftar Moonshot dengan markup 0%, sementara Intern-S2-397B tidak dirutekan — checkpoint Apache-2.0 yang baru, jalur Anda ke sana adalah API milik vendor sendiri atau deployment yang dihosting sendiri. Nilai perutean dalam perbandingan ini adalah menjaga lalu lintas generalis berkonteks panjang tetap pada kunci yang sudah Anda miliki dan pekerjaan batch ilmiah pada model yang Anda jalankan, dengan failover otomatis di antara keduanya. DSL membuat batas itu menjadi konfigurasi, bukan integrasi kedua.

Putusan
Pilih Kimi K3 ketika pekerjaannya adalah pekerjaan generalis berkonteks panjang — pengodean seluruh repositori, loop agen berkelanjutan, pekerjaan pengetahuan yang membutuhkan satu juta token memori kerja — dan Anda menginginkan papan skor independen di baliknya. Ini adalah model dengan bukti yang lebih kuat dalam segala hal, bobot terbukanya nyata (Modified MIT, 27 Juli), dan jika Anda sudah mengoperasikan infrastruktur kelas supernode, ekonomi per token dengan caching menguntungkan.
Pilih Intern-S2-397B ketika tugasnya bersifat ilmiah: makalah yang padat gambar, diagram molekul, literatur hasil pemindaian, sinyal deret waktu, dan data yang harus tetap berada di dalam perimeter Anda atau bobot yang ingin Anda fine-tune pada hasil proprietary. Apache-2.0 memungkinkan hal itu, tidak ada API sewaan yang bisa, dan baris-baris ilmiah di kartu itu adalah spesies yang berbeda dari apa yang pernah di-tuning untuk model generalis. Anggarkan perangkat kerasnya, jalankan evaluasi Anda sendiri, dan perlakukan setiap angka yang diterbitkan tentangnya sebagai klaim sampai seseorang di luar InternLM mereproduksi satu saja.

