Kartu hero yang dihasilkan yang membandingkan Intern-S2-397B dan Grok 4.6, menampilkan di sebelah kiri model ilmiah berbobot terbuka dengan tombol alih penalaran berlabel enable_thinking dan bentuk gelombang deret waktu, dan di sebelah kanan titik akhir cloud tertutup dengan dial upaya penalaran dan ikon alat sisi server, dilabeli dengan kontras antara kendali self-hosted Apache-2.0 dan API terukur $2 / $6, dengan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Intern-S2-397B vs Grok 4.6: Siapa yang Berhak Memutar Kenop

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Intern-S2-397B dan Grok 4.6 dirilis berselang sekitar satu bulan dan menjawab pertanyaan mendasar yang sama dengan cara yang berlawanan: siapa yang berhak mengendalikan penalaran. Grok 4.6, model unggulan xAI yang mulai aktif pada 12 Agustus 2026, menjual kepada Anda sebuah kenop — kontrol upaya penalaran yang dapat dikonfigurasi pada API tertutup dengan harga $2.00 per juta token input dan $6.00 per juta token output, dengan jendela 500.000 token dan alat sisi server xAI ditagih tambahan. Intern-S2-397B, model multimodal ilmiah 403 miliar parameter yang dirilis tim InternLM Shanghai AI Laboratory di bawah Apache-2.0 pada 13 September, menyerahkan seluruh mesin kepada Anda — bobot, toggle berpikir, jalur visi, head deret waktu — dan mengharapkan Anda menjalankannya sendiri. Yang satu disewa dengan kenop; yang lain dimiliki sepenuhnya. Perbandingan yang penting di sini bukanlah mana yang mendapat skor lebih tinggi pada tabel benchmark; melainkan jenis kontrol apa yang sebenarnya dibutuhkan beban kerja Anda, dan berapa biaya masing-masing jenis.

Dua dial yang berbeda

Cara paling bersih untuk membedakan keduanya adalah dengan melihat di mana kontrol penalaran berada. Grok 4.6 mengekspos pengaturan upaya penalaran melalui API x​AI, dan di sekitarnya terdapat rangkaian alat sisi server — pemanggilan fungsi, pencarian web, pencarian X, eksekusi kode — yang dioperasikan dan ditagih secara terpisah oleh x​AI. Anda menyetel upaya, Anda merangkai alat yang diberikannya, dan Anda tidak pernah menyentuh bobot. Perilaku model adalah properti x​AI dan masalah x​AI; tuas Anda adalah parameter dalam permintaan.

Intern-S2-397B memberi Anda rangkaian tuas yang berbeda, dan letaknya lebih rendah di dalam stack. Thinking aktif secara default dan Anda mematikannya per permintaan dengan enable_thinking=False. Karena model ini berlisensi Apache-2.0, Anda juga dapat mengambil bobotnya dan melakukan fine-tuning pada perilaku penalarannya sendiri menggunakan data Anda, lalu menyajikan hasilnya di LMDeploy, vLLM, atau SGLang. Permukaan inputnya lebih luas daripada API teks-dan-gambar: ia menerima sinyal deret waktu dan menghasilkan prakiraan, kemampuan yang saat ini hanya terhubung melalui LMDeploy, dan ia dilatih untuk kerja agen berhorizon panjang di lingkungan sandbox. Trade-off-nya sama jelasnya — tingkat kendali seperti itu hanya bermakna jika Anda siap mengoperasikan perangkat keras dan stack penyajian yang menyertainya.

• Kontrol penalaran — Grok 4.6: dial upaya penalaran pada API tertutup vs Intern-S2-397B: toggle enable_thinking plus kontrol penuh pada tingkat bobot di bawah Apache-2.0.

• Alat — Grok 4.6: pencarian web sisi server, pencarian X, dan eksekusi kode dari xAI, ditagih terpisah vs Intern-S2-397B: pemanggilan alat yang Anda sambungkan sendiri, plus jalur peramalan deret waktu melalui LMDeploy.

• Masukan — Grok 4.6: teks, gambar, berkas vs Intern-S2-397B: teks, gambar, deret waktu.

• Konteks — Grok 4.6: 500,000 token vs Intern-S2-397B: penalaran teks 256K, multimodal 64K, kedua angka tersebut berasal dari kartu model.

• Harga — Grok 4.6: $2,00 / $6,00 per 1 juta, bertingkat menjadi $4,00 / $12,00 setelah 200K token vs Intern-S2-397B: tidak ada daftar tarif; self-host atau API Intern resmi.

Apa yang sebenarnya dicakup oleh angka-angka itu

Setiap angka Intern-S2-397B di bawah ini adalah milik InternLM sendiri, dijalankan melalui OpenCompass, VLMEvalKit, dan AgentCompass serta diterbitkan bersama bobotnya tanpa reproduksi independen. Angka Grok 4.6 adalah hal yang berbeda: angka-angka itu terakumulasi melalui arena publik dan Artificial Analysis setelah model tersebut diluncurkan, sehingga membawa label pihak ketiga.

Di sisi yang diukur secara independen, Grok 4.6 berada di 44 pada Artificial Analysis Intelligence Index saat ini, dengan GPQA Diamond 94,9, Humanity's Last Exam 61,0, dan skor coding 76,8, dan Artificial Analysis menempatkan angka TerminalBench 2.1-nya di sekitar 80,3. Di sisi vendor, kartu Intern-S2-397B melaporkan 89,77 pada MMLU Pro, 93,56 pada HMMT-2026, 81,68 pada MMMU Pro, dan 68,54 pada SWE-bench-Pro, di samping baris-baris ilmiah yang membuatnya tampak seperti spesies berbeda: 55,71 pada Biology-Instructions, 63,28 pada SciReasoner 1.5, 53,95 pada Mol-Instructions, 62,35 pada MolecularIQ. Satu angka dalam tabel vendor yang seharusnya membuat pembangun agen bergidik adalah TerminalBench 2.1 di 64,04 — angka yang menurut para pembuat model itu sendiri kalah dengan selisih besar dari generasi tertutup yang lebih tua, tepat di jalur kerja terminal tempat model frontier sewaan seperti Grok 4.6 paling kuat.

Bacalah pembagian itu sebagai potret, bukan peringkat. Intern-S2-397B adalah spesialis ilmiah yang juga merupakan model umum yang kompeten; Grok 4.6 adalah generalis yang hanya memiliki minat sekilas terhadap sains. Baris-baris ilmiah yang timpang memang dapat diduga — tidak ada model unggulan generalis yang dilatih terlebih dahulu pada halaman mentah literatur ilmiah dengan gambar, tata letak, dan notasi simbolik secara bersamaan, dan itulah tepatnya paradigma yang menjadi dasar pembangunan Intern-S2-397B. Tidak ada apa pun dalam kedua basis bukti tersebut yang mendukung "Intern-S2-397B sama baiknya dengan Grok 4.6 dalam penalaran arbitrer," dan tidak ada apa pun dalam bukti Grok 4.6 yang menunjukkan bahwa model itu disetel untuk analisis sekuens multi-omik.

Harga dari kendali

Grok 4.6 memiliki harga yang bisa Anda masukkan ke spreadsheet: $2.00 per juta token input dan $6.00 per juta token output, dengan tarif naik menjadi $4.00 / $12.00 begitu prompt melewati 200.000 token, dan tier prioritas opsional untuk respons yang lebih cepat. Model ini tersedia melalui OrcaRouter dengan harga daftar x​AI yang diteruskan pada markup 0%, sehingga perubahan tarif di x​AI sampai di sini pada hari yang sama tanpa selisih perantara — dial yang Anda sewa tetap dihargai sesuai cara vendor menetapkan harganya.

Intern-S2-397B sama sekali tidak memiliki tarif per token yang dipublikasikan. Kartu modelnya merujuk ke API Intern resmi, tetapi perhitungan ekonomi yang sebenarnya ingin dibandingkan orang adalah opsi self-host: checkpoint berparameter 403B, sekitar 807 GB bobot yang tersebar di 188 shard dalam BF16, sehingga membutuhkan node multi-GPU yang serius, dengan build FP8 yang kira-kira memangkas separuh jejaknya. Jika Anda sudah memiliki kapasitas itu, biaya marginal untuk kueri ilmiah berikutnya mendekati biaya listrik, dan itulah inti dari posisi Apache-2.0. Jika Anda tidak memilikinya, model "gratis" itu adalah pilot belanja modal, bukan pos anggaran.

Yang didapat dari router dalam perbandingan spesifik ini adalah sambungannya, bukan harganya. Grok 4.6 menggunakan kunci yang sudah Anda miliki untuk lalu lintas produksi umum; Intern-S2-397B tidak dirutekan di OrcaRouter — ini adalah checkpoint yang benar-benar baru, dan jalur Anda ke sana adalah API milik vendor sendiri atau deployment yang dihosting sendiri. Rutekan penalaran umum yang sensitif terhadap latensi ke model berbayar per pemakaian, pertahankan pekerjaan batch ilmiah pada model yang Anda jalankan, dan biarkan failover otomatis melindungi Anda saat endpoint salah satu sisi tidak sehat. Batas di antara keduanya menjadi aturan perutean, bukan integrasi kedua.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

Mana yang harus dipilih

Pilih Grok 4.6 ketika pekerjaannya bersifat umum, penalarannya harus kembali dengan cepat dan benar, dan Anda tidak ingin memiliki stack yang menghasilkannya. Jendela 500K-nya, GPQA Diamond yang terukur pada 94,9, dan rangkaian alatnya adalah fitur produksi, dan meteran $2/$6 adalah yang Anda bayar untuk tidak mengoperasikan apa pun.

Pilih Intern-S2-397B ketika inputnya bersifat ilmiah — makalah yang padat gambar, diagram molekul, sinyal deret waktu — dan ketika penalaran harus dilakukan pada data yang tidak boleh keluar dari lingkungan Anda, atau pada perilaku yang ingin Anda fine-tune sendiri. Apache-2.0 memungkinkan hal itu; tidak ada API sewaan yang bisa. Anggarkan untuk perangkat kerasnya, jangan berharap ada papan skor independen untuk sementara waktu, dan anggap setiap angka di kartunya sebagai klaim sampai seseorang di luar InternLM mereproduksi satu angka pun.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.