
Intern-S2 vs Gemini 3.1 Pro: Pertarungan Multimodal yang Benar-Benar Diukur InternLM
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Sebagian besar pertarungan dalam seri ini memerlukan penggabungan klaim dua vendor. Yang ini tidak. Intern-S2, model multimodal Apache-2.0 berparameter 397 miliar yang dirilis InternLM hari ini, dan Gemini 3.1 Pro, model penalaran unggulan Google, keduanya muncul sebagai kolom terukur dalam tabel benchmark yang sama — yang menjadikannya adu langsung paling adil dalam kumpulan ini dan, bukan kebetulan, yang paling harus dipertanggungjawabkan oleh model terbuka. Gemini 3.1 Pro membaca teks, gambar, audio, dan video, memiliki konteks 1M token, dan telah dibedah habis oleh lab independen serta lalu lintas produksi sejak memasuki pratinjau pada 19 Februari 2026. Intern-S2 membaca teks, gambar, dan deret waktu, diunggah ke Hugging Face pagi ini, dan tidak memiliki skor pihak ketiga apa pun. Pada baris yang keduanya diukur, model Google menang lebih banyak daripada tidak.
Keduanya membaca gambar. Di situlah kesamaannya berakhir.
Kata "multimodal" membuat model-model ini terdengar setara. Mereka tidak setara, dan perbedaannya terletak pada apa yang masing-masing dirancang untuk dilihat.
Jalur visi Intern-S2 dilatih untuk mengonsumsi halaman mentah literatur ilmiah — gambar, persamaan, diagram struktural, tata letak — sebagai satu representasi bersama alih-alih mengurai teksnya terlebih dahulu. Tolok ukur multimodalnya bersifat ilmiah: VQA mikroskopi biologis, penginderaan jauh, tanya jawab bagan ilmiah. Ia juga menerima data deret waktu dan dapat menghasilkan perkiraan, yang merupakan jenis masukan yang hampir tidak ditangani sama sekali oleh model unggulan umum mana pun.
Multimodalitas Gemini 3.1 Pro bersifat serbaguna dan lebih luas jenisnya: teks, gambar, audio, dan video, dalam satu model, ditujukan untuk seluruh rentang tugas produksi ketika Anda mengarahkan model ke sebuah berkas dan mengajukan pertanyaan. Rekaman rapat, tangkapan layar UI, diagram dalam PDF, klip video — semuanya bisa ditangani, semuanya dengan enam bulan evaluasi publik di belakangnya.
Jika input Anda adalah gambar ilmiah, Intern-S2 memang dirancang khusus untuk itu dan memiliki angka dari vendor untuk mendukung argumennya. Jika input Anda adalah hal lain, Gemini 3.1 Pro menerima audio dan video, sedangkan Intern-S2 tidak menerima keduanya. Itu menyelesaikan sebagian besar pertanyaan "mana yang harus saya gunakan" sebelum harga atau tolok ukur masuk ke dalam pertimbangan, dan siapa pun yang mengatakan bahwa keduanya dapat dipertukarkan belum membaca daftar input.
Apa yang ditunjukkan tabel bersama, bacalah dengan jujur.
Karena InternLM melakukan benchmark terhadap keduanya, ini salah satu dari sedikit tempat di mana perbandingan langsung bersifat sah, bukan hasil rakitan. Catatan pentingnya tidak berubah dan layak disebutkan sekali: setiap angka Intern-S2 dilaporkan vendor, dijalankan oleh InternLM pada harness miliknya sendiri melalui OpenCompass, VLMEvalKit, dan AgentCompass, tanpa reproduksi independen. Angka Gemini dalam tabel itu juga berasal dari proses perbandingan yang dijalankan InternLM, meskipun Gemini memiliki rekam jejak independen yang luas di luar itu.
• Pengetahuan multimodal — Gemini 3.1 Pro 83.99 pada MMMU Pro vs Intern-S2 81.68.
• QA grafik ilmiah — Gemini 3.1 Pro 71,18 pada ChartQAPro vs Intern-S2 71,12. Seri hingga dua angka desimal.
• Penginderaan jauh — Gemini 3.1 Pro 54,27 pada XLRS-Bench vs Intern-S2 51,38.
• VQA Mikroskopi — Gemini 3.1 Pro 71,02 pada MicroVQA vs Intern-S2 69,67.
• Tugas multimodal ilmiah — Intern-S2 60,74 pada SFE vs Gemini 3.1 Pro 59,57. Satu-satunya kemenangan multimodal Intern-S2.
• Pengetahuan umum — Gemini 3.1 Pro 91,00 pada MMLU Pro vs Intern-S2 89,77.
• Matematika SMA — Gemini 3.1 Pro 94,70 pada HMMT-2026 vs Intern-S2 93,56.
• Penalaran literatur ilmiah — Intern-S2 55.71 pada Biology-Instructions vs Gemini 3.1 Pro 13.87, dan 53.95 vs 38.84 pada Mol-Instructions.
• Soal olimpiade sains — Intern-S2 87,00 pada FrontierScience-Olympiad vs Gemini 3.1 Pro 79,00.
• Penguasaan terminal — Gemini 3.1 Pro 73,80 pada TerminalBench 2.1 vs Intern-S2 64,04.
Pembacaan jujurnya: Gemini 3.1 Pro menang di baris multimodal yang luas dengan selisih tipis, Intern-S2 menang di baris literatur ilmiah yang mendalam dengan selisih yang sangat besar, dan tidak satu pun dari hasil tersebut mengejutkan mengingat data pelatihan masing-masing. Sempitnya selisih kekalahan di multimodal bisa dibilang temuan yang lebih menarik — sebuah checkpoint terbuka yang dirilis pada hari yang sama yang hanya terpaut dua poin dari model andalan tertutup berusia enam bulan pada MMMU Pro dan ChartQAPro adalah hasil yang lebih kuat bagi InternLM daripada angka-angka sainsnya yang mencolok.
Konteks, keluaran, dan pertanyaan pratinjau
Kisah input panjang terbagi dengan rapi. Gemini 3.1 Pro memiliki jendela konteks 1 juta token dengan batas keluaran 64K — cukup untuk kumpulan dokumen panjang dan jawaban yang substansial. Intern-S2 dievaluasi hingga 256K token untuk penalaran teks dan 64K untuk multimodal, serta tidak mempublikasikan batas keluaran; anggap jendela yang dapat digunakannya lebih kecil daripada milik Gemini sampai seseorang mengukurnya secara independen.
Ada satu catatan operasional di sisi Google yang harus ada dalam setiap perbandingan yang jujur. Gemini 3.1 Pro masih merupakan model pratinjau, bukan rilis GA. Model pratinjau membawa ekspektasi keandalan yang lebih rendah, dan panel tingkat galat 7 hari di halaman model adalah pengingat tetap untuk menghindari ketidakstabilan alih-alih membangun jalur kritis di atasnya. Intern-S2 adalah rilis Apache-2.0 penuh dengan bobot yang dapat Anda pin — yang, berlawanan dengan intuisi, menjadikan model terbuka yang baru ini lebih stabil secara operasional di antara keduanya dalam arti yang paling penting: tidak ada yang dapat mengubahnya di belakang Anda.
• Konteks — Intern-S2 256K teks / 64K multimodal dievaluasi terhadap Gemini 3.1 Pro 1M token.
• Input — Intern-S2 teks, gambar, deret waktu vs Gemini 3.1 Pro teks, gambar, audio, video.
• Bobot — Intern-S2 Apache-2.0, dapat diunduh vs Gemini 3.1 Pro tertutup.
• Kematangan — Intern-S2 baru berusia beberapa jam, belum ada skor independen vs Gemini 3.1 Pro preview sejak Februari 2026, diuji secara intensif dan independen.
• Harga — Intern-S2 tidak memiliki daftar tarif publik; self-host atau API Intern resmi vs Gemini 3.1 Pro $2,00 input / $12,00 output per juta, naik menjadi $4,00/$18,00 di atas 200K token input.

Harga dan di mana masing-masing berada
Gemini 3.1 Pro menetapkan tarif $2.00 per juta token input dan $12.00 per juta token output pada tier standar, lalu naik menjadi $4.00/$18.00 begitu sebuah permintaan melewati 200K token input — premi konteks panjang yang benar-benar terasa tepat saat Anda memakai jendela 1M yang menjadi alasan memilihnya. Model ini dapat dirutekan di OrcaRouter dengan harga daftar yang sama, diteruskan dengan markup 0%, pada sebuah kunci yang juga membawa 200+ model lain; pass-through di sini penting karena perubahan harga Google langsung berdampak di sisi kami pada hari yang sama, bukan setelah satu siklus penyesuaian harga. DSL routing adalah bagian yang berguna untuk adu kasus khusus ini: Anda bisa mengirim pekerjaan gambar-dan-video ke Gemini 3.1 Pro dan batch dokumen ilmiah ke Intern-S2 yang di-host sendiri, lalu menjaga keduanya di balik satu endpoint tanpa kontrak kedua atau perubahan kode.
Intern-S2 tidak memiliki harga API publik. Self-hosting bobot Apache-2.0 adalah jalur yang paling mungkin diambil sebagian besar tim, dan dengan 403B parameter itu merupakan komitmen perangkat keras yang nyata. API Intern resmi hadir untuk tim yang lebih memilih tidak menjalankan GPU, tetapi tanpa kartu tarif publik, perbandingan biaya dengan $2/$12 milik Gemini bukanlah sesuatu yang dapat dilakukan di atas kertas — Anda harus meminta kuota dan melakukan perhitungan sendiri.

Panggilan
Pilih Gemini 3.1 Pro jika Anda memerlukan model multimodal umum yang mendukung audio dan video, menampung satu juta token, telah memiliki validasi independen selama berbulan-bulan, dan dapat disewa per token saat ini. Model ini lebih terbukti dan kemampuannya lebih luas, serta label pratinjau merupakan catatan tentang keandalan, bukan tentang kemampuan.
Pilih Intern-S2 jika input multimodal Anda bersifat ilmiah dan data Anda tidak boleh meninggalkan infrastruktur Anda. Hanya itu satu-satunya dari keduanya yang membaca halaman literatur mentah secara native, membuat perkiraan dari sinyal deret waktu, dan dapat di-fine-tune pada data eksperimen eksklusif di bawah lisensi permisif. Terimalah bahwa Anda adalah orang pertama yang menjalankannya, dan bahwa tabel tolok ukur yang mendukungnya ditulis oleh orang-orang yang membuatnya.

Tidak ada model yang menang secara mutlak, dan tabel membuktikannya lebih baik daripada yang bisa dilakukan sebuah putusan. Yang satu adalah generalis yang kebetulan bagus dalam sains; yang lain adalah instrumen ilmiah yang kebetulan kompetitif dalam pekerjaan multimodal umum — dan pada rilis terbuka di hari yang sama, "kompetitif" adalah hasil yang lebih mengejutkan.
Untuk memegang kedua sisi perbandingan ini tanpa kontrak kedua: satu kunci API yang mencakup lebih dari 200 model menempatkan model unggulan multimodal tertutup dan semua alternatif di balik satu endpoint, sehingga Anda dapat mengarahkan pekerjaan gambar dan video ke satu jalur dan batch dokumen ke jalur lainnya.
