Kartu hero yang dihasilkan yang membandingkan Intern-S2 dan Gemini 3.1 Pro, menampilkan halaman figur ilmiah dan bagan yang memberi masukan ke model multimodal di sebelah kiri serta empat ikon masukan untuk gambar, audio, video, dan teks di sekitar kartu API tertutup di sebelah kanan, diberi label dengan kontras antara multimodalitas ilmiah Apache-2.0 dan model unggulan multimodal umum berkonteks 1M yang tertutup, dengan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Intern-S2 vs Gemini 3.1 Pro: Pertarungan Multimodal yang Benar-Benar Diukur InternLM

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sebagian besar pertarungan dalam seri ini memerlukan penggabungan klaim dua vendor. Yang ini tidak. Intern-S2, model multimodal Apache-2.0 berparameter 397 miliar yang dirilis InternLM hari ini, dan Gemini 3.1 Pro, model penalaran unggulan Google, keduanya muncul sebagai kolom terukur dalam tabel benchmark yang sama — yang menjadikannya adu langsung paling adil dalam kumpulan ini dan, bukan kebetulan, yang paling harus dipertanggungjawabkan oleh model terbuka. Gemini 3.1 Pro membaca teks, gambar, audio, dan video, memiliki konteks 1M token, dan telah dibedah habis oleh lab independen serta lalu lintas produksi sejak memasuki pratinjau pada 19 Februari 2026. Intern-S2 membaca teks, gambar, dan deret waktu, diunggah ke Hugging Face pagi ini, dan tidak memiliki skor pihak ketiga apa pun. Pada baris yang keduanya diukur, model Google menang lebih banyak daripada tidak.

Keduanya membaca gambar. Di situlah kesamaannya berakhir.

Kata "multimodal" membuat model-model ini terdengar setara. Mereka tidak setara, dan perbedaannya terletak pada apa yang masing-masing dirancang untuk dilihat.

Jalur visi Intern-S2 dilatih untuk mengonsumsi halaman mentah literatur ilmiah — gambar, persamaan, diagram struktural, tata letak — sebagai satu representasi bersama alih-alih mengurai teksnya terlebih dahulu. Tolok ukur multimodalnya bersifat ilmiah: VQA mikroskopi biologis, penginderaan jauh, tanya jawab bagan ilmiah. Ia juga menerima data deret waktu dan dapat menghasilkan perkiraan, yang merupakan jenis masukan yang hampir tidak ditangani sama sekali oleh model unggulan umum mana pun.

Multimodalitas Gemini 3.1 Pro bersifat serbaguna dan lebih luas jenisnya: teks, gambar, audio, dan video, dalam satu model, ditujukan untuk seluruh rentang tugas produksi ketika Anda mengarahkan model ke sebuah berkas dan mengajukan pertanyaan. Rekaman rapat, tangkapan layar UI, diagram dalam PDF, klip video — semuanya bisa ditangani, semuanya dengan enam bulan evaluasi publik di belakangnya.

Jika input Anda adalah gambar ilmiah, Intern-S2 memang dirancang khusus untuk itu dan memiliki angka dari vendor untuk mendukung argumennya. Jika input Anda adalah hal lain, Gemini 3.1 Pro menerima audio dan video, sedangkan Intern-S2 tidak menerima keduanya. Itu menyelesaikan sebagian besar pertanyaan "mana yang harus saya gunakan" sebelum harga atau tolok ukur masuk ke dalam pertimbangan, dan siapa pun yang mengatakan bahwa keduanya dapat dipertukarkan belum membaca daftar input.

Apa yang ditunjukkan tabel bersama, bacalah dengan jujur.

Karena InternLM melakukan benchmark terhadap keduanya, ini salah satu dari sedikit tempat di mana perbandingan langsung bersifat sah, bukan hasil rakitan. Catatan pentingnya tidak berubah dan layak disebutkan sekali: setiap angka Intern-S2 dilaporkan vendor, dijalankan oleh InternLM pada harness miliknya sendiri melalui OpenCompass, VLMEvalKit, dan AgentCompass, tanpa reproduksi independen. Angka Gemin​i dalam tabel itu juga berasal dari proses perbandingan yang dijalankan InternLM, meskipun Gemin​i memiliki rekam jejak independen yang luas di luar itu.

• Pengetahuan multimodal — Gemini 3.1 Pro 83.99 pada MMMU Pro vs Intern-S2 81.68.

• QA grafik ilmiah — Gemini 3.1 Pro 71,18 pada ChartQAPro vs Intern-S2 71,12. Seri hingga dua angka desimal.

• Penginderaan jauh — Gemini 3.1 Pro 54,27 pada XLRS-Bench vs Intern-S2 51,38.

• VQA Mikroskopi — Gemini 3.1 Pro 71,02 pada MicroVQA vs Intern-S2 69,67.

• Tugas multimodal ilmiah — Intern-S2 60,74 pada SFE vs Gemini 3.1 Pro 59,57. Satu-satunya kemenangan multimodal Intern-S2.

• Pengetahuan umum — Gemini 3.1 Pro 91,00 pada MMLU Pro vs Intern-S2 89,77.

• Matematika SMA — Gemini 3.1 Pro 94,70 pada HMMT-2026 vs Intern-S2 93,56.

• Penalaran literatur ilmiah — Intern-S2 55.71 pada Biology-Instructions vs Gemini 3.1 Pro 13.87, dan 53.95 vs 38.84 pada Mol-Instructions.

• Soal olimpiade sains — Intern-S2 87,00 pada FrontierScience-Olympiad vs Gemini 3.1 Pro 79,00.

• Penguasaan terminal — Gemini 3.1 Pro 73,80 pada TerminalBench 2.1 vs Intern-S2 64,04.

Pembacaan jujurnya: Gemini 3.1 Pro menang di baris multimodal yang luas dengan selisih tipis, Intern-S2 menang di baris literatur ilmiah yang mendalam dengan selisih yang sangat besar, dan tidak satu pun dari hasil tersebut mengejutkan mengingat data pelatihan masing-masing. Sempitnya selisih kekalahan di multimodal bisa dibilang temuan yang lebih menarik — sebuah checkpoint terbuka yang dirilis pada hari yang sama yang hanya terpaut dua poin dari model andalan tertutup berusia enam bulan pada MMMU Pro dan ChartQAPro adalah hasil yang lebih kuat bagi InternLM daripada angka-angka sainsnya yang mencolok.

Konteks, keluaran, dan pertanyaan pratinjau

Kisah input panjang terbagi dengan rapi. Gemini 3.1 Pro memiliki jendela konteks 1 juta token dengan batas keluaran 64K — cukup untuk kumpulan dokumen panjang dan jawaban yang substansial. Intern-S2 dievaluasi hingga 256K token untuk penalaran teks dan 64K untuk multimodal, serta tidak mempublikasikan batas keluaran; anggap jendela yang dapat digunakannya lebih kecil daripada milik Gemini sampai seseorang mengukurnya secara independen.

Ada satu catatan operasional di sisi Goog​le yang harus ada dalam setiap perbandingan yang jujur. Gemini 3.1 Pro masih merupakan model pratinjau, bukan rilis GA. Model pratinjau membawa ekspektasi keandalan yang lebih rendah, dan panel tingkat galat 7 hari di halaman model adalah pengingat tetap untuk menghindari ketidakstabilan alih-alih membangun jalur kritis di atasnya. Intern-S2 adalah rilis Apache-2.0 penuh dengan bobot yang dapat Anda pin — yang, berlawanan dengan intuisi, menjadikan model terbuka yang baru ini lebih stabil secara operasional di antara keduanya dalam arti yang paling penting: tidak ada yang dapat mengubahnya di belakang Anda.

• Konteks — Intern-S2 256K teks / 64K multimodal dievaluasi terhadap Gemini 3.1 Pro 1M token.

• Input — Intern-S2 teks, gambar, deret waktu vs Gemini 3.1 Pro teks, gambar, audio, video.

• Bobot — Intern-S2 Apache-2.0, dapat diunduh vs Gemini 3.1 Pro tertutup.

• Kematangan — Intern-S2 baru berusia beberapa jam, belum ada skor independen vs Gemini 3.1 Pro preview sejak Februari 2026, diuji secara intensif dan independen.

• Harga — Intern-S2 tidak memiliki daftar tarif publik; self-host atau API Intern resmi vs Gemini 3.1 Pro $2,00 input / $12,00 output per juta, naik menjadi $4,00/$18,00 di atas 200K token input.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Harga dan di mana masing-masing berada

Gemini 3.1 Pro menetapkan tarif $2.00 per juta token input dan $12.00 per juta token output pada tier standar, lalu naik menjadi $4.00/$18.00 begitu sebuah permintaan melewati 200K token input — premi konteks panjang yang benar-benar terasa tepat saat Anda memakai jendela 1M yang menjadi alasan memilihnya. Model ini dapat dirutekan di OrcaRouter dengan harga daftar yang sama, diteruskan dengan markup 0%, pada sebuah kunci yang juga membawa 200+ model lain; pass-through di sini penting karena perubahan harga Google langsung berdampak di sisi kami pada hari yang sama, bukan setelah satu siklus penyesuaian harga. DSL routing adalah bagian yang berguna untuk adu kasus khusus ini: Anda bisa mengirim pekerjaan gambar-dan-video ke Gemini 3.1 Pro dan batch dokumen ilmiah ke Intern-S2 yang di-host sendiri, lalu menjaga keduanya di balik satu endpoint tanpa kontrak kedua atau perubahan kode.

Intern-S2 tidak memiliki harga API publik. Self-hosting bobot Apache-2.0 adalah jalur yang paling mungkin diambil sebagian besar tim, dan dengan 403B parameter itu merupakan komitmen perangkat keras yang nyata. API Intern resmi hadir untuk tim yang lebih memilih tidak menjalankan GPU, tetapi tanpa kartu tarif publik, perbandingan biaya dengan $2/$12 milik Gemini bukanlah sesuatu yang dapat dilakukan di atas kertas — Anda harus meminta kuota dan melakukan perhitungan sendiri.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

Panggilan

Pilih Gemini 3.1 Pro jika Anda memerlukan model multimodal umum yang mendukung audio dan video, menampung satu juta token, telah memiliki validasi independen selama berbulan-bulan, dan dapat disewa per token saat ini. Model ini lebih terbukti dan kemampuannya lebih luas, serta label pratinjau merupakan catatan tentang keandalan, bukan tentang kemampuan.

Pilih Intern-S2 jika input multimodal Anda bersifat ilmiah dan data Anda tidak boleh meninggalkan infrastruktur Anda. Hanya itu satu-satunya dari keduanya yang membaca halaman literatur mentah secara native, membuat perkiraan dari sinyal deret waktu, dan dapat di-fine-tune pada data eksperimen eksklusif di bawah lisensi permisif. Terimalah bahwa Anda adalah orang pertama yang menjalankannya, dan bahwa tabel tolok ukur yang mendukungnya ditulis oleh orang-orang yang membuatnya.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Tidak ada model yang menang secara mutlak, dan tabel membuktikannya lebih baik daripada yang bisa dilakukan sebuah putusan. Yang satu adalah generalis yang kebetulan bagus dalam sains; yang lain adalah instrumen ilmiah yang kebetulan kompetitif dalam pekerjaan multimodal umum — dan pada rilis terbuka di hari yang sama, "kompetitif" adalah hasil yang lebih mengejutkan.

Untuk memegang kedua sisi perbandingan ini tanpa kontrak kedua: satu kunci API yang mencakup lebih dari 200 model menempatkan model unggulan multimodal tertutup dan semua alternatif di balik satu endpoint, sehingga Anda dapat mengarahkan pekerjaan gambar dan video ke satu jalur dan batch dokumen ke jalur lainnya.