Intern-S2-Mobius-1
Engineering & Research

Intern-S2-Mobius: Model 35B yang Memisahkan Pengetahuan dari Penalaran

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tim InternLM dari Laboratorium AI Shanghai telah diam-diam menerbitkan Intern-S2-Mobius, model fondasi open-weight 35B yang melakukan sesuatu yang hampir tidak dilakukan model lain yang dirilis: ia berhenti menyimpan pengetahuan di dalam lapisan-lapisannya. Alih-alih susunan Transformer standar — di mana setiap lapisan membawa blok feed-forward sendiri yang penuh dengan fakta yang dihafal — Mobius menarik semua pengetahuan itu keluar ke dalam satu Memori global yang digunakan bersama dan memungkinkan sejumlah kecil Reasoner untuk menanyakannya berulang kali. Manfaat yang diklaim bukanlah skor benchmark yang lebih tinggi. Melainkan kecepatan: jawaban yang sama dalam kira-kira sepertiga hingga seperlima token penalaran, dan hingga 4,6x throughput permintaan. Panduan ini menjelaskan apa sebenarnya Mobius itu, apa yang diungkapkan file konfigurasinya yang tidak diungkapkan oleh kartu model, apa yang ditunjukkan oleh benchmark yang dipublikasikan baris demi baris — termasuk dua baris yang kalah — di mana klaim "4x lebih cepat" berlaku dan di mana klaim itu menguap, dan siapa yang secara realistis harus peduli.

Catatan akurasi: setiap angka di bawah ini berasal dari kartu model InternLM sendiri, angka kinerja dan efisiensi yang dipublikasikannya, panduan penerapannya, serta file konfigurasi model di Hugging Face. Belum ada evaluasi pihak ketiga yang independen terhadap Intern-S2-Mobius pada saat tulisan ini dibuat — model ini tidak tercantum di papan peringkat independen mana pun, tidak digunakan oleh penyedia inferensi mana pun, dan penghitung unduhannya masih nol. Anggaplah semua angka perbandingan sebagai laporan vendor sampai ada pihak yang mereproduksinya. Spesifikasi dan kode untuk model baru seperti ini cepat berubah; verifikasi sebelum Anda membangun.

TL;DR. Intern-S2-Mobius adalah model fondasi multimodal dengan 35 miliar parameter, berlisensi Apache 2.0, yang dipra-latih secara berkelanjutan dari Qwen3.5-35B, lalu dilatih lanjut dengan SFT dan pembelajaran penguatan. Kebaruannya bersifat arsitektural: desain Mobius-v0 menggantikan penyimpanan pengetahuan feed-forward yang terikat lapisan dengan satu Memori global bersama berisi 2,560 pakar, yang diakses oleh empat blok Reasoner bertumpuk yang dapat menjangkau pengetahuan di luar kedalaman mereka sendiri (Backward Residual Connection) dan menyempurnakan hidden state melalui iterasi laten berulang sebelum decoding (Dynamic Latent Reasoning). Pada evaluasi InternLM sendiri, model ini mengungguli baseline Qwen3.5-35B yang menjadi asalnya pada tujuh dari sembilan tolok ukur umum (rata-rata 67.88 vs 65.05) dan menghancurkannya pada tugas-tugas ilmiah (52.14 vs 18.20), sambil menghasilkan jejak penalaran sekitar 1.5x lebih pendek rata-rata — 4.6x lebih pendek di MMLU Pro, 5.0x lebih pendek di GPQA Diamond. Kompresi jejak itulah sumber peningkatan throughput: 2.9x pada batch 16, naik menjadi 4.6x pada batch 256. Kelemahannya nyata: model ini kalah pada dua tolok ukur penalaran tersulit (HLE dan UGD hard), keunggulan throughput sebagian besar menghilang pada matematika kompetisi, dan belum ada pihak di luar lab yang memverifikasi semuanya.

Poin-poin penting

• Rilis pertama berbasis arsitektur: Mobius-v0 memisahkan vektor pengetahuan dari operator penalaran — satu Memori bersama dari 2.560 pakar melayani empat blok Reasoner, alih-alih 40 lapisan yang masing-masing menimbun pengetahuan FFN sendiri.

Efisiensi, bukan kecerdasan, adalah daya tariknya: panjang output rata-rata turun sekitar 1,5x, dan throughput permintaan naik dari 2,9x pada batch 16 menjadi 4,6x pada batch 256 dibandingkan dengan baseline Transformer.

• Ia benar-benar mengalahkan model dasarnya sendiri: rata-rata 67.88 vs 65.05 pada tugas umum, memenangkan MMLU Pro (89.05 vs 85.31), AIME 2026 (95.31 vs 92.08) dan HMMT 2026 (85.51 vs 78.50).

• Tetapi ia kalah di mana pertimbangan paling penting: HLE 19.11 vs 22.40 dan UGD hard 73.02 vs 78.02 — dua evaluasi paling sulit dalam set tersebut, keduanya dimenangkan oleh Transformer biasa.

• Lompatan sains adalah hasil tunggal terbesar: Biology-Instructions 51.40 vs 3.77, Mol-Instructions 45.73 vs 21.70, MolecularIQ 59.29 vs 29.13.

• Terbuka tetapi tidak tersedia: bobot Apache 2.0 di Hugging Face, tidak ada penyedia inferensi yang menghostingnya, ~73 GB bobot bfloat16 — hosting mandiri saat ini satu-satunya cara untuk menjalankannya.

Apa sebenarnya Intern-S2-Mobius itu

Intern-S2-Mobius adalah model fondasi 35B yang diterbitkan oleh internlm, organisasi Hugging Face di balik seri Intern dari Shanghai AI Laboratory. Bobotnya tersedia di Hugging Face pada 29 Juli 2026, dan repositori GitHub yang menyertainya — README, panduan penerapan, dan PDF laporan teknis lengkap — dipublikasikan pada 5 Agustus 2026. Model ini dirilis di bawah Apache 2.0, yang merupakan lisensi paling permisif untuk bobot terbuka: penggunaan komersial, modifikasi, dan redistribusi semuanya diizinkan.

Ini bukan fine-tune. Ini adalah pra-pelatihan berkelanjutan dengan bedah arsitektur. InternLM mengambil Qwen3.5-35B — model mixture-of-experts 35B berbobot terbuka milik Alibaba, yang dirilis pada 4 Maret 2026 — merestrukturisasi cara model menyimpan dan mengakses pengetahuan, dan melanjutkan pra-pelatihan pada hasilnya, lalu menerapkan supervised fine-tuning dan reinforcement learning di atasnya. Garis keturunan itu penting untuk menafsirkan tolok ukur: setiap perbandingan yang dipublikasikan InternLM adalah Mobius terhadap model persis dari mana ia dikembangkan, yang merupakan ablasi paling bersih terhadap perubahan arsitektur dan juga, kebetulan, perbandingan yang paling mungkin menyanjungnya.

Model ini multimodal. Hugging Face mengklasifikasikannya sebagai image-text-to-text, dan konfigurasinya mengonfirmasi encoder visi lengkap serta penanganan token video. Model ini juga, berdasarkan apa yang disertakan bersama bobotnya, ditujukan langsung untuk sains — lebih lanjut di bawah ini.

Arsitektur Mobius, dalam bahasa sederhana

Transformer konvensional menyelingi dua pekerjaan di setiap lapisan. Atensi memindahkan informasi antar token; jaringan umpan-maju (atau, dalam model campuran-ahli, sekumpulan FFN ahli) menyimpan pengetahuan. Karena FFN berada di dalam lapisan, pengetahuan yang dimilikinya hanya dapat diakses pada kedalaman tersebut. Fakta yang dipelajari ke lapisan 30 tidak dapat dikonsultasikan oleh penalaran yang terjadi di lapisan 5. Informasi mengalir maju, lapisan demi lapisan, dan itulah satu-satunya jalur.

Mobius memutuskan ikatan itu. InternLM menjelaskan tiga konsekuensi.

Pemisahan pengetahuan-penalaran.Penyimpanan FFN yang terikat lapisan digantikan oleh Memori yang dibagikan secara global. Alih-alih 40 lapisan yang masing-masing memiliki sebagian pengetahuan model, ada satu kolam yang dapat diakses oleh setiap tahap penalaran. Argumen InternLM adalah bahwa ini meningkatkan kompresi pengetahuan — fakta yang sama tidak perlu dipelajari ulang secara redundan di berbagai kedalaman — dan memberikan setiap Penalar ruang pengetahuan yang jauh lebih luas daripada yang dapat ditawarkan oleh FFN satu lapisan.

Koneksi Residual Mundur.Karena Memory digunakan bersama, tahap penalaran dangkal dan dalam sama-sama mencapai repositori yang sama. Akses pengetahuan tidak lagi mengalir secara ketat ke depan. Tahap dangkal dapat menarik sesuatu yang, dalam tumpukan standar, baru tersedia tiga puluh lapisan kemudian. Klaim InternLM adalah bahwa ini memungkinkan model menyusun pengetahuan lintas kedalaman secara lebih fleksibel dan, yang terpenting, mensintesis informasi yang berguna dalam lebih sedikit langkah penalaran. Klausa terakhir itulah keseluruhan tesis dari rilis ini.

Penalaran Laten Dinamis. Alih-alih mengeksternalkan setiap langkah pertimbangan sebagai token rantai pemikiran yang terlihat, Mobius menyempurnakan keadaan tersembunyi kontinunya melalui iterasi laten berulang sebelum mendekode apa pun. Sebagian dari "pemikiran" terjadi dalam ruang representasi internal model, bukan dalam teks yang dihasilkan, dan jumlah komputasi internal tersebut dialokasikan secara dinamis per token. Efek praktisnya adalah model perlu menulis lebih sedikit kata untuk mencapai kesimpulan yang sama — dan karena generasi bersifat autoregresif dan serial, menulis lebih sedikit kata adalah cara paling langsung untuk membuat model penalaran lebih cepat.

Secara keseluruhan, tawaran tersebut adalah model penalaran yang lebih banyak berpikir dan lebih sedikit mengetik.

Intern-S2-Mobius-2

Apa yang diungkapkan oleh file konfigurasi

Kartu model menjelaskan arsitektur dalam bentuk prosa. code>config.json/code> membuatnya konkret, dan berisi beberapa angka yang perlu diketahui.

Empat Reasoner dalam 40 lapisan.Konfigurasi teks mendeklarasikan 40 lapisan tersembunyi tetapi hanya empat blok. Ke-40 lapisan tersebut diorganisasikan menjadi empat tahap Reasoner yang beriterasi terhadap Memori bersama, bukan sebagai empat puluh unit pengetahuan-plus-atensi yang independen.

2,560 pakar. Ini adalah memori bersama yang diwujudkan secara literal. Mobius memiliki 2,560 pakar dengan 8 diaktifkan per token dan ukuran perantara per pakar yang sangat kecil yaitu 512, ditambah satu pakar bersama. Sebagai gambaran, saudaranya Intern-S2-Preview menggunakan 256 pakar. Kumpulan sepuluh kali lebih besar yang terdiri dari pakar-pakar yang jauh lebih kecil adalah persis seperti apa "satu penyimpanan pengetahuan global alih-alih FFN per lapisan" ketika ditulis sebagai konfigurasi.

35B di kotak, ~36B di disk, ~3B aktif. Kartu model menyebut 35B; pembaca safetensors Hugging Face melaporkan 36B parameter; indeks bobot totalnya 72.96 GB dalam bfloat16, yang kira-kira setara dengan 36,5B. Panduan penerapan adalah yang paling presisi: panduan itu menyebut rilis ini sebagai 30B-A3B model — sekitar 3B parameter aktif per token. Seperti halnya MoE sparse lainnya, Anda membayar untuk set bobot penuh di memori dan mendapatkan komputasi model kecil per token.

Atensi hibrida, 3:1.Daftar lapisan bergantian tiga lapisan atensi linear dengan satu lapisan atensi penuh, hingga ke bawah — sepuluh lapisan atensi penuh dari 40. Atensi linear menjaga memori konteks panjang dan komputasi agar tidak meledak; lapisan atensi penuh periodik mempertahankan ingatan presisi yang dikorbankan oleh atensi linear murni. Lapisan linear menggunakan kernel konvolusi dengan lebar 4 dan status SSM dalam float32, resep gaya gated-delta yang kini menjadi standar.

Konteks 256K. Embedding posisi maksimum adalah 262.144. Perhatikan kesenjangan antara apa yang didukung arsitektur dan cara arsitektur tersebut dievaluasi: InternLM menjalankan tolok ukur teksnya pada 128K, dan pada 64K untuk MMLU Pro, SimpleQA, dan HLE. Batas atas 256K tidak sama dengan 256K kualitas tervalidasi.

Kepala prediksi multi-token bawaan. Ada modul MTP satu lapis dengan 256 ekspernya sendiri. Ini bukan sekadar hiasan — panduan penerapan merekomendasikan menjalankannya dengan decoding spekulatif MTP dan empat token draf, sehingga sebagian dari kisah kecepatan di dunia nyata adalah decoding spekulatif, bukan arsitektur semata.

Menara visi yang sesungguhnya. Encoder visi dengan 27 lapisan, 1152 hidden, ukuran patch 16, penggabungan spasial 2x2, dan penambalan temporal untuk video, memproyeksikan ke dalam aliran teks 2048 dimensi dengan RoPE multimodal yang disisipkan. Gambar dan video masuk, teks keluar.

• Spesifikasi lain untuk yang penasaran: 16 kepala attention dengan dimensi kepala 256, 2 kepala key-value (grouped-query attention yang agresif), output attention gated, faktor rotary parsial 0,25, RoPE theta 10 juta, dan kosakata 251.392 token.

Tolok ukur, baris demi baris

InternLM dievaluasi dengan OpenCompass dan menerbitkan satu perbandingan: Intern-S2-Mobius-35B melawan Qwen3.5-35B, yaitu model yang menjadi dasar pelatihan lanjutannya. Sembilan tolok ukur umum, tiga tolok ukur ilmiah.

Pada tugas umum, Mobius memenangkan tujuh dari sembilan. MMLU Pro — pengetahuan multi-domain yang luas dengan distraktor yang lebih sulit daripada MMLU asli — mencapai 89.05 berbanding 85.31, peningkatan 3.7 poin dan hasil pengetahuan paling jelas dalam rangkaian ini. GPQA Diamond, pertanyaan sains tingkat pascasarjana yang ditulis agar tidak bisa dijawab dengan mencari di Google, pada dasarnya imbang dengan 80.81 berbanding 80.24. IMO Bench, matematika tingkat olimpiade, mencapai 81.25 berbanding 77.50. AIME 2026, American Invitational Mathematics Examination, mencapai 95.31 berbanding 92.08. HMMT 2026, Harvard-MIT Mathematics Tournament, memiliki selisih terbesar dengan 85.51 berbanding 78.50. AMO mencapai 58.00 berbanding 50.00. Dan SimpleQA — pengingatan fakta bentuk pendek, tolok ukur yang paling langsung mengukur apakah model benar-benar mengetahui sesuatu — melonjak dari 21.39 ke 28.90, peningkatan relatif 35% yang merupakan bukti terbaik tunggal untuk argumen InternLM bahwa "memori bersama mengompres pengetahuan lebih baik".

Lalu dua kekalahan itu, dan itulah baris-baris yang menarik. UGD hard berjalan sebaliknya: 73.02 untuk Mobius dibanding 78.02 untuk baseline, defisit lima poin. Dan HLE — Humanity's Last Exam, evaluasi umum tersulit yang banyak digunakan, di mana model-model frontier masih mendapat skor belasan dan dua puluhan — adalah 19.11 berbanding 22.40. Transformer polos menang 3.3 poin pada benchmark yang secara khusus dirancang untuk membutuhkan penalaran paling banyak.

Pola itu bukan noise, dan tidak tersembunyi: InternLM menerbitkannya. Pembacaan yang paling masuk akal adalah bahwa penalaran laten adalah kompresi, dan kompresi bersifat lossy di bagian ekor. Menginternalisasi deliberasi ke dalam state tersembunyi yang kontinu bekerja dengan indah ketika deliberasi tersebut banyak melibatkan pencarian informasi atau mengikuti bentuk yang familier — yang menggambarkan MMLU Pro, SimpleQA, dan sebagian besar matematika kompetisi. Pada masalah yang benar-benar membutuhkan rantai pemikiran yang panjang, eksploratif, dan mengoreksi kesalahan, jejak eksplisit token demi token tampaknya masih sepadan dengan biayanya. Rata-rata keseluruhan — 67.88 berbanding 65.05 — adalah kemenangan nyata, tetapi itu adalah rata-rata yang menyembunyikan trade-off, bukan peningkatan yang seragam.

Hasil ilmiahnya berada pada skala perbedaan yang berbeda. Biology-Instructions naik dari 3,77 menjadi 51,40. Mol-Instructions, yang mencakup pemahaman dan pembuatan molekul, naik dari 21,70 menjadi 45,73. MolecularIQ naik dari 29,13 menjadi 59,29. Rata-ratanya adalah 52,14 dibanding 18,20. Angka-angka seperti 3,77 yang naik menjadi 51,40 bukanlah kemenangan arsitektur; itu adalah ciri khas pelatihan domain yang ditargetkan pada tugas-tugas yang tidak pernah diajarkan kepada baseline. Qwen3.5-35B yang mencetak di bawah 4% pada Biology-Instructions berarti model tersebut tidak memahami format tugasnya, bukan berarti buruk dalam biologi. Baca ketiga baris tersebut sebagai "InternLM menambahkan spesialisasi ilmiah," yang benar-benar berharga dan merupakan inti dari lini Intern-S — hanya saja jangan mengaitkannya dengan arsitektur Mobius.

Di mana "4x lebih cepat" itu nyata, dan di mana tidak

Klaim efisiensi adalah alasan mengapa model ini dibuat, jadi perlu dibaca secara saksama. Judul utama InternLM adalah "percepatan inferensi end-to-end hampir 4x lipat." Angka throughput yang dipublikasikan lebih informatif daripada judul utamanya, dan juga lebih jujur.

Diukur sebagai throughput permintaan terhadap ukuran batch, dirata-rata di seluruh tolok ukur, Mobius mengungguli baseline Transformer sebesar 2.9x pada batch 16 dan 4.6x pada batch 256. Kesenjangan melebar seiring dengan ukuran batch, yang mana hal ini seperti yang diharapkan ketika keunggulan tersebut berasal dari menghasilkan lebih sedikit token per permintaan: semakin banyak permintaan yang Anda gabungkan, semakin banyak langkah decode yang dihemat akan terakumulasi. Judul "hampir 4x" adalah titik tengah dari suatu rentang, bukan sebuah konstanta.

Uraikan per benchmark dan gambarnya makin tajam. Pada MMLU Pro dan GPQA Diamond, Mobius jauh lebih cepat di setiap ukuran batch — kurva throughput langsung terpisah dan terus melebar. Pada IMO Bench, ia memimpin secara konsisten namun dengan selisih tipis. Pada AIME 2026 dan HMMT 2026, Transformer dasar sebenarnya lebih cepat pada ukuran batch menengah, dan Mobius baru unggul di batch 256. Pada soal matematika kompetisi tersulit, keunggulan throughput itu impas atau lebih buruk di sebagian besar rentang operasional yang berguna.

Mengapa? Karena throughput mengikuti kompresi jejak hampir secara sempurna. Rata-rata panjang keluaran di seluruh tolok ukur turun sekitar 1,5x, dari kira-kira 20.400 token menjadi kira-kira 13.200. Namun, rata-rata itu mencakup rentang yang sangat besar: 4,6x lebih pendek pada MMLU Pro (sekitar 1.100 token dibandingkan 5.150) dan 5,0x lebih pendek pada GPQA Diamond (sekitar 2.600 dibandingkan 12.900), sedangkan hanya 1,4x pada IMO Bench, 1,5x pada AIME 2026, dan 1,2x pada HMMT 2026. Ketika model dapat mengompresi pemikirannya, ia melesat. Ketika soal menuntut 24.000 token derivasi apa pun yang terjadi, ia tidak bisa, dan yang muncul justru overhead arsitekturnya.

Terjemahan praktisnya: jika beban kerja Anda terlihat seperti pengambilan pengetahuan, pilihan ganda, tanya jawab teknis, atau klasifikasi, percepatannya besar dan langsung terasa. Jika beban kerja Anda adalah derivasi matematika atau ilmiah yang sulit, perkirakan sekitar paritas dan Anda akan terkejut dengan menyenangkan. Siapa pun yang mengutip "4x lebih cepat" sebagai properti umum model tersebut sedang mengutip rata-rata dari dua perilaku yang sangat berbeda.

Intern-S2-Mobius-3

Stack sains yang tersembunyi di daftar file

Salah satu hal yang paling mengungkap dari rilis ini tidak ada di kartu model sama sekali — justru ada di daftar berkas repositori. Di samping berkas tokenizer yang biasa, Intern-S2-Mobius menyediakan tiga tokenizer domain tambahan: code>tokenizer_PROT.model/code> untuk urutan protein, code>tokenizer_SMILES.model/code> untuk struktur molekul dalam notasi SMILES, dan code>tokenizer_XNA.model/code> untuk urutan asam nukleat. Ada juga sebuah array NumPy yang tercecer berisi data seismik di dalam repositori.

Tokenizer khusus untuk protein, molekul, dan DNA/RNA bukanlah sesuatu yang Anda tambahkan dengan sembarangan. Ini berarti model dilatih untuk membaca jenis urutan tersebut sebagai input kelas satu, bukan sebagai teks biasa yang kebetulan mengandung huruf. Itulah yang mengubah skor 3.77 menjadi 51.40 pada Biology-Instructions, dan menempatkan Mobius dalam keluarga yang sama dengan saudaranya Intern-S2-Preview, yang menambahkan modalitas deret waktu dan visi serta, menurut InternLM, merupakan model open-source pertama dengan kemampuan pembuatan struktur kristal material.

Jika Anda pengembang serba guna, ini adalah hal sepele. Jika Anda bekerja di bidang biologi komputasional, informatika kimia, atau ilmu material, ini mungkin baris paling penting dalam artikel ini: ini adalah model kecil berlisensi Apache-2.0 yang dapat di-host sendiri dan secara native memahami SMILES serta sekuens protein.

Di mana letaknya dalam keluarga Intern

Lini Intern-S adalah seri multimodal ilmiah dari Shanghai AI Laboratory. Intern-S1 menetapkan formatnya. Intern-S1-Pro meningkatkan skalanya ke kelas triliunan parameter. Intern-S2-Preview, yang dirilis sesaat sebelum Mobius, adalah langkah efisiensi: model dengan total 36B, 3B aktif, 256 pakar, dan konteks 262K yang menurut InternLM mampu menyamai S1-Pro berskala triliunan pada tugas-tugas ilmiah profesional inti — pengurangan parameter sekitar 30x untuk kemampuan ilmiah yang sebanding.

Intern-S2-Mobius adalah hal ketiga: sebuah arsitektur yang dirilis memakai nama Intern-S2. V0 dalam Mobius-v0 benar-benar berfungsi dalam label itu — ini adalah iterasi publik pertama dari sebuah desain, bukan lini produk yang matang. Ini terhubung ke ArchSpace, platform terbuka milik InternLM untuk memvalidasi inovasi arsitektur LLM, yang tujuan resminya adalah "mengubah eksplorasi arsitektur LLM menjadi pengetahuan yang dapat digunakan kembali untuk komunitas," dengan peninjauan sejawat dan hasil yang dipublikasikan termasuk hasil yang negatif. Mobius adalah seperti apa program itu ketika sebuah proposal naik dari probe skala 1B menjadi model 35B yang benar-benar dapat Anda unduh. Laporan teknis lengkap disertakan dengan repositori GitHub bagi siapa saja yang menginginkan derivasi.

Dilihat dari sudut pandang itu, dua kekalahan pada benchmark tersebut adalah fitur dari rilis ini, bukan aib. Ini adalah lab yang menerbitkan eksperimen arsitektur secara jujur, termasuk bagian di mana ia mengalami regresi.

Cara menjalankannya

Intern-S2-Mobius didukung oleh tiga tumpukan inferensi, dan panduan penerapan memberikan pemanggilan yang berfungsi untuk masing-masingnya.

LMDeploy adalah jalur yang direkomendasikan dan satu-satunya yang ditampilkan panduan ini pada satu GPU: sajikan dengan backend PyTorch, code>--trust-remote-code/code>, paralelisme tensor 1, dan decoding spekulatif MTP yang diaktifkan melalui algoritma spekulatif qwen3_5_mtp dengan empat token draf. vLLM ditampilkan dengan paralelisme tensor 2, parser penalaran qwen3, parser pemanggilan alat qwen3_coder, pilihan alat otomatis, dan decoding spekulatif MTP dengan empat token spekulatif. Transformers berfungsi untuk inferensi dasar melalui code>AutoModelForImageTextToText/code> dengan code>trust_remote_code=True/code> dan bfloat16 — perhatikan bahwa model ini menyertakan kode pemodelan kustom, jadi eksekusi kode jarak jauh wajib dilakukan, dan konfigurasi menargetkan Transformers 5.2.

Parameter sampling yang direkomendasikan InternLM adalah temperature 0.8, top-p 0.95, top-k 50, dan min-p 0.0 — lebih hangat daripada pengaturan near-greedy yang kebanyakan model penalaran inginkan, yang patut dihormati daripada diabaikan karena kebiasaan.

Pada sisi perangkat keras: sekitar 73 GB bobot bfloat16 ditambah cache KV dan aktivasi berarti satu akselerator 80 GB sudah ketat dan satu kartu 141 GB terasa nyaman, yang kemungkinan menjadi alasan mengapa contoh vLLM menggunakan dua GPU sementara contoh LMDeploy mengasumsikan satu GPU besar. Pekerjaan konteks panjang akan mendorong kebutuhan itu lebih tinggi. Aktifkan MTP — panduan ini merekomendasikannya secara eksplisit, dan porsi signifikan dari percepatan yang diiklankan ada di sana, bukan pada arsitektur dasarnya.

Peringatan praktis yang paling penting: tidak ada penyedia inferensi yang saat ini menghosting model ini. Panel penyedia Hugging Face mengatakannya dengan jelas, dan penghitung unduhan masih nol saat tulisan ini dibuat. Tidak ada endpoint API, tidak ada harga per juta token, dan tidak ada cara terkelola untuk mencobanya. Hosting mandiri adalah satu-satunya opsi saat ini.

Intern-S2-Mobius-4

Siapa yang sebenarnya harus peduli?

1. Tim yang menjalankan beban kerja penalaran bervolume tinggi berbasis pengambilan

Ini adalah profil yang arsitektur tersebut dibangun untuknya. Jika Anda melayani batch besar tanya-jawab teknis, analisis dokumen, ekstraksi terstruktur, atau klasifikasi bergaya pilihan ganda melalui model penalaran, dan tagihan Anda didominasi oleh token penalaran yang tidak pernah Anda tampilkan kepada pengguna, model yang mencapai jawaban yang sama dalam seperlima token adalah pengurangan biaya langsung. Angka MMLU Pro dan GPQA — jejak 4,6x dan 5,0x lebih pendek dengan akurasi yang sama atau lebih baik — persis seperti bentuk ini. Uji bandingkan dengan lalu lintas Anda sendiri sebelum mempercayainya, tetapi mekanismenya masuk akal dan insentifnya besar.

2. Kelompok ilmu komputasi

Tokenizer protein asli, SMILES, dan asam nukleat, plus peningkatan terukur yang besar pada tolok ukur biologi dan molekuler, dalam model Apache 2.0 yang muat di satu atau dua GPU. Bagi lab yang membutuhkan data tetap berada di on-premises dan tidak dapat mengirim struktur molekul ke API komersial, kombinasi semacam itu jarang ada. Jajaran Intern-S telah mengarah ke hal ini, dan Mobius adalah titik masuk termurah ke dalamnya sejauh ini.

3. Para peneliti dan pengamat arsitektur

Pemisahan pengetahuan-penalaran dan penalaran laten telah menjadi topik penelitian aktif sejak lama; sangat sedikit yang telah divalidasi pada 35B dan dirilis secara terbuka dengan kasus kegagalan yang tetap utuh. Jika Anda peduli ke mana arsitektur pasca-Transformer akan melangkah selanjutnya, laporan teknis dan dua baris yang kalah itu lebih menarik daripada skor rata-rata. ArchSpace dibangun secara eksplisit untuk membuat hasil semacam ini dapat digunakan kembali.

Siapa yang seharusnya tidak peduli, setidaknya untuk saat ini: siapa pun yang mencari asisten serba guna untuk produksi. Tidak ada endpoint yang dihosting, tidak ada evaluasi independen, tidak ada perangkat ekosistem, dan tidak ada rekam jejak. Itu bukan kritik terhadap model — itu adalah deskripsi dari rilis riset yang baru berusia satu minggu.

Bagaimana ia cocok dalam tumpukan produksi

Penempatan yang jujur untuk Intern-S2-Mobius hari ini adalah kandidat evaluasi, bukan model default. Ini adalah artefak penelitian yang tidak di-host, belum terverifikasi, berusia satu minggu dengan arsitektur yang benar-benar menarik dan satu kekuatan yang sangat spesifik — penalaran efisien-token pada tugas berbentuk retrieval — ditambah spesialisasi nyata dalam data sekuens ilmiah.

Pola yang masuk akal adalah menjaga lalu lintas produksi Anda pada endpoint yang netral terhadap vendor seperti OrcaRouter, yang memberi Anda satu API yang kompatibel dengan OpenAI di berbagai model, dan menjalankan Mobius secara terpisah pada GPU Anda sendiri untuk bagian sempit yang berpeluang menang. Ukurlah hal yang benar-benar penting untuk model ini: bukan hanya akurasi, tetapi token yang dihabiskan per jawaban benar. Itulah sumbu yang menjadi fokus optimasi Mobius, dan itulah sumbu yang diabaikan oleh sebagian besar kerangka evaluasi. Jika ia bertahan pada beban kerja Anda, Anda memiliki jalur self-hosted yang murah untuk dijalankan dan tanpa beban hukum. Jika tidak, Anda telah kehilangan satu hari waktu GPU dan jalur produksi Anda tidak pernah berubah.

Logika yang sama berlaku sebaliknya jika suatu penyedia pada akhirnya menghostingnya: router memungkinkan Anda melakukan uji A/B model baru terhadap model lama Anda tanpa menulis ulang apa pun, yang merupakan cara yang tepat untuk mengadopsi arsitektur yang belum pernah diuji secara independen oleh siapa pun.

Keterbatasan dan peringatan

Mulailah dengan yang terbesar: tidak ada verifikasi independen terhadap angka-angka apa pun dalam artikel ini. Setiap tolok ukur, setiap kurva throughput, dan setiap perbandingan panjang token berasal dari InternLM. Perbandingan ini juga secara struktural menguntungkan — Mobius hanya diukur terhadap baseline spesifik yang menjadi dasar prapelatihan berkelanjutannya, bukan terhadap teknologi mutakhir saat ini, dan tambahan pasca-pelatihan SFT dan RL berarti perbandingan ini bukanlah ablasi arsitektur yang bersih meskipun disajikan sebagai demikian. Sebagian dari peningkatannya adalah Mobius; sebagian hanyalah hasil dari lebih banyak pelatihan.

Regresi tersebut nyata dan terjadi pada tugas-tugas tersulit. Kehilangan HLE sebesar 3,3 poin dan UGD hard sebesar 5 poin, sambil memenangkan hampir semua yang lebih mudah, merupakan sinyal yang koheren dan sedikit mengkhawatirkan bagi model yang nilai jualnya adalah efisiensi penalaran.

Secara operasional, gesekannya signifikan. Kode pemodelan khusus berarti code>trust_remote_code/code> dan versi Transformers yang mutakhir. Framework yang mendukungnya harus cukup baru untuk mengetahui apa itu code>interns2_mobius/code>, dan panduan InternLM sendiri memperingatkan bahwa ini adalah konfigurasi referensi yang masih dalam pengembangan aktif. Sekitar 73 GB bobot bukanlah model laptop. Tidak ada API yang di-hosting, tidak ada harga, tidak ada batas kecepatan, dan tidak ada SLA — karena tidak ada layanan.

Akhirnya, perhatikan apa yang belum dipublikasikan: tidak ada hasil benchmark multimodal meskipun ada encoder visi lengkap, tidak ada evaluasi konteks panjang meskipun batas 256K, tidak ada benchmark coding sama sekali, tidak ada evaluasi keamanan atau alignment, dan tidak ada perbandingan dengan model lain selain Qwen3.5-35B. Untuk penyebaran tujuan umum, itu adalah ruang kosong yang besar. Untuk makalah arsitektur dengan bobot yang dilampirkan, hal-hal tersebut di luar cakupan — yang merupakan cara yang tepat untuk membaca rilis ini.

FAQ

Apa itu Intern-S2-Mobius?

Model fondasi multimodal dengan 35 miliar parameter, berlisensi Apache 2.0, dari tim InternLM di Shanghai AI Laboratory, dibangun di atas arsitektur Mobius-v0 yang memisahkan penyimpanan pengetahuan dari komputasi penalaran. Model ini dilatih lanjut secara berkelanjutan dari Qwen3.5-35B dan dilatih pasca dengan SFT dan pembelajaran penguatan, serta dipublikasikan di Hugging Face pada 29 Juli 2026.

Apa yang membuat arsitektur Mobius berbeda?

Transformer konvensional menyimpan pengetahuan dalam blok feed-forward di dalam setiap lapisan, sehingga pengetahuan hanya dapat diakses pada kedalaman tempat ia berada. Mobius menggantinya dengan satu Memory yang dibagikan secara global — 2,560 ahli dalam konfigurasi yang dirilis — yang ditanyakan berulang kali oleh empat blok Reasoner, memungkinkan akses pengetahuan lintas kedalaman dan membiarkan sebagian proses penalaran terjadi dalam keadaan tersembunyi yang kontinu, bukan dalam token rantai pemikiran yang dihasilkan.

Apakah Intern-S2-Mobius benar-benar 4x lebih cepat?

Secara rata-rata dan pada ukuran batch yang besar, kira-kira ya: InternLM mengukur throughput permintaan 2,9x lebih tinggi pada batch 16, naik menjadi 4,6x pada batch 256. Tetapi hal ini sangat bervariasi tergantung tugasnya. Pada MMLU Pro dan GPQA Diamond, peningkatannya besar di setiap ukuran batch; pada matematika kompetisi AIME dan HMMT, Transformer dasar sebenarnya lebih cepat pada ukuran batch menengah. Percepatan tersebut mengikuti seberapa banyak model dapat mempersingkat jejak penalarannya.

Bagaimana perbandingannya dengan Qwen3.5-35B?

Ia memenangkan tujuh dari sembilan tolok ukur umum dengan rata-rata 67.88 dibandingkan 65.05, termasuk MMLU Pro (89.05 vs 85.31), AIME 2026 (95.31 vs 92.08), HMMT 2026 (85.51 vs 78.50) dan SimpleQA (28.90 vs 21.39). Ia kalah pada UGD hard (73.02 vs 78.02) dan HLE (19.11 vs 22.40). Pada tugas-tugas ilmiah, ia jauh lebih unggul — rata-rata 52.14 dibandingkan 18.20.

Bisakah saya menggunakan Intern-S2-Mobius melalui API?

Saat ini belum. Tidak ada penyedia inferensi yang menghostingnya, tidak ada harga yang dipublikasikan, dan Hugging Face tidak mencantumkan deployment. Self-hosting dengan LMDeploy, vLLM, atau Transformers adalah satu-satunya cara untuk menjalankannya saat ini.

Perangkat keras apa yang saya butuhkan untuk menjalankannya?

Bobot modelnya sekitar 73 GB dalam bfloat16, jadi rencanakan satu akselerator kelas 141 GB atau dua GPU 80 GB, ditambah ruang cadangan untuk cache KV. Contoh LMDeploy milik InternLM menggunakan paralelisme tensor 1; contoh vLLM-nya menggunakan 2. Mengaktifkan decoding spekulatif MTP dengan empat token draft sangat disarankan.

Berapa panjang konteksnya?

Konfigurasi ini mendukung 262.144 token (256K). Perhatikan bahwa InternLM dievaluasi pada 128K untuk sebagian besar tolok ukur teks dan 64K untuk MMLU Pro, SimpleQA, dan HLE, sehingga kualitas yang tervalidasi pada 256K penuh belum dapat ditunjukkan.

Apakah ini multimodal?

Ya. Hugging Face mengklasifikasikannya sebagai image-text-to-text, dan konfigurasinya mencakup vision encoder 27 lapis dengan penanganan token video. Namun, InternLM tidak menerbitkan hasil benchmark multimodal pada rilis ini, sehingga kemampuan vision-nya tidak terdokumentasi dalam praktiknya.

Mengapa ia menyertakan tokenizer protein dan SMILES?

Karena lini Intern-S adalah keluarga model ilmiah. Tokenizer khusus untuk sekuens protein, notasi molekuler SMILES, dan asam nukleat berarti model membaca format-format tersebut sebagai tipe input asli, itulah sebabnya ia meraih skor 51.40 pada Biology-Instructions sementara baseline meraih 3.77.

Apakah lisensinya benar-benar Apache 2.0?

Ya — Apache 2.0, dengan file lisensi di repositori. Penggunaan komersial, modifikasi, dan redistribusi diizinkan, yang secara signifikan lebih permisif dibandingkan banyak rilis open-weight dari laboratorium besar.

Haruskah saya menggunakannya dalam produksi?

Belum. Model ini baru berumur satu minggu, belum di-hosting, belum diverifikasi oleh pihak ketiga mana pun, dan belum memiliki evaluasi pengodean, multimodal, konteks panjang, serta keamanan. Perlakukan sebagai kandidat evaluasi untuk penalaran hemat token atau pekerjaan sekuens ilmiah, pertahankan lalu lintas produksi pada model yang sudah mapan melalui endpoint netral-vendor, dan tinjau kembali ketika angka independen sudah tersedia.

Intinya

Intern-S2-Mobius adalah salah satu rilis model yang benar-benar menarik tahun ini, dan hampir semuanya tidak ada hubungannya dengan skor-skor yang diraihnya. InternLM mengambil ide arsitektural yang nyata — berhenti mengikat pengetahuan pada lapisan-lapisan, menaruhnya dalam satu Memori bersama, dan membiarkan model melakukan sebagian pemikirannya dalam ruang laten alih-alih dalam token — menskalakannya hingga 35B, melatihnya dengan benar, dan merilis bobotnya di bawah Apache 2.0 beserta laporan teknis dan hasil-hasil yang tidak sesuai keinginan mereka. Mekanisme efisiensinya mudah dipahami dan buktinya konsisten secara internal: jejak menjadi lebih pendek rata-rata 1,5x dan hingga 5x lebih pendek pada tugas-tugas yang berat pengetahuan, dan throughput naik persis dalam proporsi yang Anda prediksi dari itu.

Peringatan-peringatannya sama jelasnya. Tidak ada seorang pun di luar Shanghai AI Laboratory yang memverifikasi satu angka pun. Perbandingannya dilakukan terhadap basis model itu sendiri dan mencakup pasca-pelatihan tambahan, jadi ini bukan ablasi bersih seperti yang terlihat. Percepatannya sebagian besar menghilang pada matematika yang sulit. Model ini kalah pada dua tolok ukur penalaran paling berat di tabelnya sendiri. Dan tidak ada cara untuk mencobanya tanpa menyewa GPU.

Jadi: ini bukan model untuk di-deploy minggu ini, tetapi sangat layak untuk dipantau, dan opsi yang benar-benar menarik bagi dua audiens spesifik — tim yang tagihan reasoning-nya didominasi oleh token yang tidak dibaca siapa pun, dan kelompok ilmiah yang membutuhkan model kecil berlisensi permisif yang secara native memahami protein dan molekul. Pertahankan stack produksi pada model-model yang sudah terbukti melalui endpoint netral-vendor seperti OrcaRouter, jalankan Mobius di perangkat keras Anda sendiri untuk kasus khusus tersebut, dan ukur token per jawaban yang benar, bukan sekadar akurasi. Jika arsitekturnya tahan terhadap pengawasan independen, Mobius-v0 akan dikenang bukan sebagai model 35B, melainkan sebagai nomor versi sebelum versi yang benar-benar berarti.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube