
Intern-S2-Mobius: Il modello da 35B che separa la conoscenza dal ragionamento
- qwenNUOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M di token · 56 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 201 tok/s
- orcaNUOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUOVOAnthropic: Claude Opus 52026-07-2461Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1651Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0854Intelligenza72Codice
- tencentTencent: Hy32026-07-0641Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenza69Codice60Matematica
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenza61Codice61Matematica
Il team InternLM dello Shanghai AI Laboratory ha pubblicato in sordina Intern-S2-Mobius, un modello foundation open-weight da 35B che fa qualcosa che quasi nessun altro modello rilasciato fa: smette di immagazzinare conoscenza all'interno dei suoi strati. Invece della disposizione standard dei Transformer — in cui ogni strato porta il proprio blocco feed-forward pieno di fatti memorizzati — Mobius estrae tutta quella conoscenza in un'unica Memory condivisa globalmente e lascia che un piccolo numero di Reasoners la interroghi ripetutamente. Il vantaggio dichiarato non è un punteggio benchmark più alto. È la velocità: le stesse risposte in circa un terzo o un quinto dei token di ragionamento, e fino a 4,6 volte il throughput delle richieste. Questa guida spiega cosa sia realmente Mobius, cosa rivela il suo file di configurazione che la scheda del modello non mostra, cosa mostrano i benchmark pubblicati riga per riga — incluse le due righe in cui perde — dove l'affermazione "4x più veloce" regge e dove svanisce, e a chi dovrebbe realisticamente importare.
Nota sull'accuratezza: ogni numero riportato di seguito proviene dalla scheda tecnica di InternLM, dalle sue cifre pubblicate su prestazioni ed efficienza, dalla sua guida al deployment e dai file di configurazione del modello su Hugging Face. Non esiste alcuna valutazione indipendente di terze parti di Intern-S2-Mobius al momento della stesura: non compare in nessuna classifica indipendente, non è distribuito da alcun provider di inferenza e il suo contatore di download è ancora a zero. Tratta tutte le cifre comparative come dichiarate dal fornitore finché qualcuno non le riproduce. Le specifiche e il codice di un modello così nuovo cambiano rapidamente; verifica prima di costruire.
TL;DR. Intern-S2-Mobius è un modello foundation multimodale da 35 miliardi di parametri, con licenza Apache 2.0, pre-addestrato in modo continuo a partire da Qwen3.5-35B e poi post-addestrato con SFT e apprendimento per rinforzo. La sua novità è architetturale: il design Mobius-v0 sostituisce l'archiviazione della conoscenza feed-forward legata ai livelli con una Memory condivisa globalmente composta da 2.560 esperti, interrogata da quattro blocchi Reasoner impilati che possono raggiungere conoscenza al di fuori della propria profondità (una connessione residua all'indietro) e affinare gli stati nascosti attraverso l'iterazione latente ricorrente prima della decodifica (ragionamento latente dinamico). Nella valutazione di InternLM, supera la baseline Qwen3.5-35B da cui è stato costruito in sette dei nove benchmark generali (media 67,88 vs 65,05) e la distrugge nei compiti scientifici (52,14 vs 18,20), producendo tracce di ragionamento circa 1,5 volte più corte in media — 4,6 volte più corte su MMLU Pro, 5,0 volte più corte su GPQA Diamond. È da questa compressione delle tracce che deriva il guadagno in termini di throughput: 2,9 volte con batch 16, fino a 4,6 volte con batch 256. I contro sono reali: perde nei due benchmark di ragionamento più difficili (HLE e UGD hard), il vantaggio nel throughput scompare in gran parte nella matematica competitiva, e nessuno al di fuori del laboratorio ha verificato nulla di tutto ciò.
Punti chiave
• Release incentrata sull'architettura: Mobius-v0 disaccoppia i vettori di conoscenza dagli operatori di ragionamento — una Memoria condivisa di 2.560 esperti al servizio di quattro blocchi Reasoner, invece di 40 layer che accumulano ciascuno la propria conoscenza FFN.
• L'efficienza, non l'intelligenza, è il punto chiave: la lunghezza media dell'output si riduce di circa 1,5x, e il throughput delle richieste aumenta da 2,9x con batch 16 a 4,6x con batch 256 rispetto alla baseline Transformer.
• Supera davvero il suo modello base: 67.88 contro 65.05 di media nei compiti generali, vincendo MMLU Pro (89.05 contro 85.31), AIME 2026 (95.31 contro 92.08) e HMMT 2026 (85.51 contro 78.50).
• Ma perde dove la riflessione conta di più: HLE 19.11 vs 22.40 e UGD hard 73.02 vs 78.02 — le due valutazioni più difficili del set, entrambe vinte dal Transformer semplice.
• Il salto scientifico è il risultato singolo più grande: Biology-Instructions 51.40 vs 3.77, Mol-Instructions 45.73 vs 21.70, MolecularIQ 59.29 vs 29.13.
• Aperto ma non disponibile: pesi Apache 2.0 su Hugging Face, nessun provider di inferenza lo ospita, ~73 GB di pesi bfloat16 — il self-hosting è attualmente l'unico modo per eseguirlo.
Cosa sia realmente Intern-S2-Mobius
Intern-S2-Mobius è un modello foundation da 35B pubblicato da internlm, l'organizzazione Hugging Face dietro la serie Intern dello Shanghai AI Laboratory. I pesi sono arrivati su Hugging Face il 29 luglio 2026, e il repository GitHub associato — README, guida alla distribuzione e un rapporto tecnico completo in PDF — è stato reso pubblico il 5 agosto 2026. È rilasciato sotto licenza Apache 2.0, che è quanto di più permissivo si possa avere con pesi aperti: uso commerciale, modifica e ridistribuzione sono tutti consentiti.
Non è un fine-tuning. È un pre-training continuo con chirurgia dell'architettura. InternLM ha preso Qwen3.5-35B — il modello mixture-of-experts da 35B a pesi aperti di Alibaba, rilasciato il 4 marzo 2026 — ha ristrutturato il modo in cui il modello archivia e accede alla conoscenza, ha proseguito il pre-training del risultato e quindi ha applicato fine-tuning supervisionato e apprendimento per rinforzo. Questa discendenza è importante per interpretare i benchmark: ogni confronto pubblicato da InternLM è Mobius contro il modello esatto da cui è stato sviluppato, che è l'ablazione più pulita possibile del cambiamento architetturale e anche, convenientemente, il confronto che più probabilmente lo favorisce.
Il modello è multimodale. Hugging Face lo classifica come image-text-to-text, e la configurazione conferma un encoder visivo completo oltre alla gestione dei token video. Inoltre, a giudicare da ciò che viene distribuito insieme ai pesi, è chiaramente orientato alla scienza — ne parleremo più avanti.
L'architettura Mobius, in parole semplici
Un Transformer convenzionale intreccia due compiti in ogni livello. L'attenzione sposta informazioni tra i token; la rete feed-forward (o, in un modello a miscuglio di esperti, un insieme di FFN esperte) immagazzina conoscenza. Poiché la FFN si trova all'interno del livello, la conoscenza che detiene è raggiungibile solo a quella profondità. Un fatto appreso nel livello 30 non può essere consultato dal ragionamento che avviene al livello 5. L'informazione fluisce in avanti, livello per livello, e questo è l'unico percorso.
Mobius spezza quel legame. InternLM descrive tre conseguenze.
Separazione tra conoscenza e ragionamento. Lo storage FFN legato ai layer viene sostituito da una Memory. Piuttosto che 40 layer che possiedono ciascuno una fetta della conoscenza del modello, esiste un unico pool a cui ogni fase di ragionamento può accedere. La tesi di InternLM è che questo migliora la compressione della conoscenza — gli stessi fatti non devono essere riappresi in modo ridondante a più profondità — e offre a ciascun Reasoner uno spazio di conoscenza molto più ampio di quanto l'FFN di un singolo layer potrebbe offrire.
Connessione residua all'indietro. Poiché la memoria è condivisa, le fasi di ragionamento superficiali e profonde raggiungono entrambe lo stesso repository. L'accesso alla conoscenza non scorre più strettamente in avanti. Una fase superficiale può attingere a qualcosa che, in uno stack standard, sarebbe stato disponibile solo trenta strati dopo. L'affermazione di InternLM è che questo consente al modello di comporre la conoscenza attraverso le profondità in modo più flessibile e, soprattutto, sintetizzare informazioni utili in meno passaggi di ragionamento. Quell'ultima proposizione è l'intera tesi del rilascio.
Ragionamento Latente Dinamico. Invece di esternalizzare ogni passo di deliberazione come token visibili di catena di pensiero, Mobius raffina i suoi stati nascosti continui attraverso l'iterazione latente ricorrente prima di decodificare qualsiasi cosa. Parte del "pensiero" avviene nello spazio di rappresentazione interno del modello piuttosto che nel testo generato, e la quantità di quella computazione interna è allocata dinamicamente per token. L'effetto pratico è che il modello deve scrivere meno parole per raggiungere la stessa conclusione — e poiché la generazione è autoregressiva e serializzata, scrivere meno parole è il modo più diretto in assoluto per rendere più veloce un modello di ragionamento.
Nel complesso, la proposta è un modello di ragionamento che pensa di più e digita meno.

Ciò che rivela il file di configurazione
La scheda del modello descrive l'architettura in prosa. Il code>config.json/code> la rende concreta e contiene diversi numeri degni di nota.
• Quattro Reasoner su 40 livelli. La configurazione testuale dichiara 40 livelli nascosti ma solo quattro blocchi. I 40 livelli sono organizzati in quattro stadi Reasoner che iterano sulla Memoria condivisa, anziché in quaranta unità indipendenti di conoscenza e attenzione.
• 2.560 esperti. Questa è la Memoria condivisa resa concreta. Mobius ha 2.560 esperti, con 8 attivati per token e una dimensione intermedia per esperto di 512, più un esperto condiviso. Per dare un'idea, il suo gemello Intern-S2-Preview ne usa 256. Un pool dieci volte più grande di esperti molto più piccoli è esattamente ciò che si ottiene quando si scrive "un unico archivio di conoscenza globale invece di FFN per livello" come configurazione.
• 35B sulla confezione, ~36B su disco, ~3B attivi. La scheda del modello indica 35B; il lettore safetensors di Hugging Face riporta 36B parametri; l'indice dei pesi totalizza 72,96 GB in bfloat16, che equivale a circa 36,5B. La guida al deployment è la più precisa: definisce il rilascio un modello 30B-A3B — circa 3B parametri attivi per token. Come per qualsiasi MoE sparso, si paga l'intero set di pesi in memoria e si ottiene un calcolo da modello piccolo per token.
• Attenzione ibrida, 3:1. L'elenco dei layer alterna tre layer di attenzione lineare a un layer di attenzione completa, fino in fondo — dieci layer di attenzione completa su 40. L'attenzione lineare evita che la memoria a contesto lungo e il carico computazionale esplodano; i layer periodici di attenzione completa preservano il richiamo esatto a cui l'attenzione lineare pura rinuncia. I layer lineari usano un kernel di convoluzione di larghezza 4 e uno stato SSM in float32, la ricetta ormai standard in stile gated-delta.
• 256K di contesto. Il numero massimo di embedding posizionali è 262.144. Nota il divario tra ciò che l'architettura supporta e come è stata valutata: InternLM ha eseguito i suoi benchmark testuali a 128K e a 64K su MMLU Pro, SimpleQA e HLE. Un tetto di 256K non è la stessa cosa di 256K di qualità validata.
• Una testa di previsione multi-token integrata. C'è un modulo MTP a un solo strato con i suoi 256 esperti. Non è puramente decorativo: la guida alla distribuzione consiglia di eseguire con decodifica speculativa MTP e quattro token di bozza, quindi parte della storia della velocità nel mondo reale è la decodifica speculativa, non solo l'architettura.
• Una vera vision tower. Un encoder visivo a 27 strati con 1152 dimensioni nascoste, patch size 16, merging spaziale 2x2 e patching temporale per i video, che proietta nel flusso testuale a 2048 dimensioni con RoPE multimodale interleaved. Immagini e video in ingresso, testo in uscita.
• Altre specifiche per i curiosi: 16 teste di attenzione con dimensione della testa pari a 256, 2 teste chiave-valore (attenzione a query raggruppate aggressiva), output di attenzione gated, un fattore rotatorio parziale di 0,25, theta RoPE di 10 milioni e un vocabolario di 251.392 token.
I benchmark, riga per riga
{{1}}InternLM è stato valutato con OpenCompass ed è stato pubblicato un singolo confronto: Intern-S2-Mobius-35B contro Qwen3.5-35B, il modello da cui è stato continuamente pre-addestrato. Nove benchmark generali, tre di carattere scientifico.{{/1}}
Nei compiti generali, Mobius vince sette su nove. MMLU Pro — ampia conoscenza multi-dominio con distrattori più difficili dell'MMLU originale — passa da 89.05 a 85.31, un guadagno di 3.7 punti e il risultato di conoscenza più netto del set. GPQA Diamond, domande di scienza di livello post-laurea scritte per essere a prova di Google, è di fatto un pareggio: 80.81 contro 80.24. IMO Bench, matematica a livello olimpico, passa da 81.25 a 77.50. AIME 2026, l'American Invitational Mathematics Examination, passa da 95.31 a 92.08. HMMT 2026, l'Harvard-MIT Mathematics Tournament, registra il maggiore scarto in matematica: 85.51 contro 78.50. AMO passa da 58.00 a 50.00. E SimpleQA — richiamo fattuale a risposta breve, il benchmark che misura più direttamente se un modello sa davvero le cose — balza da 21.39 a 28.90, un miglioramento relativo del 35% che è la migliore prova in assoluto dell'argomento di InternLM secondo cui "la memoria condivisa comprime meglio la conoscenza".
Poi le due sconfitte, e sono le righe interessanti. UGD hard va nella direzione opposta: 73,02 per Mobius contro 78,02 per la baseline, un deficit di cinque punti. E HLE — Humanity's Last Exam, la valutazione generale più difficile tra quelle ampiamente utilizzate, dove i modelli di frontiera ottengono ancora punteggi tra i dieci e i venti — è 19,11 contro 22,40. Il semplice Transformer vince di 3,3 punti sul benchmark specificamente progettato per richiedere il massimo ragionamento.
Questo schema non è rumore, e non è nascosto: InternLM lo ha pubblicato. La lettura più plausibile è che il ragionamento latente sia una compressione, e la compressione è lossy in coda. Interiorizzare la deliberazione in stati nascosti continui funziona splendidamente quando la deliberazione è basata sul recupero o segue una forma familiare — il che descrive MMLU Pro, SimpleQA e la maggior parte delle competizioni di matematica. Su problemi che richiedono davvero lunghe catene di pensiero esplorative e autocorrettive, la traccia esplicita token-per-token sembra ancora valere il suo costo. La media complessiva — 67.88 contro 65.05 — è una vittoria reale, ma è una media che nasconde un compromesso, non un miglioramento uniforme.
I risultati scientifici rappresentano una differenza su un'altra scala. Biology-Instructions passa da 3.77 a 51.40. Mol-Instructions, che copre la comprensione e la generazione molecolare, passa da 21.70 a 45.73. MolecularIQ passa da 29.13 a 59.29. La media è 52.14 contro 18.20. Numeri come 3.77 che salgono a 51.40 non sono vittorie dell'architettura; sono la firma di un addestramento di dominio mirato su compiti che la baseline non ha mai imparato a svolgere. Il punteggio di Qwen3.5-35B inferiore al 4% su Biology-Instructions significa che non comprende il formato del compito, non che sia scarso in biologia. Leggi queste tre righe come "InternLM ha aggiunto una specializzazione scientifica", il che è genuinamente prezioso ed è l'intero scopo della linea Intern-S — ma non attribuirlo all'architettura Mobius.
Dove "4x più veloce" è reale, e dove non lo è.
L'affermazione sull'efficienza è il motivo per cui questo modello esiste, quindi merita una lettura attenta. Il titolo di InternLM è "quasi 4x di accelerazione end-to-end dell'inferenza." Il dato di throughput pubblicato è più informativo del titolo, e più onesto.
Misurato come throughput di richieste in funzione della dimensione del batch, in media sui benchmark, Mobius supera il baseline Transformer di 2.9x con batch 16 e 4.6x con batch 256. Il divario si amplia con la dimensione del batch, come ci si aspetterebbe quando il vantaggio deriva dalla generazione di meno token per richiesta: più richieste si raggruppano insieme, più i passaggi di decodifica risparmiati si accumulano. Il titolo "quasi 4x" è un punto medio di un intervallo, non una costante.
Scomponendolo per benchmark, il quadro diventa più nitido. Su MMLU Pro e GPQA Diamond, Mobius è drammaticamente più veloce a ogni dimensione del batch — le curve di throughput si separano subito e continuano a divergere. Su IMO Bench, è in testa in modo costante ma moderato. Su AIME 2026 e HMMT 2026, il Transformer di base è in realtà più veloce a dimensioni di batch intermedie, con Mobius che supera gli altri solo al batch 256. Nella matematica competitiva più difficile, il vantaggio in termini di throughput è un pareggio o peggio in gran parte dell’intervallo operativo utile.
Perché? Perché il throughput segue quasi perfettamente la compressione della traccia. La lunghezza media dell'output sui benchmark diminuisce di circa 1,5x, da circa 20.400 token a circa 13.200. Ma questa media copre un'enorme gamma: 4,6x più breve su MMLU Pro (circa 1.100 token contro 5.150) e 5,0x più breve su GPQA Diamond (circa 2.600 contro 12.900), contro solo 1,4x su IMO Bench, 1,5x su AIME 2026 e 1,2x su HMMT 2026. Dove il modello può comprimere il suo ragionamento, vola. Dove il problema richiede comunque 24.000 token di derivazione, non può, e gli overhead dell'architettura emergono invece.
La traduzione pratica: se il tuo carico di lavoro assomiglia a recupero di conoscenza, scelta multipla, Q&A tecnico o classificazione, l'accelerazione è notevole e immediata. Se il tuo carico di lavoro è una derivazione matematica o scientifica difficile, metti in conto una parità approssimativa e sii piacevolmente sorpreso. Chiunque citi "4x più veloce" come proprietà generale del modello sta citando una media di due comportamenti molto diversi.

Lo stack scientifico nascosto nell'elenco dei file
Una delle cose più rivelatrici di questa release non è affatto nella model card — è nell'elenco dei file del repository. Oltre ai soliti file dei tokenizer, Intern-S2-Mobius include tre tokenizer di dominio aggiuntivi: code>tokenizer_PROT.model/code> per le sequenze proteiche, code>tokenizer_SMILES.model/code> per le strutture molecolari in notazione SMILES e code>tokenizer_XNA.model/code> per le sequenze di acidi nucleici. C'è anche un array NumPy isolato di dati sismici che giace nel repository.
I tokenizer dedicati per proteine, molecole e DNA/RNA non sono qualcosa che si aggiunge con leggerezza. Significano che il modello è stato addestrato a leggere questi tipi di sequenze come input di prima classe, piuttosto che come testo ordinario che per caso contiene lettere. È questo che trasforma un 3.77 in un 51.40 su Biology-Instructions, e mette Mobius nella stessa famiglia del suo gemello Intern-S2-Preview, che ha aggiunto le modalità serie temporali e visione e, secondo InternLM, è stato il primo modello open-source con capacità di generazione di strutture cristalline dei materiali.
Se sei uno sviluppatore generico, questa è una curiosità. Se lavori in biologia computazionale, cheminformatica o scienza dei materiali, potrebbe essere la riga più importante di questo articolo: questo è un modello piccolo, con licenza Apache-2.0, auto-ospitabile, che parla nativamente SMILES e sequenze proteiche.
Dove si colloca nella famiglia Intern
La linea Intern-S è la serie multimodale scientifica del Laboratorio di Intelligenza Artificiale di Shanghai. Intern-S1 ha stabilito il formato. Intern-S1-Pro l'ha portata alla classe dei trilioni di parametri. Intern-S2-Preview, rilasciato poco prima di Mobius, è la scommessa sull'efficienza: un modello da 36B totali e 3B attivi, con 256 esperti e un contesto di 262K, che InternLM sostiene eguagli l'S1-Pro su scala trilione nei compiti scientifici professionali fondamentali — una riduzione dei parametri di circa 30 volte per una capacità scientifica comparabile.
Intern-S2-Mobius è una terza cosa: una architettura release che porta il nome Intern-S2. Il "v0" in Mobius-v0 sta facendo un lavoro reale in quell'etichetta — questa è la prima iterazione pubblica di un design, non una linea di prodotti matura. Si collega a ArchSpace, la piattaforma open di InternLM per la validazione delle innovazioni nell'architettura dei LLM, il cui obiettivo dichiarato è "trasformare l'esplorazione dell'architettura dei LLM in conoscenza riutilizzabile per la comunità", con revisione tra pari e risultati pubblicati, inclusi quelli negativi. Mobius è ciò che quel programma diventa quando una proposta passa da un prototipo da 1B a un modello da 35B che puoi effettivamente scaricare. Un rapporto tecnico completo è incluso nel repository GitHub per chiunque voglia le derivazioni.
Letto in quest'ottica, i due cali nei benchmark sono una caratteristica della release, non un imbarazzo. Questo è un laboratorio che pubblica onestamente un esperimento di architettura, inclusi i punti in cui ha subito regressioni.
Come eseguirlo
Intern-S2-Mobius è supportato da tre stack di inferenza, e la guida di distribuzione fornisce invocazioni funzionanti per ciascuno.
LMDeploy è il percorso consigliato e l'unico che la guida mostra su una singola GPU: si serve con il backend PyTorch, code>--trust-remote-code/code>, parallelismo tensoriale di 1 e decodifica speculativa MTP abilitata tramite l'algoritmo speculativo qwen3_5_mtp con quattro token di draft. vLLM viene mostrato con parallelismo tensoriale di 2, il parser di ragionamento qwen3, il parser di chiamate agli strumenti qwen3_coder, la scelta automatica degli strumenti e la decodifica speculativa MTP con quattro token speculativi. Transformers funziona per l'inferenza di base tramite code>AutoModelForImageTextToText/code> con code>trust_remote_code=True/code> e bfloat16 — nota che il modello include codice di modellazione personalizzato, quindi l'esecuzione di codice remoto è obbligatoria e la configurazione è destinata a Transformers 5.2.
I parametri di campionamento raccomandati da InternLM sono temperature 0.8, top-p 0.95, top-k 50 e min-p 0.0 — più "caldi" rispetto alle impostazioni quasi-greedy che la maggior parte dei modelli di ragionamento preferisce, un aspetto da rispettare piuttosto che sovrascrivere per abitudine.
Sul fronte hardware: circa 73 GB di pesi in bfloat16, più la cache KV e le attivazioni, significano che un singolo acceleratore da 80 GB è al limite, mentre una scheda singola da 141 GB è comoda — motivo per cui, presumibilmente, l'esempio vLLM usa due GPU mentre quello LMDeploy presuppone un'unica scheda di grandi dimensioni. Il lavoro su contesti lunghi farà salire ulteriormente il fabbisogno. Attiva MTP — la guida lo raccomanda esplicitamente, e una fetta significativa dell'incremento di velocità pubblicizzato risiede lì, non nell'architettura di base.
L'avvertenza pratica più importante: nessun provider di inferenza ospita attualmente questo modello. Il pannello dei provider di Hugging Face lo dice chiaramente, e il contatore dei download era ancora a zero quando è stato scritto. Non esiste un endpoint API, nessun prezzo per milione di token e nessun modo gestito per provarlo. Il self-hosting è l'unica opzione oggi.

Chi dovrebbe davvero interessarsene
1. Team che eseguono carichi di lavoro di ragionamento ad alto volume, basati sul retrieval
Questo è il profilo per cui l'architettura è stata costruita. Se stai servendo grandi batch di Q&A tecnici, analisi di documenti, estrazione strutturata o classificazione a scelta multipla tramite un modello di reasoning, e la tua fattura è dominata da token di reasoning che non mostri mai all'utente, un modello che arriva alla stessa risposta con un quinto dei token è una riduzione diretta dei costi. I numeri di MMLU Pro e GPQA — tracce più corte di 4,6x e 5,0x con accuratezza uguale o migliore — sono esattamente di questa forma. Mettilo a confronto con il tuo traffico prima di crederci, ma il meccanismo è solido e l'incentivo è grande.
2. Gruppi di scienza computazionale
Tokenizer nativi per proteine, SMILES e acidi nucleici, oltre a grandi miglioramenti misurati su benchmark biologici e molecolari, in un modello Apache 2.0 che sta su una o due GPU. Per un laboratorio che ha bisogno che i dati restino on-premises e non può inviare strutture molecolari a un'API commerciale, questa combinazione è rara. La linea Intern-S ha costruito in questa direzione, e Mobius è finora il punto di ingresso più economico.
3. Ricercatori e osservatori dell'architettura
Il disaccoppiamento conoscenza-ragionamento e il ragionamento latente sono filoni di ricerca attivi da tempo; pochissimi sono stati validati a 35B e rilasciati apertamente con i casi di errore intatti. Se ti interessa dove andranno le architetture post-Transformer, il rapporto tecnico e le due righe perdenti sono più interessanti del punteggio medio. ArchSpace è esplicitamente progettato per rendere riutilizzabile questo tipo di risultato.
Chi non dovrebbe interessarsene, almeno per ora: chiunque cerchi un assistente generico pronto per la produzione. Non c'è un endpoint ospitato, nessuna valutazione indipendente, nessuno strumento per l'ecosistema e nessuna esperienza pregressa. Questa non è una critica al modello — è una descrizione di una release di ricerca che ha una settimana.
Come si integra in uno stack di produzione
La collocazione onesta per Intern-S2-Mobius oggi è candidato alla valutazione, non modello predefinito. È un artefatto di ricerca non ospitato, non verificato, vecchio di una settimana, con un'architettura genuinamente interessante e un punto di forza molto specifico — ragionamento efficiente in termini di token su compiti basati sul recupero — oltre a una vera specializzazione nei dati di sequenze scientifiche.
Un modello sensato è mantenere il traffico di produzione su un endpoint neutrale rispetto al fornitore come OrcaRouter, che ti offre un'unica API compatibile con OpenAI su molti modelli, e configurare Mobius separatamente sulle tue GPU per la ristretta fascia in cui potrebbe rivelarsi vincente. Misura la cosa che conta davvero per questo modello: non solo l'accuratezza, ma token spesi per risposta corretta. Questo è l'asse su cui Mobius è ottimizzato, ed è l'asse che la maggior parte dei banchi di valutazione ignora. Se regge sul tuo carico di lavoro, hai una corsia self-hosted che è economica da far girare e senza vincoli legali. Se non regge, hai perso un giorno di tempo GPU e il tuo percorso di produzione non si è mai mosso.
La stessa logica vale al contrario se un provider alla fine lo ospita: un router ti permette di fare un A/B test tra un nuovo modello e quello attuale senza riscrivere nulla, che è esattamente il modo giusto di adottare un'architettura che nessuno ha testato in modo indipendente.
Limitazioni e avvertenze
Iniziamo dal più grande: non esiste alcuna verifica indipendente dei numeri riportati in questo articolo. Ogni benchmark, ogni curva di throughput e ogni confronto sulla lunghezza dei token proviene da InternLM. Il confronto è inoltre strutturalmente favorevole — Mobius viene misurato solo rispetto alla baseline specifica da cui è stato continuamente pre-addestrato, non rispetto allo stato dell'arte attuale, e il successivo post-training con SFT e RL significa che il confronto non è un'ablazione architetturale pulita, anche se viene presentato come tale. Parte del miglioramento è dovuta a Mobius; parte è semplicemente un maggiore addestramento.
Le regressioni sono reali e si verificano nei compiti più difficili. Perdere HLE di 3,3 punti e UGD hard di 5 punti, mentre si vince quasi tutto ciò che è più facile, è una firma coerente e leggermente preoccupante per un modello il cui punto di forza è l'efficienza del ragionamento.
Operativamente, l'attrito è notevole. Il codice di modellazione personalizzato comporta code>trust_remote_code/code>code>interns2_mobius/code> sia, e la guida di InternLM stessa avverte che queste sono configurazioni di riferimento in fase di sviluppo attivo. Circa 73 GB di pesi non è un modello da laptop. Non c'è un'API ospitata, né prezzi, né limiti di frequenza, né SLA — perché non c'è alcun servizio.
Infine, notate ciò che non è stato pubblicato: nessun benchmark multimodale nonostante un encoder visivo completo, nessuna valutazione del contesto lungo nonostante un tetto di 256K, nessun benchmark di coding, nessuna valutazione di sicurezza o allineamento, e nessun confronto con alcun modello diverso da Qwen3.5-35B. Per una distribuzione di uso generale, questi sono grandi spazi vuoti. Per un paper di architettura con pesi allegati, sono semplicemente fuori scope — che è il modo giusto di leggere questa release.
Domande frequenti
Cos'è Intern-S2-Mobius?
Un modello fondazionale multimodale da 35 miliardi di parametri, con licenza Apache 2.0, del team InternLM dello Shanghai AI Laboratory, costruito sull'architettura Mobius-v0 che separa l'archiviazione della conoscenza dal calcolo del ragionamento. È stato pre-addestrato in modo continuo a partire da Qwen3.5-35B e post-addestrato con SFT e apprendimento per rinforzo, ed è stato pubblicato su Hugging Face il 29 luglio 2026.
Cosa rende diversa l'architettura Mobius?
I Transformer convenzionali immagazzinano la conoscenza in un blocco feed-forward all'interno di ogni strato, quindi la conoscenza è accessibile solo alla profondità in cui risiede. Mobius lo sostituisce con una Memoria condivisa a livello globale — 2.560 esperti nella configurazione rilasciata — che quattro blocchi Reasoner interrogano ripetutamente, consentendo l'accesso alla conoscenza trasversale tra gli strati e permettendo che parte della deliberazione avvenga in stati nascosti continui invece che in token di catena di pensiero generati.
Intern-S2-Mobius è davvero 4 volte più veloce?
In media e con batch di grandi dimensioni, grosso modo sì: InternLM misura una produttività di richieste 2,9 volte superiore con batch 16, che sale a 4,6 volte con batch 256. Ma varia enormemente in base al compito. Su MMLU Pro e GPQA Diamond il guadagno è ampio a ogni dimensione del batch; su AIME e HMMT, competizioni di matematica, il Transformer di base è in realtà più veloce con batch di dimensioni intermedie. L'accelerazione dipende da quanto il modello riesce a ridurre la propria traccia di ragionamento.
Come si confronta con Qwen3.5-35B?
Vince sette dei nove benchmark generali con una media di 67.88 contro 65.05, inclusi MMLU Pro (89.05 vs 85.31), AIME 2026 (95.31 vs 92.08), HMMT 2026 (85.51 vs 78.50) e SimpleQA (28.90 vs 21.39). Perde UGD hard (73.02 vs 78.02) e HLE (19.11 vs 22.40). Nei compiti scientifici è molto avanti — 52.14 di media contro 18.20.
Posso usare Intern-S2-Mobius tramite un'API?
Al momento no. Nessun provider di inferenza lo ospita, non ci sono prezzi pubblicati e Hugging Face non elenca alcun deployment. Il self-hosting con LMDeploy, vLLM o Transformers è l'unico modo per eseguirlo oggi.
Di quale hardware ho bisogno per eseguirlo?
I pesi sono circa 73 GB in bfloat16, quindi prevedi un acceleratore di classe 141 GB o due GPU da 80 GB, più spazio per la cache KV. L'esempio LMDeploy di InternLM utilizza un parallelismo dei tensori di 1; il suo esempio vLLM utilizza 2. Si consiglia di abilitare la decodifica speculativa MTP con quattro token di bozza.
Qual è la lunghezza del suo contesto?
La configurazione supporta 262.144 token (256K). Nota che InternLM è stato valutato a 128K sulla maggior parte dei benchmark testuali e a 64K su MMLU Pro, SimpleQA e HLE, quindi la qualità validata a 256K completi non è stata dimostrata.
È multimodale?
Sì. Hugging Face lo classifica come image-text-to-text, e la configurazione include un encoder visivo a 27 livelli con gestione dei token video. Tuttavia, InternLM non ha pubblicato risultati di benchmark multimodali con questa release, quindi la capacità visiva è di fatto non documentata.
Perché include tokenizer per proteine e SMILES?
Poiché la linea Intern-S è una famiglia di modelli scientifici. Tokenizer dedicati per sequenze proteiche, notazione molecolare SMILES e acidi nucleici fanno sì che il modello legga questi formati come tipi di input nativi, motivo per cui ottiene 51,40 su Biology-Instructions dove la baseline ottiene 3,77.
La licenza è davvero Apache 2.0?
Sì — Apache 2.0, con il file di licenza nel repository. L'uso commerciale, la modifica e la ridistribuzione sono consentiti, il che è notevolmente più permissivo rispetto a molti rilasci open-weight da grandi laboratori.
Dovrei usarlo in produzione?
Non ancora. Ha una settimana, non è ospitato, non è verificato da terze parti e manca di valutazioni su coding, multimodalità, contesto lungo e sicurezza. Trattalo come candidato per la valutazione del ragionamento efficiente in termini di token o del lavoro su sequenze scientifiche, mantieni il traffico di produzione su modelli affermati tramite un endpoint neutrale rispetto al fornitore e rivalutalo quando esisteranno dati indipendenti.
Il risultato finale
Intern-S2-Mobius è uno dei rilasci di modelli davvero interessanti dell'anno, e quasi nulla di questo ha a che fare con i suoi punteggi. InternLM ha preso un'idea architetturale reale — smettere di legare la conoscenza ai layer, metterla in una Memory condivisa, e lasciare che il modello faccia parte del suo ragionamento nello spazio latente invece che nei token — l'ha scalata a 35B, l'ha addestrata correttamente, e ha rilasciato i pesi sotto Apache 2.0 insieme al technical report e ai risultati che non sono andati a suo favore. Il meccanismo di efficienza è leggibile e l'evidenza a suo supporto è internamente coerente: le trace si accorciano in media di 1,5x e fino a 5x nei task ad alta densità di conoscenza, e la produttività aumenta esattamente nella proporzione che si prevederebbe da questo.
Le riserve sono altrettanto chiare. Nessuno al di fuori dello Shanghai AI Laboratory ha verificato un singolo numero. Il confronto è rispetto alla base del modello stesso e include post-training aggiuntivo, quindi non è l'ablazione pulita che sembra. Il guadagno di velocità svanisce in gran parte sulla matematica difficile. Il modello perde sui due benchmark di ragionamento più impegnativi nella propria tabella. E non c'è modo di provarlo senza noleggiare GPU.
Quindi: non è un modello da implementare questa settimana, ma è decisamente uno da tenere d'occhio, e un'opzione davvero attraente per due specifici tipi di pubblico — team la cui fattura per il reasoning è dominata da token che nessuno legge, e gruppi scientifici che hanno bisogno di un modello piccolo, con licenza permissiva, che parli nativamente il linguaggio di proteine e molecole. Mantieni lo stack di produzione su modelli collaudati tramite un endpoint indipendente dal fornitore come OrcaRouter, avvia Mobius sul tuo hardware per il caso specifico, e misura i token per risposta corretta piuttosto che la sola accuratezza. Se l'architettura regge a un vaglio indipendente, Mobius-v0 sarà ricordato meno come un modello da 35B che come la versione prima di quella che contava.
