
Intern-S2-Mobius: El modelo de 35B que separa el conocimiento del razonamiento
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 201 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
El equipo InternLM del Laboratorio de Inteligencia Artificial de Shanghái ha publicado discretamente Intern-S2-Mobius, un modelo fundacional de pesos abiertos de 35B que hace algo que casi ningún otro modelo publicado hace: deja de almacenar conocimiento dentro de sus capas. En lugar de la disposición estándar de Transformer —donde cada capa lleva su propio bloque feed-forward lleno de hechos memorizados—, Mobius extrae todo ese conocimiento a una única Memoria compartida globalmente y permite que un pequeño número de Razonadores la consulte repetidamente. El beneficio declarado no es una puntuación más alta en los benchmarks. Es velocidad: las mismas respuestas con entre un tercio y un quinto de los tokens de razonamiento, y hasta 4.6 veces el rendimiento de solicitudes. Esta guía explica qué es realmente Mobius, qué revela su archivo de configuración que la ficha del modelo no revela, qué muestran los benchmarks publicados línea por línea —incluidas las dos filas en las que pierde—, dónde se cumple la afirmación de «4x más rápido» y dónde se desvanece, y a quién debería importarle realmente.
Nota de precisión: cada cifra que aparece a continuación proviene de la {{1}}propia ficha del modelo de InternLM{{/1}}, de sus cifras publicadas de rendimiento y eficiencia, de su guía de despliegue y de los archivos de configuración del modelo en Hugging Face. No existe ninguna {{2}}evaluación independiente de terceros{{/2}} sobre Intern-S2-Mobius al momento de escribir esto: no figura en ninguna tabla de clasificación independiente, no está desplegado por ningún proveedor de inferencia y su contador de descargas sigue en cero. Trata todas las {{3}}cifras comparativas{{/3}} como reportadas por el proveedor hasta que alguien las reproduzca. Las {{4}}especificaciones y el código{{/4}} de un modelo tan nuevo cambian rápidamente; verifica antes de construir.
TL;DR. Intern-S2-Mobius es un modelo fundacional multimodal de 35B parámetros, con licencia Apache 2.0, pre-entrenado continuamente a partir de Qwen3.5-35B y luego post-entrenado con SFT y aprendizaje por refuerzo. Su novedad es arquitectónica: el diseño Mobius-v0 reemplaza el almacenamiento de conocimiento feed-forward ligado a capas por una Memoria compartida globalmente de 2.560 expertos, consultada por cuatro bloques Reasoner apilados que pueden alcanzar conocimiento más allá de su propia profundidad (una Conexión Residual hacia atrás) y refinar estados ocultos mediante iteración latente recurrente antes de la decodificación (Razonamiento Latente Dinámico). En la evaluación de InternLM, supera a la línea base Qwen3.5-35B de la que partió en siete de nueve benchmarks generales (promedio 67.88 vs. 65.05) y la arrasa en tareas científicas (52.14 vs. 18.20), mientras produce trazas de razonamiento aproximadamente 1.5x más cortas en promedio — 4.6x más cortas en MMLU Pro, 5.0x más cortas en GPQA Diamond. Esa compresión de trazas es de donde proviene la ganancia de rendimiento: 2.9x con batch 16, aumentando a 4.6x con batch 256. Las desventajas son reales: pierde en los dos benchmarks de razonamiento más difíciles (HLE y UGD hard), la ganancia de rendimiento desaparece en gran medida en matemáticas de competición, y nadie fuera del laboratorio ha verificado nada de esto.
Conclusiones clave
Lanzamiento centrado en la arquitectura: Mobius-v0 desacopla los vectores de conocimiento de los operadores de razonamiento — una Memoria compartida de 2,560 expertos que sirve a cuatro bloques Reasoner, en lugar de 40 capas, cada una acumulando su propio conocimiento FFN.
• Eficiencia, no inteligencia, es la propuesta: la longitud promedio de salida se reduce aproximadamente 1.5 veces, y el rendimiento de solicitudes aumenta de 2.9x en batch 16 a 4.6x en batch 256 frente a la línea base Transformer.
• Realmente supera a su propio modelo base: 67.88 frente a 65.05 de media en tareas generales, ganando MMLU Pro (89.05 frente a 85.31), AIME 2026 (95.31 frente a 92.08) y HMMT 2026 (85.51 frente a 78.50).
• Pero pierde donde la deliberación importa más: HLE 19.11 vs 22.40 y UGD hard 73.02 vs 78.02 — las dos evaluaciones más difíciles del conjunto, ambas ganadas por el Transformer simple.
• El salto en ciencias es el mayor resultado individual: Biology-Instructions 51.40 vs 3.77, Mol-Instructions 45.73 vs 21.70, MolecularIQ 59.29 vs 29.13.
• Abierto pero no disponible: pesos Apache 2.0 en Hugging Face, ningún proveedor de inferencia lo aloja, ~73 GB de pesos bfloat16 — el autoalojamiento es actualmente la única forma de ejecutarlo.
Lo que Intern-S2-Mobius realmente es
Intern-S2-Mobius es un modelo fundacional de 35B publicado por internlm, la organización de Hugging Face detrás de la serie Intern del Shanghai AI Laboratory. Los pesos se publicaron en Hugging Face el 29 de julio de 2026, y el repositorio de GitHub correspondiente — README, guía de despliegue y un informe técnico completo en PDF — se hizo público el 5 de agosto de 2026. Se publica bajo Apache 2.0, que es tan permisivo como se puede ser con pesos abiertos: se permiten el uso comercial, la modificación y la redistribución.
No es un ajuste fino. Es un preentrenamiento continuo con cirugía de arquitectura. InternLM tomó Qwen3.5-35B — el modelo de mezcla de expertos de 35B con pesos abiertos de Alibaba, lanzado el 4 de marzo de 2026 — reestructuró cómo el modelo almacena y accede al conocimiento, y continuó preentrenando el resultado; luego aplicó ajuste fino supervisado y aprendizaje por refuerzo sobre él. Ese linaje importa para interpretar los benchmarks: cada comparación que InternLM publica es Mobius contra el modelo exacto del que surgió, lo que constituye la ablación más limpia posible del cambio de arquitectura y también, convenientemente, la comparación con más probabilidades de favorecerlo.
El modelo es multimodal. Hugging Face lo clasifica como image-text-to-text, y la configuración confirma un codificador de visión completo más el manejo de tokens de video. Además, a juzgar por lo que se distribuye junto con los pesos, está claramente orientado a la ciencia: más sobre esto a continuación.
La arquitectura Mobius, en lenguaje sencillo
Un Transformer convencional intercala dos tareas en cada capa. La atención mueve información entre tokens; la red feed-forward (o, en un modelo de mezcla de expertos, un banco de FFNs expertas) almacena conocimiento. Debido a que la FFN se encuentra dentro de la capa, el conocimiento que contiene solo es accesible a esa profundidad. Un hecho aprendido en la capa 30 no puede ser consultado por el razonamiento que ocurre en la capa 5. La información fluye hacia adelante, capa por capa, y ese es el único camino.
Mobius rompe ese vínculo. InternLM describe tres consecuencias.
Separación de conocimiento y razonamiento. El almacenamiento FFN ligado a capas se sustituye por una Memory compartida globalmente. En lugar de que cada una de las 40 capas posea una porción del conocimiento del modelo, hay un único fondo común al que cada etapa de razonamiento puede acceder. El argumento de InternLM es que esto mejora la compresión del conocimiento — los mismos hechos no necesitan reaprenderse de forma redundante a múltiples profundidades — y da a cada Reasoner un espacio de conocimiento mucho más amplio del que el FFN de una sola capa podría ofrecer.
Conexión residual hacia atrás. Debido a que la memoria se comparte, las etapas de razonamiento superficial y profundo acceden al mismo repositorio. El acceso al conocimiento ya no fluye estrictamente hacia adelante. Una etapa superficial puede incorporar algo que, en una pila estándar, solo estaría disponible treinta capas más adelante. La afirmación de InternLM es que esto permite al modelo componer conocimiento a través de profundidades con mayor flexibilidad y, crucialmente, sintetizar información útil en menos pasos de razonamiento. Esa última cláusula es toda la tesis del lanzamiento.
Razonamiento Latente Dinámico. En lugar de externalizar cada paso de deliberación como tokens visibles de cadena de pensamiento, Mobius refina sus estados ocultos continuos mediante iteración latente recurrente antes de decodificar cualquier cosa. Parte del «pensamiento» ocurre en el espacio de representación interna del modelo en lugar de en el texto generado, y la cantidad de ese cómputo interno se asigna dinámicamente por token. El efecto práctico es que el modelo necesita escribir menos palabras para llegar a la misma conclusión — y dado que la generación es autorregresiva y serializada, escribir menos palabras es la forma más directa de hacer que un modelo de razonamiento sea más rápido.
En conjunto, la propuesta es un modelo de razonamiento que piensa más y escribe menos.

Lo que revela el archivo de configuración
La ficha del modelo describe la arquitectura en prosa. El code>config.json/code> la hace concreta, y contiene varios números que vale la pena conocer.
• Cuatro Reasoners sobre 40 capas.La configuración de texto declara 40 capas ocultas, pero solo cuatro bloques. Las 40 capas están organizadas en cuatro etapas Reasoner que iteran contra la Memory compartida, en lugar de cuarenta unidades independientes de conocimiento más atención.
• 2,560 expertos. Esta es la Memoria compartida hecha literal. Mobius tiene 2,560 expertos con 8 activados por token y un tamaño intermedio por experto de 512, además de un experto compartido. Como referencia, su hermano Intern-S2-Preview utiliza 256 expertos. Un conjunto diez veces más grande de expertos mucho más pequeños es exactamente lo que parece "un almacén de conocimiento global en lugar de FFN por capa" cuando lo escribes como config.
• 35B en la caja, ~36B en disco, ~3B activos. La tarjeta del modelo dice 35B; el lector de safetensors de Hugging Face reporta 36B parámetros; el índice de pesos totaliza 72.96 GB en bfloat16, lo que equivale a aproximadamente 36.5B. La guía de despliegue es la más precisa: denomina al lanzamiento un modelo 30B-A3B — con alrededor de 3B parámetros activos por token. Como con cualquier MoE disperso, pagas por el conjunto completo de pesos en memoria y obtienes cómputo de modelo pequeño por token.
• Atención híbrida, 3:1. La lista de capas alterna tres capas de atención lineal por cada capa de atención completa, hasta el final: diez capas de atención completa de 40. La atención lineal evita que la memoria de contexto largo y el cómputo exploten; las capas periódicas de atención completa preservan el recuerdo exacto que la atención lineal pura sacrifica. Las capas lineales utilizan un kernel de convolución de ancho 4 y un estado SSM en float32, la receta ahora estándar de estilo gated-delta.
• Contexto de 256K. Las incrustaciones de posición máximas son 262,144. Nótese la brecha entre lo que soporta la arquitectura y cómo se evaluó: InternLM ejecutó sus pruebas de texto a 128K, y a 64K en MMLU Pro, SimpleQA y HLE. Un límite de 256K no es lo mismo que 256K de calidad validada.
• Un cabezal de predicción de múltiples tokens integrado. Hay un módulo MTP de una capa con sus propios 256 expertos. No es decorativo: la guía de implementación recomienda ejecutar con decodificación especulativa MTP y cuatro tokens de borrador, por lo que parte de la historia de velocidad en el mundo real es la decodificación especulativa, no solo la arquitectura.
• Una torre de visión real. Un codificador de visión de 27 capas y 1152 unidades ocultas con tamaño de parche 16, fusión espacial 2×2 y parcheo temporal para video, que proyecta en el flujo de texto de 2048 dimensiones con RoPE multimodal intercalado. Imágenes y video de entrada, texto de salida.
Otros detalles específicos para los curiosos: 16 cabezas de atención con dimensión de cabeza de 256, 2 cabezas clave-valor (atención de consulta agrupada agresiva), salidas de atención con compuerta, un factor rotatorio parcial de 0,25, theta de RoPE de 10 millones y un vocabulario de 251.392 tokens.
Los benchmarks, línea por línea
InternLM evaluó con OpenCompass y publicó una única comparación: Intern-S2-Mobius-35B contra Qwen3.5-35B, el modelo a partir del cual fue preentrenado continuamente. Nueve benchmarks generales, tres científicos.
En tareas generales, Mobius gana siete de nueve. MMLU Pro — conocimiento multidisciplinario amplio con distractores más difíciles que el MMLU original — obtiene 89.05 frente a 85.31, una mejora de 3.7 puntos y el resultado de conocimiento más claro del conjunto. GPQA Diamond, preguntas de ciencias de nivel de posgrado escritas para ser a prueba de Google, es esencialmente un empate con 80.81 frente a 80.24. IMO Bench, matemáticas de nivel olimpiada, obtiene 81.25 frente a 77.50. AIME 2026, el Examen de Matemáticas por Invitación de Estados Unidos, obtiene 95.31 frente a 92.08. HMMT 2026, el Torneo de Matemáticas Harvard-MIT, es el mayor cambio en matemáticas con 85.51 frente a 78.50. AMO obtiene 58.00 frente a 50.00. Y SimpleQA — recuperación de hechos en formato breve, el punto de referencia que mide más directamente si un modelo realmente sabe cosas — salta de 21.39 a 28.90, una mejora relativa del 35% que es la evidencia más contundente del argumento de InternLM de que "la memoria compartida comprime mejor el conocimiento".
Luego las dos pérdidas, y son las filas interesantes. UGD hard va en la otra dirección: 73.02 para Mobius frente a 78.02 para la línea base, un déficit de cinco puntos. Y HLE — Humanity's Last Exam, la evaluación general más difícil en uso generalizado, donde los modelos de vanguardia todavía obtienen puntuaciones entre los diez y los veintitantos — es 19.11 frente a 22.40. El Transformer simple gana por 3.3 puntos en la prueba de referencia diseñada específicamente para requerir el mayor razonamiento.
Ese patrón no es ruido, y no está oculto: InternLM lo publicó. La lectura más plausible es que el razonamiento latente es una compresión, y la compresión es con pérdidas en la cola. Internalizar la deliberación en estados ocultos continuos funciona de maravilla cuando la deliberación se basa en gran medida en la recuperación o sigue una forma conocida — lo cual describe MMLU Pro, SimpleQA y la mayoría de las matemáticas de competición. En problemas que realmente requieren cadenas de pensamiento largas, exploratorias y con corrección de errores, el rastro explícito token por token todavía parece valer su costo. El promedio general — 67.88 frente a 65.05 — es una victoria real, pero es un promedio que oculta una disyuntiva, no una mejora uniforme.
Los resultados científicos son de una escala de diferencia distinta. Biology-Instructions pasa de 3.77 a 51.40. Mol-Instructions, que cubre la comprensión y generación molecular, pasa de 21.70 a 45.73. MolecularIQ pasa de 29.13 a 59.29. El promedio es de 52.14 frente a 18.20. Números como 3.77 que suben a 51.40 no son victorias de arquitectura; son la firma de un entrenamiento de dominio específico en tareas que la línea base nunca fue enseñada a hacer. Qwen3.5-35B obteniendo menos del 4% en Biology-Instructions significa que no comprende el formato de la tarea, no que sea malo en biología. Lee esas tres filas como "InternLM añadió una especialización científica," lo cual es genuinamente valioso y es el punto central de la línea Intern-S — solo no lo atribuyas a la arquitectura Mobius.
Dónde "4 veces más rápido" es real, y dónde no lo es
La afirmación de eficiencia es la razón por la que existe este modelo, así que merece una lectura cuidadosa. El titular de InternLM es "aceleración de inferencia de extremo a extremo de casi 4x". La cifra de rendimiento publicada es más informativa que el titular, y más honesta.
Medido como rendimiento de solicitudes en función del tamaño de lote, promediado entre benchmarks, Mobius supera la línea base de Transformer en 2.9x con lote 16 y 4.6x con lote 256. La brecha se amplía con el tamaño de lote, lo cual es de esperar cuando la ventaja proviene de generar menos tokens por solicitud: cuantas más solicitudes se agrupan, más se acumulan los pasos de decodificación ahorrados. El titular de "casi 4x" es un punto medio de un rango, no una constante.
Al desglosarlo por benchmark, el panorama se vuelve más nítido. En MMLU Pro y GPQA Diamond, Mobius es dramáticamente más rápido en todos los tamaños de lote — las curvas de rendimiento se separan de inmediato y siguen divergiendo. En IMO Bench, lidera de manera consistente pero modesta. En AIME 2026 y HMMT 2026, el Transformer de referencia en realidad es más rápido en tamaños de lote intermedios, y Mobius solo se adelanta en el lote 256. En las matemáticas de competencia más difíciles, la ventaja de rendimiento es nula o peor en gran parte del rango operativo útil.
¿Por qué? Porque el rendimiento sigue la compresión del rastro casi perfectamente. La longitud media de salida entre los puntos de referencia se reduce aproximadamente 1,5x, de unos 20.400 tokens a unos 13.200. Pero esa media abarca un rango enorme: 4,6x más corto en MMLU Pro (unos 1.100 tokens frente a 5.150) y 5,0x más corto en GPQA Diamond (unos 2.600 frente a 12.900), frente a solo 1,4x en IMO Bench, 1,5x en AIME 2026 y 1,2x en HMMT 2026. Donde el modelo puede comprimir su pensamiento, vuela. Donde el problema exige 24.000 tokens de derivación pase lo que pase, no puede, y en su lugar se hacen evidentes los costes generales de la arquitectura.
La traducción práctica: si tu carga de trabajo consiste en recuperación de conocimiento, opción múltiple, preguntas y respuestas técnicas o clasificación, la aceleración es grande e inmediata. Si tu carga de trabajo es derivación matemática o científica difícil, presupuesta aproximadamente paridad y sorpréndete gratamente. Quien cite "4x más rápido" como una propiedad general del modelo está citando un promedio de dos comportamientos muy diferentes.

La pila de ciencia escondida en la lista de archivos.
Una de las cosas más reveladoras de esta versión no está en absoluto en la tarjeta del modelo, sino en la lista de archivos del repositorio. Junto a los archivos de tokenizador habituales, Intern-S2-Mobius incluye tres tokenizadores de dominio adicionales: code>tokenizer_PROT.model/code> para secuencias de proteínas, code>tokenizer_SMILES.model/code> para estructuras moleculares en notación SMILES, y code>tokenizer_XNA.model/code> para secuencias de ácidos nucleicos. También hay una matriz NumPy suelta de datos sísmicos en el repositorio.
Los tokenizadores dedicados para proteínas, moléculas y ADN/ARN no son algo que se añada a la ligera. Significan que el modelo fue entrenado para leer esos tipos de secuencia como entradas de primera clase, en lugar de como texto ordinario que casualmente contiene letras. Eso es lo que convierte un 3.77 en un 51.40 en Biology-Instructions, y sitúa a Mobius en la misma familia que su hermano Intern-S2-Preview, que añadió modalidades de series temporales y visión y, según InternLM, fue el primer modelo de código abierto con capacidad de generación de estructuras cristalinas de materiales.
Si eres un desarrollador de propósito general, esto es algo trivial. Si trabajas en biología computacional, quimioinformática o ciencia de materiales, puede ser la línea más importante de este artículo: este es un modelo pequeño, con licencia Apache-2.0, autoalojable, que habla SMILES y secuencias de proteínas de forma nativa.
Dónde se sitúa en la familia Intern
La línea Intern-S es la serie multimodal científica del Laboratorio de Inteligencia Artificial de Shanghái. Intern-S1 estableció el formato. Intern-S1-Pro lo escaló a la clase de billones de parámetros. Intern-S2-Preview, lanzado poco antes de Mobius, es la apuesta por la eficiencia: un modelo de 36B en total y 3B activos, con 256 expertos y un contexto de 262K que, según InternLM, iguala al S1-Pro de escala de billones en las tareas científicas profesionales principales — una reducción de parámetros de aproximadamente 30x para una capacidad científica comparable.
Intern-S2-Mobius es una tercera cosa: un arquitectónico lanzamiento que lleva el nombre de Intern-S2. El "v0" en Mobius-v0 está haciendo un trabajo real en esa etiqueta: esta es la primera iteración pública de un diseño, no una línea de productos madura. Se conecta a ArchSpace, la plataforma abierta de InternLM para validar innovaciones en arquitectura de LLM, cuyo objetivo declarado es "convertir la exploración de arquitecturas de LLM en conocimiento reutilizable para la comunidad", con revisión por pares y resultados publicados, incluidos los negativos. Mobius es el aspecto que tiene ese programa cuando una propuesta pasa de una sonda de escala 1B a un modelo de 35B que realmente puedes descargar. Un informe técnico completo se incluye con el repositorio de GitHub para cualquiera que quiera las derivaciones.
Visto desde esa perspectiva, las dos pérdidas en los benchmarks son una característica del lanzamiento, no una vergüenza. Es un laboratorio que publica honestamente un experimento de arquitectura, incluyendo dónde retrocedió.
Cómo ejecutarlo
Intern-S2-Mobius cuenta con el respaldo de tres pilas de inferencia, y la guía de despliegue ofrece invocaciones funcionales para cada una.
LMDeploy es la ruta recomendada y la única que la guía muestra en una sola GPU: sirve con el backend de PyTorch, code>--trust-remote-code/code>, paralelismo de tensores de 1, y decodificación especulativa MTP habilitada mediante el algoritmo especulativo qwen3_5_mtp con cuatro tokens de borrador. vLLM se muestra con paralelismo de tensores de 2, el analizador de razonamiento qwen3, el analizador de llamadas a herramientas qwen3_coder, la selección automática de herramientas y decodificación especulativa MTP con cuatro tokens especulativos. Transformers funciona para la inferencia básica mediante code>AutoModelForImageTextToText/code> con code>trust_remote_code=True/code> y bfloat16 — tenga en cuenta que el modelo incluye código de modelado personalizado, por lo que la ejecución de código remoto es obligatoria, y la configuración apunta a Transformers 5.2.
Los parámetros de muestreo recomendados por InternLM son temperatura 0.8, top-p 0.95, top-k 50 y min-p 0.0 — más cálidos que los ajustes casi codiciosos que la mayoría de los modelos de razonamiento prefieren, algo que vale la pena respetar en lugar de sobrescribir por costumbre.
En cuanto al hardware: aproximadamente 73 GB de pesos en bfloat16 más la caché KV y las activaciones significan que un único acelerador de 80 GB queda justo, mientras que una tarjeta de 141 GB es cómoda, que es presumiblemente la razón por la que el ejemplo de vLLM usa dos GPU mientras que el ejemplo de LMDeploy asume una grande. El trabajo de contexto largo elevará ese requisito. Habilita MTP: la guía lo recomienda explícitamente, y una parte significativa de la aceleración anunciada reside ahí, no en la arquitectura base.
La advertencia práctica más importante: ningún proveedor de inferencias aloja actualmente este modelo. El panel de proveedores de Hugging Face lo indica claramente, y el contador de descargas seguía en cero cuando se escribió esto. No hay ningún punto de conexión de API, ni precio por millón de tokens, ni una forma gestionada de probarlo. El autoalojamiento es la única opción hoy en día.

¿A quién debería importarle realmente?
1. Equipos que ejecutan cargas de trabajo de razonamiento de alto volumen y basadas en recuperación
Este es el perfil para el que se construyó la arquitectura. Si atiendes grandes lotes de preguntas y respuestas técnicas, análisis de documentos, extracción estructurada o clasificación de opción múltiple mediante un modelo de razonamiento, y tu factura está dominada por tokens de razonamiento que nunca le muestras al usuario, un modelo que llega a la misma respuesta con una quinta parte de los tokens es una reducción directa de costos. Las cifras de MMLU Pro y GPQA —trazas 4.6x y 5.0x más cortas con precisión igual o superior— tienen exactamente esta forma. Compáralo con tu propio tráfico antes de creerlo, pero el mecanismo es sólido y el incentivo es grande.
2. Grupos de ciencia computacional
Tokenizadores nativos de proteínas, SMILES y ácidos nucleicos, además de grandes mejoras medidas en benchmarks de biología y biología molecular, en un modelo Apache 2.0 que cabe en una o dos GPU. Para un laboratorio que necesita que los datos permanezcan en sus instalaciones y no puede enviar estructuras moleculares a una API comercial, esa combinación es poco habitual. La línea Intern-S ha estado avanzando hacia esto, y Mobius es el punto de entrada más económico hasta ahora.
3. Investigadores y observadores de arquitectura.
El desacoplamiento del razonamiento basado en conocimiento y el razonamiento latente han sido líneas de investigación activas desde hace tiempo; muy pocas se han validado a 35B y se han publicado abiertamente con los casos de fallo intactos. Si te importa hacia dónde se dirigen las arquitecturas post-Transformer, el informe técnico y las dos filas perdedoras resultan más interesantes que la puntuación media. ArchSpace está explícitamente diseñado para hacer reutilizable este tipo de resultado.
A quién no debería importarle, al menos por ahora: cualquiera que busque un asistente general de producción. No hay un endpoint alojado, no hay evaluación independiente, no hay herramientas de ecosistema ni historial. Eso no es una crítica al modelo — es una descripción de un lanzamiento de investigación que tiene una semana de antigüedad.
Cómo encaja en una pila de producción
La posición honesta de Intern-S2-Mobius hoy es candidato a evaluación, no modelo por defecto. Es un artefacto de investigación sin alojar, sin verificar, de una semana de antigüedad, con una arquitectura genuinamente interesante y una fortaleza muy específica — razonamiento eficiente en tokens para tareas de recuperación — más una especialización real en datos de secuencias científicas.
Un patrón sensato es mantener tu tráfico de producción en un endpoint independiente del proveedor como OrcaRouter, que te ofrece una API compatible con OpenAI para muchos modelos, y montar Mobius por separado en tus propias GPU para el nicho reducido donde podría destacar. Mide lo que de verdad importa para este modelo: no solo la precisión, sino los tokens gastados por respuesta correcta. Ese es el eje para el que Mobius está optimizado, y es el eje que la mayoría de los bancos de pruebas ignoran. Si se sostiene en tu carga de trabajo, tienes una vía autoalojada que es barata de operar y sin problemas legales. Si no, has perdido un día de tiempo de GPU y tu ruta de producción nunca se movió.
La misma lógica se aplica a la inversa si un proveedor finalmente lo aloja: un router te permite probar A/B un nuevo modelo contra tu actual sin reescribir nada, que es exactamente la forma correcta de adoptar una arquitectura que nadie ha probado de forma independiente.
Limitaciones y advertencias
Comencemos por la más importante: no hay verificación independiente de ninguna de las cifras de este artículo. Cada punto de referencia, cada curva de rendimiento y cada comparación de longitud de tokens proviene de InternLM. La comparación también es estructuralmente favorable: Mobius se mide únicamente frente a la línea base específica desde la que se realizó el preentrenamiento continuo, no frente a la frontera actual, y el posentrenamiento adicional con SFT y RL implica que la comparación no es una ablación de arquitectura limpia, aunque se presente como tal. Parte de la mejora es de Mobius; otra parte es simplemente más entrenamiento.
Las regresiones son reales y están en las tareas más difíciles. Perder HLE por 3,3 puntos y UGD hard por 5 puntos, mientras gana en casi todo lo más fácil, es una señal coherente y ligeramente preocupante para un modelo cuyo punto fuerte es la eficiencia de razonamiento.
Operativamente, la fricción es significativa. El código de modelado personalizado implica code>trust_remote_code/code> y una versión de Transformers de última generación. Los frameworks que lo soportan deben ser lo suficientemente recientes como para saber qué es un code>interns2_mobius/code> es, y la propia guía de InternLM advierte que estas son configuraciones de referencia en desarrollo activo. Aproximadamente 73 GB de pesos no es un modelo para portátil. No hay API alojada, ni precios, ni límites de velocidad, ni SLA — porque no hay servicio.
Por último, cabe señalar lo que no se ha publicado: no hay resultados de pruebas comparativas multimodales a pesar de contar con un codificador visual completo, no hay evaluación de contexto largo a pesar de un límite de 256K, no hay pruebas comparativas de codificación en absoluto, no hay evaluación de seguridad o alineación, y no hay comparación con ningún otro modelo aparte de Qwen3.5-35B. Para un despliegue de propósito general, esos son grandes vacíos. Para un artículo de arquitectura con pesos incluidos, simplemente quedan fuera del alcance, que es la forma correcta de interpretar este lanzamiento.
Preguntas frecuentes
¿Qué es Intern-S2-Mobius?
Un modelo fundacional multimodal de 35B parámetros, con licencia Apache 2.0, del equipo InternLM del Shanghai AI Laboratory, construido sobre la arquitectura Mobius-v0 que separa el almacenamiento de conocimiento del cálculo de razonamiento. Fue preentrenado de forma continua a partir de Qwen3.5-35B y post-entrenado con SFT y aprendizaje por refuerzo, y publicado en Hugging Face el 29 de julio de 2026.
¿Qué hace que la arquitectura Mobius sea diferente?
Los Transformers convencionales almacenan conocimiento en un bloque feed-forward dentro de cada capa, por lo que el conocimiento solo es accesible en la profundidad donde reside. Mobius reemplaza eso con una Memory compartida globalmente — 2,560 expertos en la configuración publicada — que cuatro bloques Reasoner consultan repetidamente, permitiendo el acceso al conocimiento a través de las profundidades y dejando que parte de la deliberación ocurra en estados ocultos continuos en lugar de tokens de cadena de pensamiento generados.
¿Es Intern-S2-Mobius realmente 4 veces más rápido?
En promedio y con tamaños de lote grandes, aproximadamente sí: InternLM mide un throughput de solicitudes 2.9 veces mayor en el lote 16, que sube a 4.6 veces en el lote 256. Pero varía enormemente según la tarea. En MMLU Pro y GPQA Diamond la ganancia es grande en todos los tamaños de lote; en matemáticas de competencia AIME y HMMT, el Transformer base es en realidad más rápido en tamaños de lote intermedios. La aceleración se correlaciona con cuánto puede el modelo acortar su traza de razonamiento.
¿Cómo se compara con Qwen3.5-35B?
Gana siete de nueve benchmarks generales con un promedio de 67.88 frente a 65.05, incluyendo MMLU Pro (89.05 vs 85.31), AIME 2026 (95.31 vs 92.08), HMMT 2026 (85.51 vs 78.50) y SimpleQA (28.90 vs 21.39). Pierde UGD hard (73.02 vs 78.02) y HLE (19.11 vs 22.40). En tareas científicas está muy por delante: promedio de 52.14 frente a 18.20.
¿Puedo usar Intern-S2-Mobius a través de una API?
Actualmente no. Ningún proveedor de inferencia lo aloja, no hay precios publicados y Hugging Face no lista ningún despliegue. El autoalojamiento con LMDeploy, vLLM o Transformers es la única forma de ejecutarlo hoy en día.
¿Qué hardware necesito para ejecutarlo?
Los pesos ocupan aproximadamente 73 GB en bfloat16, así que prevé un acelerador de clase 141 GB o dos GPU de 80 GB, más margen para la caché KV. El ejemplo de LMDeploy de InternLM usa paralelismo tensorial de 1; su ejemplo de vLLM usa 2. Se recomienda habilitar la decodificación especulativa MTP con cuatro tokens de borrador.
¿Cuál es su longitud de contexto?
La configuración admite 262,144 tokens (256K). Tenga en cuenta que InternLM se evaluó a 128K en la mayoría de los benchmarks de texto y a 64K en MMLU Pro, SimpleQA y HLE, por lo que no se ha demostrado una calidad validada en los 256K completos.
¿Es multimodal?
Sí. Hugging Face lo clasifica como imagen-texto-texto, y la configuración incluye un codificador visual de 27 capas con manejo de tokens de video. Sin embargo, InternLM no publicó resultados de evaluaciones multimodales con esta versión, por lo que la capacidad de visión no está documentada en la práctica.
¿Por qué incluye tokenizadores de proteínas y SMILES?
Debido a que la línea Intern-S es una familia de modelos científicos. Los tokenizadores dedicados para secuencias de proteínas, notación molecular SMILES y ácidos nucleicos hacen que el modelo lea esos formatos como tipos de entrada nativos, por lo que obtiene 51.40 en Biology-Instructions, donde la línea base obtiene 3.77.
¿La licencia es realmente Apache 2.0?
Sí — Apache 2.0, con el archivo de licencia en el repositorio. Se permiten el uso comercial, la modificación y la redistribución, lo cual es notablemente más permisivo que muchos lanzamientos de pesos abiertos de grandes laboratorios.
¿Debería usarlo en producción?
Todavía no. Tiene una semana, no está alojado, no ha sido verificado por ningún tercero y carece de evaluaciones de codificación, multimodales, de contexto largo y de seguridad. Trátelo como candidato de evaluación para razonamiento eficiente en tokens o trabajo con secuencias científicas, mantenga el tráfico de producción en modelos establecidos a través de un endpoint independiente del proveedor y vuelva a considerarlo cuando existan cifras independientes.
En resumen
Intern-S2-Mobius es uno de los lanzamientos de modelos más genuinamente interesantes del año, y casi nada de eso tiene que ver con sus puntuaciones. InternLM tomó una idea arquitectónica real — dejar de vincular el conocimiento a las capas, ponerlo en una Memoria compartida, y permitir que el modelo haga parte de su razonamiento en el espacio latente en lugar de en tokens — la escaló a 35B, la entrenó adecuadamente, y publicó los pesos bajo Apache 2.0 junto con el informe técnico y los resultados que no le favorecieron. El mecanismo de eficiencia es legible y la evidencia que lo respalda es internamente consistente: las trazas se acortan en promedio 1.5x y hasta 5x en tareas intensivas en conocimiento, y el rendimiento aumenta exactamente en la proporción que cabría predecir a partir de ello.
Las advertencias son igualmente claras. Nadie fuera del Laboratorio de IA de Shanghái ha verificado una sola cifra. La comparación se realiza contra la base del propio modelo e incluye entrenamiento adicional posterior, por lo que no es la ablación limpia que parece. La aceleración desaparece en gran medida en matemáticas difíciles. El modelo pierde en los dos puntos de referencia de razonamiento más exigentes de su propia tabla. Y no hay forma de probarlo sin alquilar GPUs.
Entonces: no es un modelo para desplegar esta semana, pero desde luego uno a seguir de cerca, y una opción genuinamente atractiva para dos audiencias concretas: equipos cuya factura de razonamiento está dominada por tokens que nadie lee, y grupos científicos que necesitan un modelo pequeño, con licencia permisiva, que hable de forma nativa el lenguaje de proteínas y moléculas. Mantén la pila de producción en modelos probados a través de un endpoint neutral respecto al proveedor como OrcaRouter, levanta Mobius en tu propio hardware para el caso específico, y mide tokens por respuesta correcta en lugar de solo la exactitud. Si la arquitectura resiste un escrutinio independiente, Mobius-v0 será recordado menos como un modelo de 35B que como el número de versión anterior al que de verdad importó.
