
Intern-S2 vs Gemini 3.1 Pro: el enfrentamiento multimodal que InternLM realmente midió
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
La mayoría de las comparativas de esta serie requieren combinar las afirmaciones de dos proveedores. Esta no. Intern-S2, el modelo multimodal Apache-2.0 de 397 mil millones de parámetros que InternLM lanzó hoy, y Gemini 3.1 Pro, el modelo de razonamiento insignia de Google, ambos aparecen como columnas medidas en la misma tabla de benchmark, lo que convierte esta en la comparación cara a cara más justa del conjunto y, no por casualidad, en la que el modelo abierto tiene más que justificar. Gemini 3.1 Pro lee texto, imágenes, audio y video, admite un contexto de 1 M de tokens, y ha sido desmenuzado por laboratorios independientes y tráfico de producción desde que entró en vista previa el 19 de febrero de 2026. Intern-S2 lee texto, imágenes y series temporales, se subió a Hugging Face esta mañana y no tiene ninguna puntuación de terceros de ningún tipo. En las filas en las que ambos fueron medidos, el modelo de Google gana más de la mitad de ellas.
Ambos leen imágenes. Ahí es donde termina la semejanza.
La palabra «multimodal» hace que estos modelos suenen como pares. No son pares, y la diferencia está en lo que cada uno fue construido para mirar.
La ruta de visión de Intern-S2 se entrenó para consumir páginas sin procesar de literatura científica —figuras, ecuaciones, diagramas estructurales, maquetación— como una única representación compartida, en lugar de extraer primero el texto. Sus benchmarks multimodales son científicos: VQA de microscopía biológica, teledetección y respuesta a preguntas sobre gráficos científicos. También acepta datos de series temporales y puede generar pronósticos, un tipo de entrada que casi ningún modelo insignia de propósito general maneja en absoluto.
La multimodalidad de Gemini 3.1 Pro es de propósito general y más amplia en cuanto a tipos: texto, imagen, audio y video, en un solo modelo, orientada a toda la gama de tareas de producción en las que se apunta un modelo a un archivo y se hace una pregunta. Una grabación de reunión, una captura de pantalla de la interfaz de usuario, un gráfico en un PDF, un clip de video: todo vale, y todo ello con seis meses de evaluación pública a sus espaldas.
Si tu entrada es una figura científica, Intern-S2 se diseñó específicamente para ello y cuenta con las cifras del proveedor para defender su caso. Si tu entrada es cualquier otra cosa, Gemini 3.1 Pro admite audio y video, e Intern-S2 no admite ninguno de los dos. Eso resuelve una gran parte de las preguntas de «¿cuál debería usar?» antes de que entren en juego el precio o los benchmarks, y quien te diga que los dos son intercambiables no ha leído la lista de entradas.
Lo que muestra la tabla compartida, léelo con honestidad
Debido a que InternLM evaluó a ambos, este es uno de los pocos casos en los que una comparación directa es legítima en lugar de ensamblada. La advertencia no ha cambiado y vale la pena enunciarla una vez: cada cifra de Intern-S2 es reportada por el proveedor, obtenida por InternLM en su propio entorno de pruebas a través de OpenCompass, VLMEvalKit y AgentCompass, sin reproducción independiente. Las cifras de Gemini en esa tabla también provienen de la ejecución de la comparación realizada por InternLM, aunque Gemini cuenta con un extenso historial independiente fuera de ella.
• Conocimiento multimodal — Gemini 3.1 Pro 83.99 en MMMU Pro frente a Intern-S2 81.68.
• QA de gráficos científicos — Gemini 3.1 Pro 71,18 en ChartQAPro frente a Intern-S2 71,12. Un empate técnico hasta el segundo decimal.
• Teledetección — Gemini 3.1 Pro 54.27 en XLRS-Bench frente a Intern-S2 51.38.
• VQA de microscopía — Gemini 3.1 Pro 71.02 en MicroVQA vs Intern-S2 69.67.
• Tareas multimodales científicas — Intern-S2 60.74 en SFE vs Gemini 3.1 Pro 59.57. La única victoria multimodal de Intern-S2.
• Conocimiento general — Gemini 3.1 Pro 91.00 en MMLU Pro vs. Intern-S2 89.77.
• Matemáticas de secundaria — Gemini 3.1 Pro 94.70 en HMMT-2026 vs Intern-S2 93.56.
• Razonamiento sobre literatura científica — Intern-S2 55,71 en Biology-Instructions frente a Gemini 3.1 Pro 13,87, y 53,95 frente a 38,84 en Mol-Instructions.
• Problemas de olimpiadas de ciencias — Intern-S2 87.00 en FrontierScience-Olympiad vs Gemini 3.1 Pro 79.00.
• Dominio de la terminal — Gemini 3.1 Pro 73.80 en TerminalBench 2.1 frente a Intern-S2 64.04.
La lectura honesta: Gemini 3.1 Pro gana las filas multimodales generales por márgenes estrechos, Intern-S2 gana las filas de literatura científica profunda por márgenes enormes, y ninguno de los dos resultados resulta sorprendente dado el material con el que se entrenó cada uno. La estrechez de las derrotas multimodales es, podría decirse, el hallazgo más interesante: que un checkpoint abierto publicado el mismo día quede a dos puntos de un modelo insignia cerrado de hace seis meses en MMMU Pro y ChartQAPro es un resultado más contundente para InternLM que cualquiera de sus arrolladoras cifras en ciencia.
Contexto, salida y la pregunta de vista previa
La historia de las entradas largas se divide con claridad. Gemini 3.1 Pro mantiene una ventana de contexto de 1M de tokens con un límite de salida de 64K —suficiente para un conjunto extenso de documentos y una respuesta sustancial—. Intern-S2 se evalúa con hasta 256K tokens para razonamiento de texto y 64K para multimodal, y no publica un límite de salida; considera su ventana utilizable como más pequeña que la de Gemini hasta que alguien la mida de forma independiente.
Hay una advertencia operativa del lado de Google que corresponde a cualquier comparación honesta. Gemini 3.1 Pro sigue siendo un modelo en vista previa, no una versión de disponibilidad general. Los modelos en vista previa conllevan expectativas de fiabilidad más bajas, y un panel de tasa de errores de 7 días en la página de un modelo es un recordatorio constante de rodear la inestabilidad en lugar de construir una ruta crítica sobre ella. Intern-S2 es una versión completa bajo Apache-2.0 con pesos que puedes fijar, lo que, contraintuitivamente, hace que el flamante modelo abierto sea el más estable operativamente de los dos en el sentido que más importa: nadie puede cambiarlo bajo tus pies.
• Contexto — Intern-S2 256K texto / 64K multimodal evaluado frente a Gemini 3.1 Pro 1M tokens.
• Entradas — Intern-S2: texto, imagen, series temporales frente a Gemini 3.1 Pro: texto, imagen, audio, vídeo.
• Pesos — Intern-S2 Apache-2.0, descargable vs Gemini 3.1 Pro cerrado.
• Madurez — Intern-S2 con apenas unas horas de vida, sin puntuación independiente frente a Gemini 3.1 Pro preview desde febrero de 2026, probado de forma exhaustiva e independiente.
• Precio — Intern-S2 no tiene lista de precios pública; autoalojamiento o API oficial de Intern frente a Gemini 3.1 Pro: $2.00 de entrada / $12.00 de salida por millón, que aumentan a $4.00/$18.00 por encima de 200K tokens de entrada.

Precio y dónde vive cada uno
Gemini 3.1 Pro factura $2.00 por millón de tokens de entrada y $12.00 por millón de tokens de salida en el nivel estándar, y pasa a $4.00/$18.00 en cuanto una solicitud supera los 200K tokens de entrada — un recargo por contexto largo que muerde exactamente cuando usas la ventana de 1M que justifica elegirlo. Es enrutable en OrcaRouter a ese mismo precio de lista, transferido con 0% de margen, en una clave que además incluye más de 200 modelos; la transferencia importa aquí porque un cambio de precio de Google llega a nuestro lado el mismo día en lugar de tras un ciclo de reajuste de precios. El DSL de enrutamiento es la parte útil para este emparejamiento concreto: puedes enviar el trabajo de imagen y vídeo a Gemini 3.1 Pro y los lotes de documentos científicos a un Intern-S2 autoalojado, y mantener ambos tras un único endpoint sin un segundo contrato ni un cambio de código.
Intern-S2 no tiene un precio de API publicado. El autoalojamiento de los pesos Apache-2.0 es la vía que la mayoría de los equipos tomará en la práctica, y con 403.000 millones de parámetros es un compromiso de hardware importante. La API oficial de Intern existe para equipos que preferirían no tener que ejecutar GPU, pero sin una lista de precios pública, la comparación de costos con los $2/$12 de Gemini no es algo que se pueda hacer sobre el papel: hay que solicitar cuota y hacer las cuentas uno mismo.

La llamada
Elige Gemini 3.1 Pro si necesitas un modelo multimodal general que acepte audio y video, admita un millón de tokens, cuente con meses de validación independiente y pueda alquilarse por token hoy mismo. Es el modelo mejor respaldado por evidencia y con capacidades más amplias, y la insignia de vista previa es una advertencia de fiabilidad, no de capacidad.
Elige Intern-S2 si tu entrada multimodal es científica y tus datos no pueden salir de tu infraestructura. Es el único de los dos que lee páginas de literatura sin procesar de forma nativa, hace pronósticos a partir de señales de series temporales y puede afinarse con datos experimentales propietarios bajo una licencia permisiva. Acepta que eres la primera persona en ejecutarlo y que la tabla de referencia que aboga por él fue escrita por las personas que lo crearon.

Ninguno de los dos modelos gana esto de manera concluyente, y la tabla lo demuestra mejor de lo que podría hacerlo un veredicto. Uno es un generalista que resulta ser bueno en ciencia; el otro es un instrumento científico que resulta ser competitivo en trabajo multimodal general — y en un lanzamiento abierto el mismo día, «competitivo» es el resultado más sorprendente.
Para sostener ambas mitades de esta comparación sin un segundo contrato: una sola clave de API que cubre más de 200 modelos pone el modelo insignia multimodal cerrado y cada alternativa detrás de un único endpoint, de modo que puedes dirigir el trabajo de imágenes y vídeo por un camino y los lotes de documentos por el otro.
