
Reflection Beam vs Gemini 3.1 Pro Preview: uno lee video, el otro lee texto
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Empiece por la asimetría que no menciona ninguna tabla de benchmarks de este enfrentamiento. Reflection Beam, anunciado el 5 de octubre de 2026, es un modelo de mezcla de expertos disperso de 501.000 millones de parámetros, con 23.000 millones de parámetros activos por token, y recibe texto y devuelve texto. Nada más. Gemini 3.1 Pro Preview, el modelo multimodal de frontera del proveedor desde el 19 de febrero de 2026, acepta texto, imágenes, vídeo, audio y archivos, y es el único modelo de esta comparación en el que la pregunta «¿puede ver aquello sobre lo que quiero preguntar?» tiene una respuesta distinta para cada lado. Todo lo demás —las proporciones de dispersión, las ventanas de contexto, los niveles de precio— es un argumento. Eso es una especificación.
También significa que este es el par menos simétrico del conjunto, y el más útil, porque revela para qué sirve realmente una comparación de modelos. Si tu carga de trabajo es texto, Beam y Gemini 3.1 Pro son dos opciones en un espectro que va de barato y sin medir a caro y evaluado a fondo. Si tu carga de trabajo incluye un fotograma de vídeo, no hay comparación posible.
Qué es cada modelo
Gemini 3.1 Pro Preview es el buque insignia de nivel preview de Google: 1,048,576 tokens de contexto, una salida máxima de 65,536 tokens, cinco modalidades de entrada y una ventana de 1 millón de tokens a la que se llega mediante una escala de precios en lugar de una tarifa plana. Google lo posiciona para ingeniería de software mejorada, mayor fiabilidad agéntica y un uso más eficiente de tokens en flujos de trabajo complejos. No es de pesos abiertos. Su nombre todavía incluye "Preview", un estado que Google ha mantenido para este modelo desde febrero.
Reflection Beam es el primer modelo de Reflection y el comienzo de una serie de pesos abiertos. 501.000 millones de parámetros totales, 23.000 millones activos —alrededor del 4,6 por ciento del modelo despierto por token—. 23,8 billones de tokens de preentrenamiento en 6.144 chips GB300 en menos de cuatro semanas, y luego una campaña de aprendizaje por refuerzo en 10.500 chips GB300 durante cuatro semanas con más de 100 millones de rollouts en aproximadamente un millón de entornos. Su API es compatible con OpenAI en api.reflection.ai/openai/v1 con Chat Completions y una lista de Models, su contexto es de 256.000 tokens con una nota al pie en beta, su parámetro reasoning_effort tiene cinco niveles y no tiene interruptor de apagado, y sus pesos están prometidos para más adelante este mes bajo Apache 2.0.
• Modalidad — Gemini 3.1 Pro Preview acepta texto, imagen, video, audio y archivo; Reflection Beam solo acepta texto.
• Contexto y salida — {{1}}1.048.576 tokens de entrada y 65.536 de salida para Gemini{{/1}}, frente a {{2}}256.000 de entrada y 128.000 de salida para Beam{{/2}}.
• Precio — Gemini 3.1 Pro Preview a $2.00 de entrada y $12.00 de salida por millón de tokens hasta 200,000 tokens, y sube a $4.00 y $18.00 por encima de esa cantidad, con lecturas de caché a $0.20; Reflection Beam no tiene un precio publicado.
• Superficie de herramientas — llamada a herramientas nativa, salidas estructuradas y grounding de búsqueda en el lado de Google; llamada a herramientas y salidas estructuradas en el lado de Beam, con un endpoint limitado a Chat Completions.
• Pesos — propietarios para Gemini; Apache 2.0 prometido para Beam, aún no publicado.
• Puntuación independiente: Gemini 3.1 Pro Preview cuenta con un índice de Artificial Analysis; Beam no tiene fila en la tabla.
La brecha de modalidad es todo el argumento
Vale la pena ser concreto en lugar de señalar vagamente lo "multimodal", porque las consecuencias prácticas son específicas.
Una carga de trabajo que ingiere una grabación de pantalla, una foto de producto, un contrato escaneado o un archivo de audio de un centro de llamadas no puede ser atendida por Beam a ningún precio, con ningún prompt, en ningún plan. No hay solución alternativa en la capa de API: la documentación de Beam describe una modalidad de entrada y una modalidad de salida, y no se enumera ninguna vía de imagen o audio. Gemini 3.1 Pro Preview maneja las cinco, lo que significa que es el único modelo aquí que puede integrarse en un flujo de trabajo donde la entrada no sea ya texto.
El caso inverso también merece mencionarse, porque es el que la gente suele malinterpretar. Si tu entrada es texto y va a seguir siendo texto, las cinco modalidades de Gemini no te aportan nada, y estás pagando el precio de un modelo multimodal para ejecutar una carga de trabajo de texto. Eso no es un argumento a favor de Beam, sino un argumento de que la cuestión de la modalidad debería responderse antes que la del benchmark, porque elimina opciones de forma más barata y fiable que cualquier comparación de puntuaciones.
Dos vistas previas, dos significados diferentes
Ambos nombres de modelo conllevan una salvedad y las salvedades no son similares, lo cual es lo más interesante de este emparejamiento.
El «Preview» de Gemini 3.1 Pro es una convención de nomenclatura en un modelo que ha sido generalmente invocable desde febrero, con una puntuación independiente, una tarifa publicada que incluye un nivel documentado de contexto largo y una superficie completa de herramientas. En la práctica, «preview» aquí significa que Google se reserva el derecho de sustituirlo, no que sea difícil de conseguir o que no tenga puntuación.
La beta de Beam es una barrera real. El acceso es una lista de espera, el ID del modelo se creó el 5 de octubre de 2026, no hay tarifario, ni puntuación de terceros, y los artefactos que permitirían a cualquiera verificar la afirmación central —pesos, informe técnico, tarjeta del modelo— se prometen en lugar de entregarse. La cifra de contexto lleva una nota al pie que advierte que puede cambiar durante la beta, lo cual es una cautela que ningún modelo de disponibilidad general necesita.
La consecuencia es asimétrica de una manera que importa para las adquisiciones. Un equipo que adopta Gemini 3.1 Pro Preview está aceptando el riesgo de rotación de modelos. Un equipo que adopta Beam hoy está aceptando un precio desconocido, una puntuación independiente desconocida y ninguna capacidad de ejecutar el modelo por sí mismo. Esas son categorías de riesgo distintas, y el precio es la que decide con más frecuencia.

Benchmarks, y el problema de las citas
Las tablas de lanzamiento de Reflection no incluyen Gemini 3.1 Pro Preview ni ningún modelo de Google. Su conjunto de comparación solo incluye modelos abiertos y semiabiertos: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max y DeepSeek V4.1 Flash. Así que los dos modelos nunca se han ejecutado uno contra el otro en una tabla publicada, y las cifras siguientes proceden de distintos entornos de evaluación por ambas partes.
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview registra 29,7, clasificado en el puesto 58 de 147 en su ejecución. Beam no tiene ninguna fila en el índice.
• GPQA Diamond — Gemini 3.1 Pro Preview con 94,1 según Artificial Analysis frente al 90,5 reportado por el proveedor Beam.
• SciCode — 58.7 para Gemini frente al 49.7 reportado por el proveedor Beam.
• Humanity's Last Exam — 47,0 para Gemini frente al 36,2 reportado por el proveedor de Beam, este último explícitamente sin herramientas.
• Terminal-Bench v2.1 — 73,8 para Gemini según Artificial Analysis frente al 80,1 reportado por el proveedor Beam. Esta es la fila más fuerte de Beam en el enfrentamiento, y es una victoria fácil contra un modelo que lleva en el mercado desde febrero.
• Recuperación de contexto largo — 82,0 para Gemini frente al 79,3 reportado por el proveedor de Beam en AA-LCR.
• tau-squared Bench — 95,6 para Gemini frente al 78,7 de Beam en MCP Atlas y 38,0 en tau3 banking. Evaluaciones relacionadas del uso de herramientas agénticas, no la misma, y la diferencia en el nombre importa.
Hay un problema de honestidad aparte con el lado de Gemini de esta tabla que merece su propia frase. Las puntuaciones de índices independientes para Gemini 3.1 Pro Preview se han citado en 30, 46, 47,7 y 57 en distintas fuentes, y Artificial Analysis ofrece distintas revisiones del índice en distintas páginas de modelos en el mismo momento. La cifra de 29,7 anterior es la de la página que leímos el 6 de octubre de 2026, y es la única que citaremos, pero cualquier artículo que ponga un único número de índice de Gemini junto a un competidor sin decir de qué instantánea proviene está presentando un número flotante como si fuera fijo. La misma advertencia se aplica a la inversa a Beam, donde no hay ninguna instantánea en absoluto.
Precio, y el nivel para el que nadie planea
Gemini 3.1 Pro Preview cuesta $2.00 de entrada y $12.00 de salida por millón de tokens hasta 200,000 tokens, y $4.00 y $18.00 por encima de esa cifra. Las lecturas de caché cuestan $0.20 por millón y las escrituras de caché, $0.375. El límite entre niveles es la parte que conviene planificar: el principal argumento de venta del modelo es una ventana de 1,048,576 tokens, y en cuanto una solicitud supera los 200,000 tokens, la tarifa de entrada se duplica y la de salida aumenta un 50 %. Por lo tanto, una carga de trabajo diseñada en torno a la ventana de un millón de tokens es una carga de trabajo que se cobra al segundo nivel durante la mayor parte de su tráfico, no al primero.
Beam no tiene tarifa publicada, así que no hay ningún nivel que modelar ni nada con lo que comparar. Esa ausencia no es neutral: significa que la afirmación más defendible sobre el costo de Beam es que se desconoce, y el único respaldo cuantitativo de su posicionamiento en eficiencia es el gráfico de Reflection, que estima los FLOPs generados como el doble del número de parámetros activos multiplicado por la media de tokens generados por intento en DeepSWE, HLE y Terminal-Bench 2.1 — con una nota al pie que admite que se excluyen el prefill de prompts, la atención y el overhead de servicio. En las cargas de trabajo donde importa un contexto de un millón de tokens, el prefill no es un error de redondeo, y es precisamente el término que la fórmula omite.

Uso de herramientas, búsqueda y en qué se diferencian los dos diseños
Las fortalezas anunciadas de Gemini 3.1 Pro Preview son la ingeniería de software, la fiabilidad agéntica y la eficiencia de tokens, y su superficie de herramientas publicada incluye llamadas a funciones, salidas estructuradas y fundamentación en búsqueda. Ese último punto es el que hay que tener en cuenta para cualquiera que compare pilas agénticas: la búsqueda fundamentada es una capacidad propia de Google y cambia lo que puede hacer un agente que usa herramientas sin un servicio externo de recuperación conectado.
La historia de herramientas de Beam es más interesante de lo que sugiere una línea de especificaciones y más difícil de evaluar. Reflection reporta MCP Atlas en 78,7, AutomationBench público en 37,0, tau3 banking en 38,0, BrowseComp con gestión de contexto en 77,4 y DeepSearchQA con gestión de contexto en 80,1 — y señala que durante el aprendizaje por refuerzo el modelo aprendió de forma orgánica a consultar otros modelos de lenguaje y a llamar a las API de OCR cuando se le daba acceso a la web, a pesar de que las tareas de navegación estaban ausentes de la mezcla de entrenamiento. Si esa generalización se mantiene, es una señal real sobre la transferencia agéntica. También es, en este punto, una observación de un proveedor procedente de una ejecución de entrenamiento, sin verificación independiente.
En las filas de uso de herramientas donde ambos lados tienen cifras, el panorama es mixto y no unilateral. La tabla de proveedores de Beam lo sitúa por delante de GLM 5.2 en MCP Atlas y a la par de GLM 5.2 y Kimi K3 en tau3 banking, mientras que la cifra de 95,6 de tau-squared Bench de Gemini es el número agéntico más alto que cualquiera de los dos lados ha publicado. Distintos conjuntos de pruebas, distintos harnesses y ninguna evaluación compartida —que es el problema recurrente en esta comparación.
Elegir, y cómo cubrirse
La regla de decisión que se desprende de lo anterior es lo bastante simple como para enunciarla en una línea: si alguna entrada no es texto, Beam no es una opción y la comparación termina. Si todas las entradas son texto, la cuestión pasa a ser si la afirmación de eficiencia no atribuida de Beam vale un precio desconocido y ninguna puntuación independiente, frente a un modelo que cuesta $2.00 y $12.00 con una escalera documentada y una superficie de herramientas completa.
Gemini 3.1 Pro Preview ya está en nuestro catálogo, con la tarifa de lista del proveedor tal cual, sin añadir nada, detrás de una única clave compatible con OpenAI en api.orcarouter.ai/v1 junto a más de 200 modelos — y esa misma clave da servicio a los modelos con los que Beam compite en precio, desde GLM 5.3 a 1,26 $ y 3,96 $ hasta DeepSeek V4.1 Flash a 0,15 $ y 0,60 $, consultados en directo esta mañana. Como el límite de nivel en 200.000 tokens es un problema de enrutamiento y no del modelo, el DSL de enrutamiento te permite expresarlo directamente: mantén las solicitudes cortas en el nivel barato y ancla las verdaderamente largas allí donde la ventana es la razón por la que elegiste el modelo, en una sola llamada en lugar de en el código de la aplicación.
Reflection Beam no es una de nuestras rutas, y no te remitiremos a nadie que afirme tenerla. Si los pesos de Apache 2.0 llegan este mes como se prometió, el autoalojamiento se convierte en una tercera opción para el trabajo de solo texto y la afirmación de eficiencia se vuelve comprobable en tu propio hardware.

¿Qué cambiaría la respuesta?
El argumento de Beam contra Gemini se basa en los mismos dos elementos en los que se basa toda comparación de Beam, y este enfrentamiento añade un tercero.
Un precio. Sin uno, el argumento de eficiencia no puede convertirse en una decisión presupuestaria, y el modelo compite con un diagrama en lugar de una tabla de precios.
Una puntuación independiente. Artificial Analysis dijo el 5 de octubre que Reflection le había dado acceso y que estaba evaluando Beam, describiendo los primeros indicadores como señal de que Beam será uno de los modelos abiertos más eficientes en tokens que ha visto para su nivel de inteligencia. Esa es la fuente correcta diciendo lo correcto, y sigue sin haber una fila de Beam en la tabla — las páginas del modelo devuelven 404 y la clasificación no contiene ninguna entrada de Beam a fecha de esta mañana.
Y lo que no cambia: Beam es solo texto. Ningún lanzamiento de pesos, ningún recorte de precio y ninguna puntuación de índice altera eso, lo que significa que, para toda una clase de cargas de trabajo, esta comparación nunca llegará a ser una comparación en absoluto. Si tu pipeline incluye un vídeo, la respuesta era Gemini 3.1 Pro Preview antes de que se cargara el primer benchmark.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
