
Reflection Beam vs Claude Opus 5.5: uno al que puedes llamar hoy y otro que tendrás que esperar
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Reflection Beam y Claude Opus 5.5 todavía no son realmente rivales, y la razón es administrativa más que técnica. Beam, el primer modelo de Reflection, se anunció el 5 de octubre de 2026 y es un modelo disperso de mezcla de expertos de 501 mil millones de parámetros que activa 23 mil millones de parámetros por token, pero solo se puede acceder a él mediante lista de espera, sus pesos están prometidos para finales de este mes bajo Apache 2.0, y no se ha publicado ningún precio en ningún sitio. Opus 5.5 se lanzó el 22 de septiembre de 2026 como el modelo insignia de Anthropic: una ventana de 1 millón de tokens, entrada de texto, imagen y archivos, y un precio de lista de 4,00 $ por millón de tokens de entrada y 20,00 $ por millón de salida. Así que la versión honesta de esta comparación es que uno de estos modelos se puede poner en producción esta misma tarde con un coste conocido, y el otro no, y todo lo demás aquí es una proyección sobre lo que ocurrirá cuando lleguen los pesos.
La respuesta corta
Si la pregunta es en qué modelo construir esta semana, es Opus 5.5 sin apenas debate: está disponible de forma general, tiene puntuación independiente, es multimodal, tiene precio y se sirve a través de una API que puedes llamar en cinco minutos. El caso de Beam no se basa en superar a Opus 5.5 — nada en el propio material de Reflection afirma que lo haga. Se basa en una propuesta mucho más limitada: que, para una puntuación de razonamiento dada, Beam consume aproximadamente una cuarta parte del cómputo de inferencia. Si eso se sostiene cuando alguien ajeno a Reflection lo mida, Beam se vuelve interesante para trabajos de gran volumen donde la respuesta tiene que ser buena, pero no la mejor. Si no es así, Beam es un modelo abierto de gama media con lista de espera.
Lo que sigue separa las partes de este enfrentamiento que hoy son hechos de las partes que son apuestas.
Qué es cada modelo, con precisión
Opus 5.5 es el sucesor cerrado y alojado de Claude Opus 5, posicionado por Anthropic para cambios de varios pasos en grandes bases de código, revisión de código y sesiones autónomas prolongadas. Acepta texto, imágenes y archivos, devuelve texto, ofrece una ventana de contexto de 1.000.000 de tokens con hasta 128.000 tokens de salida, y expone pensamiento extendido con un esfuerzo de razonamiento configurable. No tiene pesos abiertos, y su conocimiento está limitado por la fecha de corte de entrenamiento de Anthropic, no por algo que tú controles.
Reflection Beam es la construcción opuesta. Tiene 501 mil millones de parámetros totales con 23 mil millones activos —alrededor del 4,6 % del modelo activo por token, una proporción agresiva incluso frente al aproximadamente 5,4 % de GLM 5.2—, diseñado para ser barato de servir en lugar de barato de entrenar. Es solo texto. Su contexto de API es de 256.000 tokens, con una nota al pie que advierte que la cifra podría cambiar durante la beta, y su salida máxima es de 128.000 tokens. El endpoint es compatible con OpenAI en api.reflection.ai/openai/v1 y expone Chat Completions, además de una lista de Models, y nada más. Su parámetro reasoning_effort acepta cinco valores, su valor predeterminado es medium y no se puede desactivar.
• Precio — Claude Opus 5.5: $4.00 de entrada y $20.00 de salida por millón de tokens, con lecturas de caché a $0.20 y escrituras de caché a $5.00, frente a Reflection Beam: no publicado en la entrada del blog, la documentación ni el listado del modelo.
• Disponibilidad — Opus 5.5 está disponible de forma general hoy; Beam es una lista de espera para una beta, con los pesos, el informe técnico y la tarjeta de modelo prometidos para más adelante este mes.
• Modalidad — Opus 5.5 acepta texto, imágenes y archivos; Beam solo acepta texto.
• Contexto — 1.000.000 de tokens frente a 256.000, con la cifra de Beam con la salvedad de que es beta.
• Pesos abiertos: no para Opus 5.5, prometidos bajo Apache 2.0 para Beam, aún no entregados.
• Puntuación independiente — Opus 5.5 la tiene; Beam no.

El precio es la parte que no se compara
Los $4.00 y $20.00 de Opus 5.5 son la tarifa de lista del proveedor, y en nuestro catálogo se trasladan sin cambios, sin añadir nada. Las lecturas de caché a $0.20 y las escrituras de caché a $5.00 importan enormemente para la carga de trabajo para la que se comercializa Opus 5.5: una sesión agéntica larga que vuelve a leer el mismo código base de 200,000 tokens turno tras turno paga la tarifa de caché sobre casi todo él, no la tarifa de entrada. Esa es una palanca real y a menudo subestimada, y vale la pena modelarla antes de concluir que un modelo de frontera está fuera de presupuesto.
Beam no tiene un número comparable. No hay precio de lista con el que compararlo, ni un nivel de caché que modelar, y no hay tarifa publicada para la beta. Reflection no ha dicho si Beam se venderá por token, se cobrará por asiento o se regalará junto con los pesos. Cualquiera que hoy cite un costo por millón para Beam se lo está inventando.
La consecuencia práctica: la comparación de precios no es «Opus 5.5 es caro y Beam es más barato». Es «uno de estos tiene un precio y el otro tiene una fecha». Para un equipo que decide hoy, esa asimetría decide más que los benchmarks.
Puntos de referencia: los dos números que se superponen, y por qué todavía no son comparables
Las tablas de lanzamiento de Reflection no incluyen Opus 5.5, ni ningún modelo cerrado de frontera. Su conjunto de comparación es totalmente abierto o semiabierto: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max y DeepSeek V4.1 Flash. Así que cualquier tabla de Beam frente a Opus tiene que ensamblarse a mano, y ensamblarla con honestidad implica nombrar las diferencias del arnés en lugar de suavizarlas.
Existen exactamente dos benchmarks en los que ambos modelos cuentan con una cifra publicada, y ninguna de las dos comparaciones está controlada.
• Humanity's Last Exam: Reflection reporta Beam en 36.2 sin herramientas; Artificial Analysis registra Opus 5.5 en 61.4. Dos harnesses distintos, dos configuraciones distintas —la cifra de Opus 5.5 no está etiquetada como sin herramientas— y una brecha de veinticinco puntos que dice menos sobre los modelos que sobre la configuración.
• SciCode — Reflection reporta Beam con 49,7; Artificial Analysis registra 66,9 para Opus 5.5. Mismo benchmark, mismo problema: una cifra es la ejecución propia del proveedor y la otra es un arnés de terceros.
Todo lo demás no se solapa en absoluto. La tabla de Beam se basa en Terminal-Bench v2.1, mientras que el índice actual de Artificial Analysis usa Terminal-Bench 4.0, una versión diferente de la misma suite, por lo que el 80.1 de Beam y el 59.6 de Opus 5.5 en ese tablero no son una comparación y nunca deberían imprimirse juntos. En el propio índice, Artificial Analysis sitúa a Opus 5.5 en 57.6 en la configuración Max / Default Fallback, en cuarto lugar de los 147 modelos de esa ejecución. Beam no tiene fila en el índice: las páginas del modelo devuelven 404 y la clasificación no incluye ninguna entrada de Beam a fecha de esta mañana.
La única declaración verdaderamente independiente sobre Beam que consta es la de Artificial Analysis, que el 5 de octubre dijo que Reflection le había dado acceso y que estaba evaluando el modelo de forma independiente, y que los primeros indicadores sugieren que Beam será uno de los modelos abiertos más eficientes en tokens que ha visto para su nivel de inteligencia. Es una frase contundente de la fuente adecuada y sigue siendo una frase sin una cifra. Es la cifra la que decidirá este enfrentamiento.

Donde la afirmación sobre la eficiencia realmente hace mella
El argumento de Reflection no es que Beam sea más inteligente que un modelo de frontera. Es que Beam obtiene una puntuación comparable a la de GLM 5.2 mientras usa entre 3 y 4 veces menos cómputo de inferencia, y que la brecha se amplía frente a modelos de la familia de 2 billones de parámetros donde se sitúa Qwen 3.8-Max. El gráfico que lo respalda estima los FLOPs generados como el doble del número de parámetros activos multiplicado por la media de tokens generados por intento, y su propio pie de figura admite que esto excluye el prefill del prompt, la atención y la sobrecarga de servicio.
Tómese esto al pie de la letra y el objetivo interesante no es Opus 5.5 en absoluto — es la parte media del mercado. Opus 5.5 compite por capacidad por tarea y gana en las tareas que requieren criterio: refactorizaciones de varios pasos, revisión de código, trabajo donde una respuesta incorrecta cuesta más que los tokens. Un modelo que está despierto un 4,6 por ciento por token compite por coste por tarea y gana donde domina el volumen y el listón de calidad es «suficientemente bueno y verificado en fases posteriores». Son productos diferentes, y una comparación que enfrenta a Beam con Opus 5.5 en una sola tabla de puntuaciones está midiendo lo que no debe.
Hay un efecto de segundo orden que vale la pena nombrar. Si se sostiene la afirmación de eficiencia de Beam, su ámbito natural es el tipo de carga de trabajo en la que, de otro modo, gastarías los tokens de un modelo de frontera en una tarea para la que está sobradamente cualificado. Eso es una decisión de enrutamiento, no una elección de modelo, y es la razón por la que aquí la cuestión del precio importa más que la cuestión del benchmark: no puedes enrutar por coste hacia un modelo que no tiene coste.
Ejecutándolos en paralelo, cuando Beam es invocable
Opus 5.5 ya está en nuestro catálogo hoy a $4.00 y $20.00 por millón de tokens, precio de lista repercutido sin añadir nada, y se sitúa junto a más de 200 modelos más detrás de una única clave compatible con OpenAI en api.orcarouter.ai/v1. Si quisieras hacer un A/B de una carga de trabajo entre un modelo de frontera y uno abierto y barato, esa es la forma de la configuración: dos IDs de modelo, una clave, sin un segundo contrato y sin cambios en el código, y la conmutación por error automática en el enrutamiento hace que un proveedor que tenga una mala tarde no se lleve tu pipeline por delante.
Beam aún no puede formar parte de eso, y no vamos a fingir lo contrario. Reflection Beam no es una de nuestras rutas, y no te dirigiremos a quien sea que pueda revenderlo. Cuando los pesos se publiquen bajo Apache 2.0, podrás alojarlo tú mismo y enrutar a tu propio endpoint; hasta entonces, el único camino es la lista de espera de Reflection.
Para una carga de trabajo en la que de verdad se necesita un modelo de frontera, la comparación que hay que hacer no es con Beam. Es con todo lo demás del catálogo: GLM 5.3 a $1.26 y $3.96, Qwen 3.8-Max a $2.00 y $6.00, y DeepSeek V4.1 Flash a $0.15 y $0.60, todos consultados en vivo esta mañana. Ese es el segmento en el que quedará Beam si fija precios competitivos, y es un entorno mucho más difícil de lo que sugiere el gráfico de lanzamiento.

¿Qué cambiaría este veredicto?
Tres cosas, en orden de cuánto importarían.
Una fila de Artificial Analysis para Beam. No el anuncio de que una va a llegar — la fila. Si el índice queda cerca del 57,6 de Opus 5.5 mientras la afirmación de eficiencia de tokens sobrevive al contacto con un banco de pruebas de terceros, la franja media del mercado se vuelve realmente incómoda y Beam se convierte en la opción predeterminada para mucho trabajo de gran volumen. Si queda más cerca del grupo de pesos abiertos, en la parte baja de los cuarenta, Beam es un modelo barato y sólido, y nada más.
Un precio. Un modelo sin tarifa de lista no puede ganar un argumento de costos, porque no hay nada con qué comparar. Si Beam queda por debajo del nivel de GLM 5.3, la historia de eficiencia se convierte en una historia de presupuesto muy rápidamente. Si queda por encima de los $0.15 y $0.60 de DeepSeek V4.1 Flash sin una ventaja de capacidades, tendrá dificultades para el trabajo de volumen para el que fue creado.
Los pesos. Hasta que existan, «open-weight» es una afirmación sobre una licencia que no se ha concedido, y nadie puede verificar la aritmética de FLOPs por puntuación contra un modelo que realmente pueda ejecutar. Esa es la comprobación que Reflection ha invitado a hacer y que todavía no ha habilitado.
Hasta que al menos uno de esos llegue, la elección práctica no está reñida. Opus 5.5 es el modelo sobre el que puedes razonar, calcular costes y lanzar a producción. Beam es el modelo que observas.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
