Una tarjeta principal generada titulada 'Reflection Beam: 501B parámetros, 23B activos', con la línea secundaria 'MoE disperso / 23.8T tokens de preentrenamiento / contexto de API de 256K tokens / pesos prometidos este mes / cada cifra reportada por el proveedor'. Tres iconos planos de línea se encuentran debajo del texto: un diagrama de capas apiladas con la mayoría de las capas atenuadas y una resaltada, un rack de nueve módulos de servidor y un esquema de documento con un pequeño candado. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Reflection Beam, explicado: 501B parámetros, 23B activos y pesos que aún no se han publicado

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 5 de octubre de 2026, Reflection anunció Reflection Beam, un modelo de lenguaje de mezcla de expertos dispersa con 501 mil millones de parámetros totales que activa 23 mil millones de ellos por token, y puso delante de él un endpoint beta compatible con OpenAI ese mismo día. Eso es el 4,6 por ciento del modelo despierto en cualquier momento —una proporción agresiva incluso según los estándares del campo actual de pesos abiertos— y es el número del que depende todo el lanzamiento. Reflection dice que los pesos completos, un informe técnico y una tarjeta de modelo llegarán más adelante este mes bajo Apache 2.0. A día de hoy no están aquí, no se ha publicado ningún precio en ninguna de las propiedades de Reflection, y Artificial Analysis no tiene ninguna fila para el modelo. Así que el resumen honesto del lanzamiento es este: una afirmación muy específica sobre la eficiencia, hecha por el laboratorio que entrenó el modelo, con cada cifra de apoyo proporcionada por ese laboratorio.

Las propias tablas comparativas de Reflection sitúan a Reflection Beam frente a Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max y DeepSeek V4.1 Flash, lo cual ofrece una imagen justa del nivel al que apunta: modelos abiertos y semiabiertos, fuertes pero no de frontera, varios de ellos una fracción del tamaño de Beam. Beam no supera a ese grupo en capacidad bruta, y te mostraremos exactamente dónde pierde. Lo que afirma hacer es situarse cerca de la cima de ese grupo gastando aproximadamente tres o cuatro veces menos cómputo de inferencia que GLM 5.2 con puntuaciones de razonamiento comparables. Esa afirmación es el artículo.

Lo que realmente existe hoy

Todo en esta sección proviene de la propia documentación de Reflection, leída el 6 de octubre de 2026. La API está disponible en beta con acceso mediante lista de espera; los pesos aún no se han publicado.

• ID del modelo — Beam-501B-A23B, creado el 5 de octubre de 2026.

Interfaz — una superficie de API en api.ref.org/open/v1, que expone Completions y la lista de Models. Sin Completions, sin lotes.

• Contexto — 256.000 tokens, con una nota al pie adjunta a la propia cifra: «La ventana de contexto puede cambiar durante la beta». La salida máxima es de 128.000 tokens.

• Razonamiento — un parámetro reasoning_effort con cinco valores: low, medium, high, xhigh y max. El valor predeterminado es medium, y el modelo siempre razona independientemente de la configuración: no existe una opción para desactivarlo.

• Modalidad — texto de entrada, texto de salida. Sin entrada de imagen o audio en el lanzamiento, lo que supone una diferencia real con respecto a Inkling, el modelo centrado en la multimodalidad que Thinking Machines, la empresa de Mira Murati, lanzó en julio.

• Corte de conocimiento — 30 de junio de 2026.

• Precio — no publicado. La entrada del blog de Reflection, su documentación y su listado de modelos lo omiten, y la consola de la plataforma queda detrás de un muro de registro.

Esa última línea importa más de lo que parece. Todos los demás modelos del conjunto de comparación de Beam tienen un precio de lista público que puedes introducir hoy mismo en una hoja de cálculo. Beam no, lo que significa que cualquier argumento sobre su coste ahora mismo es un argumento sobre cómputo, no sobre dólares.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

La proporción de 501 a 23 es el argumento

La esparsidad no es nueva; la cuestión es hasta dónde está dispuesto un laboratorio a llevarla. GLM 5.2 funciona con aproximadamente 40.000 millones de parámetros activos de un total que se reporta en torno a los 744.000 millones —alrededor del 5,4 %—. Reflection Beam se sitúa en el 4,6 % de 501.000 millones. Sobre el papel, eso es un modesto paso más, y Reflection se muestra cautelosa respecto a lo que afirma sobre ella.

La cifra de eficiencia de la publicación de lanzamiento proviene de un gráfico construido con datos de Artificial Analysis y DataCurve, que representa la puntuación de razonamiento frente a los FLOPs de inferencia estimados, donde los FLOPs se aproximan como el doble del número de parámetros activos multiplicado por el número medio de tokens generados. Esa fórmula excluye deliberadamente el prefill del prompt, el coste de atención y la sobrecarga de servicio. Es un modelo de servilleta, no una medición, y Reflection no lo presenta como tal, pero también es el único respaldo cuantitativo de la afirmación de que es "de 3 a 4 veces más barato con la misma puntuación", y fue redactado por el proveedor. Trátala como una hipótesis que los pesos, cuando lleguen, permitirán que alguien más ponga a prueba.

Lo que la arquitectura aporta en la práctica es un perfil de servicio. Veintitrés mil millones de parámetros activos es un modelo que se puede ejecutar en un número relativamente pequeño de GPU con latencia interactiva, y eso es un producto distinto de un modelo denso de 501 mil millones de parámetros, aunque el recuento de parámetros en la ficha sea el mismo. Es la razón por la que Reflection puede hablar de razonamiento cercano a la frontera sin hablar de un despliegue a escala de centro de datos.

Menos de cuatro semanas para preentrenar, y la divulgación es inusualmente específica

El relato sobre el entrenamiento es la parte de la publicación que resulta genuinamente informativa, porque Reflection publicó cifras que la mayoría de los laboratorios mantiene internas.

Preentrenamiento — 23,8 billones de tokens en 6.144 chips GB300 en racks NVL72, finalizado en menos de cuatro semanas con un rendimiento útil reportado del 92,3 por ciento, con nueve retrocesos a puntos de control durante el proceso.

• Aprendizaje por refuerzo — 10.500 chips GB300 durante cuatro semanas, más de 100 millones de rollouts, contexto máximo de rollout de 256.000 tokens, aproximadamente 1.300 millones de sandboxes y alrededor de un millón de entornos distintos, con un promedio de 110.000 rollouts ejecutándose de forma concurrente.

• Entrenamiento intermedio: amplía el contexto efectivo del modelo hasta 1 millón de tokens.

• Estabilidad: gradientes de política asíncronos que se mantienen estables con un desfase de escala diaria, además de una penalización de longitud controlable que permite ajustar la longitud del razonamiento sin reentrenar.

Al leer juntas las líneas de preentrenamiento y RL, aparece la forma de la afirmación. El relato de eficiencia no solo tiene que ver con los parámetros activos en inferencia; también tiene que ver con la rapidez con la que se entrenó el modelo y con cuánto del cómputo se destinó a RL ligado al entorno en lugar de a más tokens. Un millón de entornos y 1.300 millones de sandboxes son una declaración sobre la infraestructura de entrenamiento agéntico y de uso de herramientas, y concuerda con los benchmarks con los que Reflection eligió liderar.

Un número merece que se le preste atención. El blog dice que el midtraining extiende el contexto efectivo a 1 millón de tokens; la documentación de la API indica un límite de servicio de 256.000 tokens con una nota al pie sobre la beta. Se trata de una capacidad del lado del entrenamiento y de un límite del lado del servicio, no de una contradicción, pero esa diferencia es exactamente el tipo de cosa que se convierte en un titular de "contexto de 1M" si nadie lee el segundo documento, y quien escriba sobre Beam la próxima semana debería leer el segundo documento.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Puntos de referencia: dónde gana Reflection Beam y dónde no

Todas las cifras que aparecen a continuación son reportadas por el proveedor, provienen de las tablas de la publicación de lanzamiento de Reflection, y ninguna ha sido reproducida de forma independiente. Las columnas de comparación son los mismos números que Reflection publicó para los otros modelos; cuando una celda muestra "NR" en el original, el modelo no se ejecutó. No hay ninguna fila de Artificial Analysis para Beam, así que nada de esto ha pasado por un banco de pruebas de terceros.

Programación agéntica

• Terminal-Bench v2.1 — Beam 80,1 frente a GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.

• SWE-Bench Pro v1 — Beam 65.5 vs Qwen3.8 Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Beam 77,2 vs Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.

• SWE-Bench — Beam 80,9 vs Inkling 77,6, Nemotron 3 Ultra 70,7.

• SWE-Bench Multilingual — Beam 78,0 vs Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44,4 frente a DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.

• SWE Atlas Codebase QnA — Beam 34,6 vs Kimi K3 68,0, GLM 5,3 61,0.

Esa última fila es la que hay que asimilar con calma. La respuesta a preguntas sobre repositorios de horizonte largo es donde un modelo tiene que mantener una base de código en la cabeza a lo largo de una interacción extensa, y un 34,6 frente a un 68,0 no es una diferencia de redondeo. DeepSWE cuenta una historia similar: 44,4 sitúa a Beam al nivel de GLM 5.2 y muy por detrás de DeepSeek V4.1 Flash.

Razonamiento

• AIME 2026 — Beam 97.8 frente a GLM 5.2 99.2, Inkling 97.1.

• HLE, sin herramientas — Beam 36.2 vs Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.

• GPQA Diamond — Beam 90.5 frente a Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.

• SciCode — Beam 49,7 frente a GLM 5.3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.

• CriPT AA — Beam 16.3 vs Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

El perfil de razonamiento de Beam está en la media, y el patrón es consistente: cómodamente por delante de los dos modelos de la generación anterior en la lista de Reflection, y por detrás del actual. GPQA Diamond con 90.5 es una puntuación sólida que otros cuatro modelos superan.

• MCP Atlas — Beam 78.7 frente a Qwen3.8 Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8, Inkling 76.0, Nemotron 3 Ultra 63.1.

• AutomationBench, split público — Beam 37.0 frente a DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.

• tau3 banking — Beam 38.0 vs. Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.

• BrowseComp con gestión de contexto — Beam 77.4 vs Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.

• DeepSearchQA con gestión de contexto — Beam 80.1 vs Kimi K3 95.0.

Reflection también mostró dos demostraciones de capacidades en la publicación: una tasa de resolución del 95,5 % en el rompecabezas "Land or Water", una cuadrícula de 180 por 90 con 16.200 puntos que requiere mantener un gran estado de tablero —una cifra que se sitúa entre el 92,5 % y el 97,8 % que Reflection atribuye a Opus 5 y Fable 5 en la misma tarea— y un ajuste fino de Text2SQL del Gemma-4 más pequeño que elevó la exactitud en el conjunto reservado al 66,5 %. Las demostraciones están seleccionadas; muestran que el modelo puede hacer algo, no con qué frecuencia.

Lo que puedes hacer con ello hoy y aquello con lo que no deberías contar

Hoy, en general, solo es posible una cosa: solicitar acceso beta y llamar a Beam-501B-A23B a través del propio endpoint de Reflection con un cliente con forma de OpenAI. No hay un precio publicado, así que no hay forma de modelar el coste de una carga de trabajo en él. No hay pesos, así que no hay autoalojamiento, ni cuantización, ni ajuste fino y ni reproducibilidad por terceros. No hay una fila de benchmark independiente, así que todo el panorama de rendimiento anterior se basa en las tablas de un solo laboratorio.

Reflection Beam no es una de nuestras rutas. No vamos a insinuar lo contrario, ni vamos a remitirte a un revendedor que quizá lo tenga. Lo que sí podemos decirte es cuánto cuesta el conjunto de comparación, porque enrutamos cuatro de esos modelos y las cifras de abajo se leen en vivo de nuestro propio catálogo esta mañana: GLM 5.2 a $1,40 de entrada y $4,40 de salida por millón de tokens, GLM 5.3 a $1,26 y $3,96, Qwen3.8 Max a $2,00 y $6,00, y DeepSeek V4.1 Flash a $0,15 y $0,60. Es una diferencia real —DeepSeek V4.1 Flash es casi diez veces más barato en entrada que GLM 5.2— y es la razón por la que un modelo beta sin precio es difícil de encajar en una decisión. OrcaRouter funciona con una sola clave compatible con OpenAI para esos y más de 200 modelos adicionales, con el precio de lista del proveedor traspasado tal cual y sin añadir nada, lo que significa que un cambio de precio del proveedor está activo en nuestro lado el mismo día, en lugar de cuando lo actualice un revendedor. Y como la conmutación automática por fallo forma parte del enrutamiento en vez de ser algo que tú tienes que construir, un modelo nuevo y no probado es justo el tipo de cosa que puedes destinar a una parte del tráfico en lugar de a tu ruta crítica, que es la única forma responsable de usar algo cuyos benchmarks nadie ha reproducido todavía.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

Qué tener en cuenta antes de tomar en serio la afirmación de eficiencia

Tres cosas resolverán la cuestión, y dos de ellas están prometidas para este mes.

Lo primero son los pesos. Apache 2.0 y un informe técnico permitirían que cualquiera con un par de nodos mida lo que de verdad importa —tokens por segundo por GPU con un umbral de calidad fijo, y si 23 mil millones de parámetros activos realmente entregan la puntuación por FLOP que sugiere el gráfico—. Hasta entonces, el argumento de la eficiencia es aritmética de servilleta.

Lo segundo es el precio. Un modelo sin precio de tarifa no tiene cabida en una comparación de costos, y si Beam se sitúa por encima del nivel de GLM y DeepSeek, la cuestión del cómputo deja de importar para cualquiera que tenga un presupuesto. Si se sitúa por debajo, el panorama cambia rápidamente.

El tercero es un tercero que ejecuta la suite. Todos los números anteriores proceden del mismo documento, y una tabla reportada por el propio fabricante que sitúa su propio modelo por detrás en siete de dieciséis filas es una buena señal sobre la honestidad del laboratorio, pero sigue siendo un solo laboratorio, un solo arnés de pruebas, un solo conjunto de prompts.

Si hoy necesitas un programador agéntico capaz y necesitas saber cuánto cuesta, la respuesta aún no es Reflection Beam. Podría serlo en tres semanas. El modelo por el que vale la pena apostar ante una afirmación de eficiencia es aquel cuyos pesos puedes descargar y cuyos FLOPs puedes contar tú mismo — y en esa prueba, Reflection nos ha dado una fecha y no un modelo.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario