Una tarjeta principal generada para el artículo 'Reflection Beam lanza una API en beta, y los pesos aún tardarán dos semanas', titulada 'Reflection Beam' con el subtítulo 'Una API en beta, y pesos que aún no están disponibles', y tres chips que dicen '501B en total / 23B activos', '256K de contexto beta' y 'Sin precio publicado'.
Guides & Insights

Reflection Beam lanza una API en beta, y los pesos aún tardarán dos semanas

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El primer modelo de Reflection se llama Reflection Beam, y lo interesante de él esta mañana no es que exista, sino que solo existe la mitad. La empresa anunció Beam el 5 de octubre de 2026 como un modelo disperso de mezcla de expertos con 501 mil millones de parámetros totales y 23 mil millones activos por token, y ese mismo día puso delante de él un endpoint beta compatible con OpenAI. Los pesos están prometidos para finales de este mes bajo Apache 2.0, junto con un informe técnico, una ficha del modelo y la pila de servicio. Hasta que lleguen, las únicas personas que pueden ejecutar Beam-501B-A23B son aquellas a las que Reflection entrega una clave de lista de espera, y cada cifra de rendimiento que circula procede de las propias tablas de un único laboratorio.

Ese es un lugar extraño para que se detenga un lanzamiento, y vale la pena ser precisos sobre qué mitad tenemos. Reflection ha lanzado una vista previa a la que puedes registrarte y un conjunto de tablas de benchmarks que nadie ha reproducido. No ha lanzado aquello a lo que se refiere "open-weight" en el titular.

¿Qué está realmente en vivo esta mañana?

Todo en esta sección proviene de la propia publicación de blog y la documentación de Reflection, consultadas el 6 de octubre de 2026.

• ID del modelo — Beam-501B-A23B, creado el 5 de octubre de 2026, servido en api.reflection.ai/openai/v1 con Chat Completions y una lista de modelos, y nada más.

• Forma — 501 mil millones de parámetros totales, 23 mil millones activos por token, lo que da una ratio de activación de aproximadamente el 4,6 por ciento. A modo de escala, GLM 5.2 se sitúa cerca del 5,4 por ciento.

• Contexto — 256.000 tokens en la API, con una nota al pie adjunta a la propia cifra que advierte que la ventana puede cambiar durante la beta. La salida máxima es de 128.000 tokens.

• Razonamiento — un parámetro reasoning_effort con cinco ajustes: low, medium, high, xhigh y max. Medium es el predeterminado, y el modelo siempre razona. No hay interruptor para desactivarlo ni modo sin razonamiento.

• Modalidad — texto de entrada, texto de salida. Sin entrada de imagen, audio o video en el lanzamiento.

• Precio — no publicado. La entrada del blog no lo incluye, la documentación no lo incluye, y la consola de la plataforma está detrás de un muro de registro.

• Acceso — una lista de espera. No hay una vía de autoservicio y no hay pesos, así que no hay descarga, ni cuantización, ni ajuste fino.

La línea de precio es la que cambia cómo interpretas todo lo demás. Cuatro de los siete modelos con los que se compara a Beam en las propias tablas de Reflection tienen precios de lista públicos que puedes poner en una hoja de cálculo hoy. Beam no, así que cualquier afirmación sobre su costo en este momento es una afirmación sobre cómputo, no sobre dólares.

A screenshot of the coding and agentic table in Reflection's Beam launch post, captured 6 October 2026, showing the header 'The below figure shows Beam's performance across a range of coding, agentic, reasoning, and STEM benchmarks. NR denotes scores that have not been reported.' and Beam's own column of rows — DeepSWE v1.1 44.4, SWE-Bench Pro v2-Hard 77.2, SWE-Bench Pro v1 65.5, Terminal-Bench v2.1 80.1, SWE Atlas Codebase QnA 34.6, SWE-Bench Multilingual 78.0 and SWE-Bench Verified 80.9 — beside the comparison columns for Inkling and Nemotron 3 Ultra.

El número del que depende el lanzamiento

La propuesta de Reflection es la eficiencia de inferencia, y es inusualmente específica al respecto: en benchmarks de razonamiento avanzado, Beam obtiene puntuaciones comparables a las de GLM 5.2 usando entre 3 y 4 veces menos cómputo de inferencia. Se describe que las ganancias son aún mayores frente a modelos de la familia de 2 billones de parámetros, donde se ubica Qwen 3.8-Max.

El gráfico que está detrás de esa afirmación merece una lectura atenta, porque es la evidencia que sostiene todo el artículo. Representa la puntuación de razonamiento frente a los FLOPs de inferencia estimados en DeepSWE, Humanity's Last Exam y Terminal-Bench 2.1, y estima los FLOPs como aproximadamente el doble del número de parámetros activos multiplicado por el número medio de tokens generados por intento. Esa fórmula excluye deliberadamente el prefill del prompt, las operaciones de atención dependientes del contexto y la sobrecarga de servicio; Reflection lo dice así en el pie de figura. Es una comparación consistente entre modelos, no una medición de la factura de nadie, y además es el único respaldo cuantitativo de la afirmación de eficiencia, escrito por el laboratorio que construyó el modelo. Trátalo como una hipótesis que los pesos permitirán que alguien más ponga a prueba.

Lo que la arquitectura sí aporta en la práctica es un perfil de servicio. Veintitrés mil millones de parámetros activos es un modelo que se puede ejecutar de manera plausible en un número comparativamente pequeño de GPUs con latencia interactiva, lo cual es un producto distinto de un modelo denso de 501 mil millones de parámetros, aunque el número en la ficha sea el mismo. Por eso Reflection puede hablar de razonamiento cercano a la frontera sin hablar de un despliegue a escala de centro de datos, y por eso la futura publicación de los pesos es el acontecimiento que importa más que la clave beta.

Dónde aterriza Beam en las propias tablas de Reflection

Todas las cifras a continuación son reportadas por el proveedor, provienen de las tablas de la publicación de lanzamiento de Reflection y ninguna de ellas ha sido reproducida de forma independiente. Cuando Reflection no publicó ninguna cifra para un modelo, la celda dice NR en el original. Las columnas de comparación son de Reflection, no nuestras ni de un tercero.

Programación y trabajo en terminal

• Terminal-Bench v2.1 — Reflection Beam 80.1 frente a GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6 y DeepSeek V4.1 Flash 90.6. Beam queda por debajo de todos y cada uno de ellos.

• SWE-Bench Verified — Reflection Beam 80.9 frente a Inkling 77.6 y Nemotron 3 Ultra 70.7. Aquí es donde Beam parece más fuerte, pero ten en cuenta que solo los dos modelos más débiles de la lista se ejecutaron en él.

• SWE-Bench Pro v1 — Reflection Beam 65.5 frente a Qwen 3.8-Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Reflection Beam 77,2 frente a Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9. Una diferencia de diez puntos con el primer puesto de la tabla.

• DeepSWE v1.1 — Reflection Beam 44,4 frente a DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam se sitúa a la par de la generación anterior y a treinta puntos por detrás del líder.

• SWE Atlas Codebase QnA — Reflection Beam 34.6 frente a Kimi K3 68.0 y GLM 5.3 61.0. Mantener un repositorio grande en mente a lo largo de una interacción prolongada es lo más difícil de esta lista, y el 34.6 de Beam no es una diferencia de redondeo.

Razonamiento y ciencia

• AIME 2026 — Reflection Beam 97,8 frente a GLM 5.2 99,2 e Inkling 97,1.

• HLE sin herramientas — Reflection Beam 36,2 frente a Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. En la mitad de la tabla, y por delante solo de los dos modelos de la generación anterior.

• GPQA Diamond — Reflection Beam 90.5 frente a Kimi K3 93.5, Qwen 3.8-Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9.

• SciCode — Reflection Beam 49.7 frente a GLM 5.3 59.0, Kimi K3 58.7, Qwen 3.8-Max 52.1, DeepSeek V4.1 Flash 52.0.

• CriPT AA — Reflection Beam 16.3 contra Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Herramientas, búsqueda y contexto largo

• MCP Atlas — Reflection Beam 78,7 frente a Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.

• AutomationBench, split público — Reflection Beam 37.0 frente a DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen 3.8-Max 39.8, GLM 5.2 26.2.

• tau3 banking — Reflection Beam 38.0 frente a Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.

• BrowseComp con gestión de contexto — Reflection Beam 77,4 frente a Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA con gestión de contexto — Reflection Beam 80.1 frente a Kimi K3 95.0.

• AA-LCR — Reflection Beam 79.3 frente a Kimi K3 88.7, DeepSeek V4.1 Flash 84.0, Qwen 3.8-Max 80.3, GLM 5.3 79.7, Nemotron 3 Ultra 79.3, GLM 5.2 78.3, Inkling 77.3. La recuperación de contexto largo es la única fila de capacidad general en la que Beam es verdaderamente competitivo en lugar de estar en la media.

Si se leen las cuatro tablas en conjunto, aparece una forma consistente: Beam supera a los dos modelos de la generación anterior en la lista de Reflection y pierde frente al actual, en casi todas las filas, por márgenes que van de pequeños a descalificadores. Que un proveedor publique tablas que dejen a su propio modelo por detrás en tantas filas es una buena señal sobre la honestidad del laboratorio. No es una señal de que el modelo esté en la frontera.

A screenshot of the efficiency section of Reflection's Beam launch post, captured 6 October 2026, showing the sentence 'On advanced reasoning benchmarks, it achieves scores comparable to GLM-5.2 while using 3-4x less inference compute.', the note that gains are more pronounced against 2T+ parameter models like Qwen 3.8-Max, the claim that the results mean 'more intelligence per token', and a score-versus-estimated-FLOPs chart plotting DeepSWE, HLE (text only) and Terminal-Bench 2.1 across reasoning-effort settings.

La única voz independiente hasta ahora, y no dice

La única evaluación de terceros de la que se tiene constancia es la de Artificial Analysis, que el 5 de octubre dijo que Reflection le había dado acceso y que estaba evaluando Beam de forma independiente, y añadió que los primeros indicadores sugieren que Beam será uno de los modelos abiertos más eficientes en tokens que ha visto para su nivel de inteligencia.

Esa es una declaración significativa de la organización cuyo índice es el que la mayoría de los compradores realmente lee, y también es una declaración sin ningún número. A partir de esta mañana no hay ninguna fila de Beam en la tabla de clasificación de Artificial Analysis —las páginas de los modelos devuelven 404 y la carga útil de la tabla de clasificación no incluye ninguna entrada de Beam—, así que la afirmación sobre la eficiencia de tokens es, por ahora, una promesa de un tercero de que publicará algo. Todavía no se ha recalculado nada del índice con Beam.

La divulgación sobre el entrenamiento, que es la parte más sólida del lanzamiento

La sección de ingeniería del artículo de Reflection contiene cifras que la mayoría de los laboratorios mantiene internas, y vale la pena registrarlas porque son la parte del lanzamiento que seguirá siendo interesante dentro de un mes.

• Preentrenamiento — 23,8 billones de tokens curados en 6.144 chips NVIDIA GB300 en racks NVL72, finalizado de extremo a extremo en menos de cuatro semanas, con un goodput reportado del 92,3 %, con nueve rebobinados semiautomáticos a lo largo del proceso atribuidos a picos en la norma del gradiente o a sospechas de corrupción silenciosa de datos.

• Aprendizaje por refuerzo: 10.500 chips GB300 durante cuatro semanas, más de 100 millones de rollouts, un contexto máximo de rollout de 256.000 tokens, aproximadamente 1.300 millones de sandboxes y alrededor de un millón de entornos distintos obtenidos para tareas de programación, agénticas y STEM.

• Servicio — los nuevos pesos llegaron a la flota de inferencia en una mediana de unos 12 segundos, con una distribución jerárquica que redujo el tráfico entre corpus en un 75 por ciento y que hizo que la adopción en toda la flota fuera 2,2× más rápida que si cada réplica descargara los pesos por sí misma.

• Estabilidad — gradientes de política totalmente asíncronos que se mantienen numéricamente estables al aprender de interacciones con un día de antigüedad, además de una penalización de longitud controlable para intercambiar longitud de razonamiento por puntuación sin reentrenamiento.

• Datos — alrededor del 95 % de los tokens brutos de internet eliminados mediante análisis sintáctico, deduplicación y curación, con la afirmación de que los filtros convencionales habrían pasado por alto aproximadamente 1,8 billones de los tokens que Reflection retuvo, incluyendo el 87 % de sus tokens de código web curados.

Dos líneas merecen una señal de alerta. La publicación afirma que el midtraining extiende el contexto efectivo de Beam a 1 millón de tokens, mientras que la documentación de la API indica un límite de servicio de 256.000 tokens con una nota al pie sobre la beta. No son una contradicción, sino una capacidad del lado del entrenamiento y un límite del lado del servicio, pero esa brecha es exactamente lo que se convierte en un titular de «contexto de 1 M» si nadie lee el segundo documento. Y la cifra de RL de más de 100 millones de rollouts se presenta como una de las mayores ejecuciones de este tipo realizadas por cualquier laboratorio abierto, lo cual es una afirmación sobre la escala, no sobre lo que la escala aportó: la curva de puntuación frente a rollouts es del propio proveedor y termina donde el proveedor dejó de graficarla.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Lo que puedes hacer con Reflection Beam hoy

Una cosa: únete a la lista de espera y, si obtienes una clave, llama a Beam-501B-A23B a través del propio endpoint de Reflection con un cliente con formato OpenAI. No hay un precio publicado, así que no hay forma de modelar el coste de una carga de trabajo en él. No hay pesos, así que no hay autoalojamiento, ni cuantización, ni reproducción por terceros. No hay una fila de benchmark independiente, así que todo el panorama de rendimiento anterior se basa en las tablas de un solo laboratorio.

Reflection Beam no es una de nuestras rutas, y no vamos a insinuar que lo sea. Lo que sí podemos darte es el precio del campo al que intenta entrar, leído en vivo de nuestro propio catálogo esta mañana: GLM 5.2 a $1.40 de entrada y $4.40 de salida por millón de tokens, GLM 5.3 a $1.26 y $3.96, Qwen 3.8-Max a $2.00 y $6.00, y DeepSeek V4.1 Flash a $0.15 y $0.60. Eso es una diferencia de más de nueve veces entre el más barato y el más caro solo en entrada — y es la razón por la que un modelo beta sin precio de lista resulta realmente difícil de encajar en una decisión, por muy bien que se vea su gráfico de eficiencia.

OrcaRouter ejecuta una única clave compatible con OpenAI en esos cuatro y en más de 200 modelos adicionales, trasladando el precio de lista del proveedor sin añadir nada, de modo que un cambio de precio de un vendedor está activo en nuestro lado el mismo día, en lugar de cuando un revendedor actualiza una tabla. La conmutación por error automática forma parte del enrutamiento y no es algo que haya que construir alrededor de cada proveedor, lo que significa que un modelo no probado —sin reproducción, sin puntuación independiente y sin precio— es justo el tipo de cosa que se destina a una fracción del tráfico en lugar de a la ruta crítica.

Cuando la afirmación se vuelve comprobable

Tres cosas zanjan esto, y Reflection ha puesto dos de ellas dentro del mes.

Lo primero son los pesos. Apache 2.0 más un informe técnico permite que cualquiera con un par de nodos mida lo que importa —tokens por segundo por GPU con un umbral de calidad fijo, y si 23 mil millones de parámetros activos realmente entregan la puntuación por FLOP que sugiere el gráfico. Hasta entonces, el argumento de eficiencia es aritmética en una servilleta, y todo el que lo repite no hace más que repetir el pie de foto de Reflection.

Lo segundo es un precio. Un modelo sin precio de lista no tiene cabida en una comparación de costos. Si Beam se sitúa por encima de la gama de GLM y DeepSeek, el argumento del cómputo deja de importar para cualquiera que tenga un presupuesto; si se sitúa por debajo, el panorama cambia rápidamente.

El tercero es el índice. Artificial Analysis ha dicho que está evaluando Beam y no ha publicado ninguna cifra. Cuando aparezca esa fila, será la primera cifra de esta historia que Reflection no calculó.

Si hoy necesitas un codificador agéntico capaz y necesitas saber cuánto cuesta, la respuesta todavía no es Reflection Beam. Puede que lo sea en tres semanas. El modelo por el que vale la pena apostar por una afirmación de eficiencia es aquel cuyos pesos puedes descargar y cuyas FLOPs puedes contar tú mismo; y en esa prueba, Reflection nos ha dado una fecha y una lista de espera, no un modelo.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario