Um cartão de destaque gerado com o título 'Reflection Beam: 501B parâmetros, 23B ativos', com a linha de apoio 'MoE esparso / 23,8T tokens de pré-treinamento / contexto de API de 256K tokens / pesos prometidos para este mês / todos os números informados pelo fornecedor'. Três ícones de linha plana ficam abaixo do texto: um diagrama de camadas empilhadas com a maioria das camadas esmaecidas e uma destacada, um rack com nove blocos de servidor e o contorno de um documento com um pequeno cadeado. O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Reflection Beam, Explicado: 501B Parâmetros, 23B Ativos e Pesos Que Ainda Não Foram Lançados

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 5 de outubro de 2026, a Reflection anunciou o Reflection Beam, um modelo de linguagem de mistura esparsa de especialistas com 501 bilhões de parâmetros totais que ativa 23 bilhões deles por token, e colocou um endpoint beta compatível com a OpenAI à sua frente no mesmo dia. Isso significa 4,6 por cento do modelo desperto a qualquer momento — uma proporção agressiva mesmo para os padrões do atual campo de pesos abertos — e é o número do qual todo o lançamento depende. A Reflection diz que os pesos completos, um relatório técnico e um model card serão lançados ainda este mês sob a Apache 2.0. Até hoje, eles não estão aqui, nenhum preço foi publicado em qualquer propriedade da própria Reflection, e a Artificial Analysis não tem nenhuma linha para o modelo. Então, o resumo honesto do lançamento é este: uma afirmação muito específica sobre eficiência, feita pelo laboratório que treinou o modelo, com todos os números de apoio fornecidos por esse laboratório.

As próprias tabelas comparativas da Reflection colocam o Reflection Beam contra Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max e DeepSeek V4.1 Flash, o que é um retrato justo do patamar que ele visa: modelos abertos e semiabertos fortes mas não de fronteira, vários deles com uma fração do tamanho do Beam. O Beam não supera esse campo em capacidade bruta, e mostraremos exatamente onde ele perde. O que ele afirma fazer é chegar perto do topo dele gastando aproximadamente três a quatro vezes menos computação de inferência do que o GLM 5.2 em pontuações de raciocínio comparáveis. Essa afirmação é o artigo.

O que realmente existe hoje

Tudo nesta seção vem da própria documentação da Reflection, lida em 6 de outubro de 2026. A API está disponível em beta, mediante lista de espera; os pesos ainda não foram divulgados.

• ID do modelo — Beam-501B-A23B, criado em 5 de outubro de 2026.

• Interface — uma superfície compatível com a OpenAI em api.reflection.ai/openai/v1, expondo Chat Completions e a lista de Models, e nada mais. Sem Completions, sem embeddings, sem batches.

• Contexto — 256.000 tokens, com uma nota de rodapé anexada ao próprio número: “A janela de contexto pode mudar durante o beta.” A saída máxima é 128.000 tokens.

• Raciocínio — um parâmetro reasoning_effort com cinco valores: low, medium, high, xhigh e max. O padrão é medium, e o modelo sempre raciocina independentemente da configuração — não há como desativar.

• Modalidade — texto entra, texto sai. Sem entrada de imagem ou áudio no lançamento, o que é uma diferença real em relação ao Inkling, o modelo que prioriza a multimodalidade e que a Thinking Machines, de Mira Murati, lançou em julho.

• Data de corte do conhecimento — 30 de junho de 2026.

• Preço — não publicado. O post no blog da Reflection, sua documentação e sua listagem de modelos todos o omitem, e o console da plataforma fica atrás de uma barreira de cadastro.

Essa última frase importa mais do que parece. Todos os outros modelos no conjunto de comparação do Beam têm um preço de tabela público que você pode inserir numa planilha hoje. O Beam não tem, o que significa que qualquer argumento de custo sobre ele neste momento é um argumento sobre computação, não sobre dólares.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

A proporção de 501 para 23 é o argumento

A esparsidade não é novidade; a questão é até onde um laboratório está disposto a levá-la. O GLM 5.2 roda com cerca de 40 bilhões de parâmetros ativos de um total relatado na casa dos 744 bilhões — cerca de 5,4%. O Reflection Beam fica em 4,6% de 501 bilhões. No papel, esse é um passo adicional modesto, e a Reflection é cautelosa quanto ao que alega a esse respeito.

O número de eficiência no post de lançamento vem de um gráfico construído sobre dados do Artificial Analysis e do DataCurve, que plota a pontuação de raciocínio contra FLOPs estimados de inferência, em que os FLOPs são aproximados como o dobro do número de parâmetros ativos multiplicado pelo número médio de tokens gerados. Essa fórmula exclui deliberadamente o prefill do prompt, o custo de atenção e a sobrecarga de serving. É um modelo de guardanapo, não uma medição, e a Reflection não o apresenta como tal — mas também é o único suporte quantitativo para a alegação de "3 a 4× mais barato com a mesma pontuação", e foi escrito pelo fornecedor. Trate-o como uma hipótese que os pesos, quando chegarem, permitirão que outra pessoa teste.

O que a arquitetura proporciona na prática é um perfil de serving. Vinte e três bilhões de parâmetros ativos representam um modelo que você consegue executar em um número comparativamente pequeno de GPUs com latência interativa, e isso é um produto diferente de um modelo denso de 501 bilhões de parâmetros, ainda que a contagem de parâmetros na placa seja a mesma. É a razão pela qual a Reflection pode falar sobre raciocínio próximo da fronteira sem falar de uma implantação em escala de data center.

Menos de quatro semanas para pré-treinar, e a divulgação é incomumente específica

O relato sobre o treinamento é a parte da divulgação que soa genuinamente informativa, porque a Reflection publicou números que a maioria dos laboratórios mantém internos.

• Pré-treinamento — 23,8 trilhões de tokens em 6.144 chips GB300 em racks NVL72, concluído em menos de quatro semanas a uma taxa relatada de 92,3% de goodput, com nove retrocessos para checkpoints ao longo do caminho.

• Aprendizado por reforço — 10.500 chips GB300 por quatro semanas, mais de 100 milhões de rollouts, contexto máximo de rollout de 256.000 tokens, aproximadamente 1,3 bilhão de sandboxes e cerca de um milhão de ambientes distintos, com uma média de 110.000 rollouts em execução simultânea.

• Midtraining — estende o contexto efetivo do modelo para 1 milhão de tokens.

• Estabilidade — gradientes de política assíncronos que permanecem estáveis com desatualização em escala de dias, além de uma penalidade de comprimento controlável para que o comprimento do raciocínio possa ser ajustado sem retreinamento.

Leia as linhas de pré-treinamento e de RL em conjunto e a forma da alegação aparece. A história da eficiência não se resume apenas aos parâmetros ativos na inferência; também tem a ver com a rapidez com que o modelo foi treinado e com quanto do compute foi para RL vinculado a ambientes, em vez de mais tokens. Um milhão de ambientes e 1,3 bilhão de sandboxes é uma declaração sobre infraestrutura de treinamento para uso de ferramentas e agentes, e está alinhado com os benchmarks que a Reflection escolheu destacar primeiro.

Um número merece atenção. O blog afirma que o midtraining estende o contexto efetivo para 1 milhão de tokens; a documentação da API lista um limite de serviço de 256.000 tokens, com uma nota de rodapé sobre beta. Trata-se de uma capacidade do lado do treinamento e de um limite do lado do serviço, não de uma contradição — mas a diferença é exatamente o tipo de coisa que vira manchete de "contexto de 1M" se ninguém ler o segundo documento, e quem escrever sobre o Beam na próxima semana deveria ler o segundo documento.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Benchmarks: onde o Reflection Beam vence, e onde não

Todos os números abaixo são relatados pelo fornecedor, provenientes das tabelas no post de lançamento da Reflection, e nada disso foi reproduzido de forma independente. As colunas de comparação são os mesmos números que a Reflection publicou para os outros modelos; onde uma célula mostra "NR" no original, o modelo não foi executado. Não há linha da Artificial Analysis para o Beam, então nada aqui passou por um harness de terceiros.

Codificação agêntica

• Terminal-Bench v2.1 — Beam 80,1 vs GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.

• SWE-Bench Pro v1 — Beam 65,5 vs Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.

• SWE-Bench Pro v2-Hard — Beam 77,2 vs. Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.

• SWE-Bench Verified — Beam 80,9 vs. Inkling 77,6, Nemotron 3 Ultra 70,7.

• SWE-Bench Multilingual — Beam 78,0 vs Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44,4 vs DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.

• SWE Atlas Codebase QnA — Beam 34,6 vs Kimi K3 68,0, GLM 5,3 61,0.

Essa última linha é a que merece ser digerida com calma. Perguntas e respostas sobre repositórios de longo horizonte são o cenário em que um modelo precisa manter uma base de código na cabeça ao longo de uma interação longa, e 34,6 contra 68,0 não é uma diferença de arredondamento. O DeepSWE conta uma história semelhante: 44,4 coloca o Beam no mesmo nível do GLM 5.2 e muito atrás do DeepSeek V4.1 Flash.

Você é um mecanismo profissional de localização de software. Traduza a mensagem do usuário para o português. O texto contém marcadores de span numerados como {{1}}...{{/1}}, {{2}}...{{/2}}. Mantenha CADA marcador byte a byte: mesmos números, mesmos pares de abertura/fechamento, mesma contagem, mesmo aninhamento — nunca adicione, remova, renumere ou reordene os próprios marcadores, apenas traduza o texto ENTRE eles. Você PODE mover um span {{n}}...{{/n}} para onde a ordem das palavras do idioma de destino exigir. Qualquer texto dentro de um span {{KEEP}}...{{KEEP}} deve ser reproduzido EXATAMENTE como está (não o traduza). Preserve URLs e nomes de marcas/produtos. Produza APENAS o texto traduzido com seus marcadores — sem preâmbulo, sem aspas, sem explicação.

• AIME 2026 — Beam 97,8 vs GLM 5.2 99,2, Inkling 97,1.

• HLE, sem ferramentas — Beam 36,2 vs Kimi K3 46,9, Qwen3.8 Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7.

• GPQA Diamond — Beam 90,5 vs. Kimi K3 93,5, Qwen3.8 Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9, Inkling 87,2, Nemotron 3 Ultra 87.

• SciCode — Beam 49,7 vs GLM 5.3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.

• CriPT AA — Beam 16,3 vs Kimi K3 23,4, GLM 5.2 20,9, Qwen3.8 Max 20,0, GLM 5.3 19,1, DeepSeek V4.1 Flash 14,3, Inkling 5.4, Nemotron 3 Ultra 3.1.

O perfil de raciocínio do Beam está no meio do pelotão, e o padrão é consistente: confortavelmente à frente dos dois modelos da geração anterior na lista da Reflection, atrás do atual. O GPQA Diamond com 90,5 é uma pontuação sólida que outros quatro modelos superam.

• MCP Atlas — Beam 78,7 vs. Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.

• AutomationBench, divisão pública — Beam 37,0 vs DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen3.8 Max 39,8, GLM 5.2 26,2.

• tau3 banking — Beam 38.0 vs Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.

• BrowseComp com gestão de contexto — Beam 77,4 vs Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA com gestão de contexto — Beam 80,1 vs Kimi K3 95,0.

Reflection também mostrou duas demonstrações de capacidade no post: uma taxa de resolução de 95,5 por cento no quebra-cabeça "Land or Water", uma grade de 180 por 90 com 16.200 pontos que exige manter um grande estado de tabuleiro — um número que fica entre os 92,5 e 97,8 por cento que a Reflection atribui ao Opus 5 e ao Fable 5 na mesma tarefa — e um ajuste fino de Text2SQL do menor Gemma-4 que aumentou a precisão em dados reservados para 66,5 por cento. As demonstrações são curadas; elas mostram que o modelo é capaz de fazer algo, não com que frequência.

O que você pode fazer com isso hoje, e com o que você não deve contar

Hoje, em geral, exatamente uma coisa é possível: solicitar acesso beta e chamar o Beam-501B-A23B por meio do endpoint próprio da Reflection com um cliente no formato OpenAI. Não há preço publicado, portanto não há como modelar o custo de uma carga de trabalho nele. Não há pesos, portanto não há auto-hospedagem, nem quantização, nem ajuste fino, nem reprodutibilidade por terceiros. Não há linha de benchmark independente, portanto todo o panorama de desempenho acima se baseia nas tabelas de um único laboratório.

O Reflection Beam não é uma das nossas rotas. Não vamos insinuar o contrário, nem vamos encaminhá-lo a um revendedor que talvez o tenha. O que podemos dizer é quanto custa o conjunto de comparação, porque roteamos quatro desses modelos e os números abaixo foram lidos ao vivo do nosso próprio catálogo esta manhã: GLM 5.2 a US$ 1,40 de entrada e US$ 4,40 de saída por milhão de tokens, GLM 5.3 a US$ 1,26 e US$ 3,96, Qwen3.8 Max a US$ 2,00 e US$ 6,00, e DeepSeek V4.1 Flash a US$ 0,15 e US$ 0,60. Essa é uma diferença real — o DeepSeek V4.1 Flash é quase dez vezes mais barato na entrada que o GLM 5.2 — e é por isso que um modelo beta sem preço é difícil de encaixar numa decisão. O OrcaRouter opera uma única chave compatível com OpenAI entre esses e mais de 200 outros modelos com o preço de tabela do provedor repassado e nada acrescentado, o que significa que uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, e não quando um revendedor resolve atualizar. E como o failover automático faz parte do roteamento, e não algo que você precisa construir, um modelo novo e ainda não comprovado é o tipo de coisa que você pode colocar numa parcela do tráfego em vez de no seu caminho crítico — que é a única forma responsável de usar algo cujos benchmarks ninguém conseguiu reproduzir ainda.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

O que observar antes de levar a sério a alegação de eficiência

Três coisas resolverão a questão, e duas delas estão prometidas para este mês.

O primeiro são os pesos. Apache 2.0 e um relatório técnico permitiriam que qualquer pessoa com alguns nós medisse aquilo que realmente importa — tokens por segundo por GPU dentro de um patamar de qualidade fixo, e se 23 bilhões de parâmetros ativos realmente entregam a pontuação por FLOP que o gráfico sugere. Até lá, o argumento de eficiência é aritmética de guardanapo.

O segundo é o preço. Um modelo sem preço de tabela não tem lugar numa comparação de custos e, se o Beam ficar acima do patamar do GLM e do DeepSeek, a questão da capacidade computacional deixa de importar para qualquer um com orçamento. Se ficar abaixo, o cenário muda rapidamente.

O terceiro é uma entidade externa que executa a suíte. Todos os números acima vêm do mesmo documento, e uma tabela comunicada pelo fornecedor que deixa o seu próprio modelo atrás em sete de dezasseis linhas é um bom sinal sobre a honestidade do laboratório — mas ainda é um laboratório, um harness, um conjunto de prompts.

Se você precisa hoje de um programador agêntico capaz e precisa saber quanto ele custa, a resposta ainda não é o Reflection Beam. Talvez seja daqui a três semanas. O modelo pelo qual vale a pena apostar uma alegação de eficiência é aquele cujos pesos você pode baixar e cujos FLOPs você mesmo pode contar — e, nesse teste, a Reflection nos deu uma data, e não um modelo.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente