
O Reflection Beam lança uma API em beta, e os pesos ainda estão a duas semanas de distância
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O primeiro modelo da Reflection chama-se Reflection Beam, e a coisa interessante sobre ele esta manhã não é que ele existe — é que apenas metade dele existe. A empresa anunciou o Beam em 5 de outubro de 2026 como um modelo esparso de mistura de especialistas com 501 bilhões de parâmetros totais e 23 bilhões ativos por token, e colocou um endpoint beta compatível com OpenAI à sua frente no mesmo dia. Os pesos são prometidos para ainda este mês sob Apache 2.0, juntamente com um relatório técnico, um cartão de modelo e a pilha de serving. Até que cheguem, as únicas pessoas que podem executar o Beam-501B-A23B são aquelas a quem a Reflection entrega uma chave de lista de espera, e todos os números de desempenho em circulação vêm das próprias tabelas de um laboratório.
É um lugar estranho para um lançamento parar, e vale a pena ser preciso sobre qual metade temos. A Reflection lançou uma prévia na qual você pode se inscrever e um conjunto de tabelas de benchmark que ninguém reproduziu. Ela não lançou a coisa a que "open-weight" no título se refere.
O que está realmente ao vivo esta manhã
Tudo nesta seção vem do próprio post de blog e da documentação da Reflection, consultados em 6 de outubro de 2026.
• ID do modelo — Beam-501B-A23B, criado em 5 de outubro de 2026, disponibilizado em api.reflection.ai/openai/v1 com Chat Completions e uma lista de Models e nada mais.
Formato — 501 bilhões de parâmetros totais, 23 bilhões ativos por token, o que dá uma taxa de ativação de cerca de 4,6%. Para se ter uma ideia da escala, o GLM 5.2 fica perto de 5,4%.
• Contexto — 256.000 tokens na API, com uma nota de rodapé atrelada ao próprio número, alertando que a janela pode mudar durante o beta. A saída máxima é de 128.000 tokens.
• Raciocínio — um parâmetro reasoning_effort com cinco configurações: low, medium, high, xhigh e max. Medium é o padrão, e o modelo sempre raciocina. Não há opção de desligar nem modo sem raciocínio.
• Modalidade — texto de entrada, texto de saída. Sem entrada de imagem, áudio ou vídeo no lançamento.
• Preço — não publicado. O post do blog não traz um, a documentação não traz um, e o console da plataforma fica atrás de uma barreira de cadastro.
• Acesso — uma lista de espera. Não existe um caminho de autoatendimento e não há pesos, portanto não há download, nem quantização, nem ajuste fino.
A linha de preço é a que muda como você lê todo o resto. Quatro dos sete modelos com que o Beam é comparado nas próprias tabelas da Reflection têm preços de tabela públicos que você pode colocar numa planilha hoje. O Beam não tem, então qualquer afirmação de custo sobre ele agora é uma afirmação sobre computação, não sobre dólares.

O número do qual depende o lançamento
O argumento de venda da Reflection é a eficiência de inferência, e ele é incomumente específico sobre o que isso significa: em benchmarks avançados de raciocínio, o Beam tem desempenho comparável ao GLM 5.2 enquanto usa de 3 a 4× menos computação de inferência. Os ganhos são descritos como ainda maiores em relação a modelos da família de 2 trilhões de parâmetros, na qual se situa o Qwen 3.8-Max.
O gráfico por trás dessa afirmação vale a pena ser lido com atenção, porque é a evidência que sustenta todo o post. Ele representa a pontuação de raciocínio em função dos FLOPs de inferência estimados em DeepSWE, Humanity's Last Exam e Terminal-Bench 2.1, e estima os FLOPs como aproximadamente duas vezes o número de parâmetros ativos multiplicado pelo número médio de tokens gerados por tentativa. Essa fórmula exclui deliberadamente o pré-preenchimento do prompt, operações de atenção dependentes do contexto e sobrecarga de serviço — a Reflection diz isso na legenda. É uma comparação consistente entre modelos, e não uma medição da conta de ninguém, e também é o único apoio quantitativo para a alegação de eficiência, escrito pelo laboratório que criou o modelo. Trate-o como uma hipótese que os pesos permitirão que outra pessoa teste.
O que a arquitetura proporciona, na prática, é um perfil de serving. Vinte e três bilhões de parâmetros ativos é um modelo que você consegue plausivelmente executar em um número relativamente pequeno de GPUs com latência interativa, o que é um produto diferente de um modelo denso de 501 bilhões de parâmetros, ainda que o número na ficha seja o mesmo. É por isso que a Reflection pode falar de raciocínio próximo da fronteira sem falar de uma implantação em escala de data center — e por isso o futuro lançamento dos pesos é o evento que importa mais do que a chave beta.
Onde o Beam aparece nas próprias tabelas do Reflection
Todos os números abaixo são da Reflection, provenientes das tabelas da publicação de lançamento da Reflection, e nenhum deles foi reproduzido de forma independente. Onde a Reflection não publicou um número para um modelo, a célula exibe NR no original. As colunas de comparação são da Reflection, não nossas e não de terceiros.
Programação e trabalho no terminal
• Terminal-Bench v2.1 — Reflection Beam 80.1 contra GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6 e DeepSeek V4.1 Flash 90.6. Beam fica abaixo de todos eles.
• SWE-Bench Verified — Reflection Beam 80.9 contra Inkling 77.6 e Nemotron 3 Ultra 70.7. É aqui que o Beam parece mais forte, mas note que apenas os dois modelos mais fracos da lista foram executados nele.
• SWE-Bench Pro v1 — Reflection Beam 65,5 contra Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77,2 contra Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9. Uma diferença de dez pontos para o topo da tabela.
• DeepSWE v1.1 — Reflection Beam 44,4 contra DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam fica no mesmo nível da geração anterior e trinta pontos atrás do líder.
• SWE Atlas Codebase QnA — Reflection Beam 34,6 contra Kimi K3 68,0 e GLM 5.3 61,0. Manter um grande repositório em mente ao longo de uma longa interação é a coisa mais difícil desta lista, e o 34,6 do Beam não é uma diferença de arredondamento.
Raciocínio e ciência
• AIME 2026 — Reflection Beam 97,8 contra GLM 5.2 99,2 e Inkling 97,1.
• HLE sem ferramentas — Reflection Beam 36,2 contra Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. No meio do pelotão, e à frente apenas dos dois modelos da geração anterior.
• GPQA Diamond — Reflection Beam 90,5 contra Kimi K3 93,5, Qwen 3.8-Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9.
• SciCode — Reflection Beam 49,7 contra GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.
• CriPT AA — Reflection Beam 16.3 contra Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Ferramentas, pesquisa e contexto longo
• MCP Atlas — Reflection Beam 78,7 contra Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.
• AutomationBench, divisão pública — Reflection Beam 37,0 contra DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.
• tau3 banking — Reflection Beam 38.0 contra Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.
• BrowseComp com gestão de contexto — Reflection Beam 77,4 contra Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA com gerenciamento de contexto — Reflection Beam 80.1 contra Kimi K3 95.0.
• AA-LCR — Reflection Beam 79,3 contra Kimi K3 88,7, DeepSeek V4.1 Flash 84,0, Qwen 3.8-Max 80,3, GLM 5.3 79,7, Nemotron 3 Ultra 79,3, GLM 5.2 78,3, Inkling 77,3. O recall de contexto longo é a única linha de capacidade geral em que o Beam é genuinamente competitivo, em vez de ficar no meio do pelotão.
Leia as quatro tabelas em conjunto e um padrão consistente aparece: o Beam supera os dois modelos da geração anterior na lista da Reflection e perde para o atual, em quase todas as linhas, por margens que variam de pequenas a desqualificantes. Um fornecedor que publica tabelas que colocam seu próprio modelo atrás em tantas linhas é um bom sinal sobre a honestidade do laboratório. Não é um sinal de que o modelo está na fronteira.

A única voz independente até agora, e o que ela não diz
A única avaliação de terceiros registrada é a da Artificial Analysis, que disse em 5 de outubro que a Reflection lhe havia concedido acesso e que estava avaliando o Beam de forma independente, acrescentando que indicadores iniciais sugerem que o Beam será um dos modelos abertos mais eficientes em tokens que já viu para o seu nível de inteligência.
Isso é uma declaração significativa da organização cujo índice é o que a maioria dos compradores realmente lê, e é também uma declaração sem nenhum número. Nesta manhã, ainda não há nenhuma linha Beam no ranking da Artificial Analysis — as páginas dos modelos retornam 404 e o payload do ranking não contém nenhuma entrada Beam —, portanto, por enquanto, a alegação de eficiência de tokens é uma promessa, feita por um terceiro, de que publicará algo. Nada no índice foi recalculado no Beam até agora.
A divulgação sobre o treinamento, que é a parte mais forte do comunicado
A seção de engenharia do post da Reflection contém números que a maioria dos laboratórios mantém internos, e vale a pena registrá-los porque são a parte do lançamento que ainda será interessante daqui a um mês.
• Pré-treinamento — 23,8 trilhões de tokens curados em 6.144 chips NVIDIA GB300 em racks NVL72, concluído de ponta a ponta em menos de quatro semanas, com um goodput relatado de 92,3 por cento, e nove retrocessos semiautomáticos ao longo do caminho atribuídos a picos na norma do gradiente ou a suspeitas de corrupção silenciosa de dados.
• Aprendizado por reforço — 10.500 chips GB300 durante quatro semanas, mais de 100 milhões de rollouts, um contexto máximo de rollout de 256.000 tokens, aproximadamente 1,3 bilhão de sandboxes e cerca de um milhão de ambientes distintos obtidos para tarefas de programação, agênticas e STEM.
• Serviço — novos pesos chegaram à frota de inferência numa mediana de cerca de 12 segundos, com a distribuição hierárquica a reduzir o tráfego entre racks em 75 por cento e a tornar a adoção em toda a frota 2,2× mais rápida do que quando cada réplica puxa os pesos por conta própria.
• Estabilidade — gradientes de política totalmente assíncronos que permanecem numericamente estáveis ao aprender a partir de interações com um dia de defasagem, além de uma penalidade de comprimento controlável para equilibrar o comprimento do raciocínio em relação à pontuação sem retreinamento.
• Dados — cerca de 95% dos tokens brutos da internet eliminados por meio de parsing, deduplicação e curadoria, com a alegação de que filtros convencionais teriam deixado de fora cerca de 1,8 trilhão dos tokens que a Reflection reteve, incluindo 87% de seus tokens curados de web e código.
Duas linhas merecem um alerta. O post afirma que o midtraining estende o contexto efetivo do Beam para 1 milhão de tokens, enquanto a documentação da API lista um limite de serviço de 256.000 tokens com uma nota de rodapé sobre beta. Trata-se de uma capacidade do lado do treinamento e de um limite do lado do serviço, e não de uma contradição, mas a disparidade é exatamente o que se transforma numa manchete de "contexto de 1M" se ninguém ler o segundo documento. E o número de RL de mais de 100 milhões de rollouts é apresentado como uma das maiores execuções desse tipo de qualquer laboratório aberto, o que é uma afirmação sobre escala, não sobre o que a escala rendeu — a curva de pontuação versus rollouts é do próprio fornecedor e termina onde o fornecedor parou de plotá-la.

O que você pode fazer hoje com o Reflection Beam
Uma coisa: entre na lista de espera e, se você conseguir uma chave, chame o Beam-501B-A23B pelo endpoint próprio da Reflection com um cliente no formato OpenAI. Não há preço publicado, então não há como modelar o custo de uma carga de trabalho nele. Não há pesos, então não há hospedagem própria, nem quantização, nem reprodução por terceiros. Não há linha de benchmark independente, então todo o panorama de desempenho acima se baseia nas tabelas de um único laboratório.
O Reflection Beam não é uma das nossas rotas, e não vamos insinuar que é. O que podemos dar é o preço do segmento em que está a tentar entrar, lido ao vivo do nosso próprio catálogo esta manhã: GLM 5.2 a $1,40 de entrada e $4,40 de saída por milhão de tokens, GLM 5.3 a $1,26 e $3,96, Qwen 3.8-Max a $2,00 e $6,00, e DeepSeek V4.1 Flash a $0,15 e $0,60. Isto é uma diferença de mais de nove vezes entre o mais barato e o mais caro só na entrada — e é por isso que um modelo beta sem preço de tabela é genuinamente difícil de encaixar numa decisão, por muito bom que pareça o seu gráfico de eficiência.
O OrcaRouter usa uma única chave compatível com a OpenAI nesses quatro e em mais de 200 outros modelos, repassando o preço de tabela do provedor sem acrescentar nada, de modo que uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, em vez de só quando um revendedor atualiza uma tabela. O failover automático faz parte do roteamento, em vez de ser algo que você precisa construir em torno de cada provedor, o que significa que um modelo não comprovado — sem reprodução, sem pontuação independente e sem preço — é exatamente o tipo de coisa que você coloca em uma parcela do tráfego, e não no seu caminho crítico.
Quando a afirmação se torna testável
Três coisas resolvem isto, e a Reflection colocou duas delas dentro do mês.
O primeiro são os pesos. Apache 2.0 mais um relatório técnico permite que qualquer pessoa com alguns nós meça o que realmente importa — tokens por segundo por GPU em um patamar de qualidade fixo, e se 23 bilhões de parâmetros ativos realmente entrega a pontuação por FLOP que o gráfico sugere. Até lá, o argumento de eficiência é aritmética de guardanapo, e todo mundo que o repete está repetindo a legenda da Reflection.
O segundo é um preço. Um modelo sem preço de tabela não tem lugar numa comparação de custos. Se o Beam ficar acima do patamar do GLM e do DeepSeek, a questão do poder computacional deixa de importar para quem tem orçamento; se ficar abaixo, o cenário muda rapidamente.
O terceiro é o índice. A Artificial Analysis disse que está fazendo benchmark do Beam e não publicou nenhum número. Quando essa linha aparecer, será o primeiro número desta história que a Reflection não calculou.
Se você precisa hoje de um programador agêntico capaz e precisa saber quanto isso custa, a resposta ainda não é o Reflection Beam. Talvez seja daqui a três semanas. O modelo no qual vale a pena apostar uma alegação de eficiência é aquele cujos pesos você pode baixar e cujos FLOPs você mesmo pode contar — e, nesse teste, a Reflection nos deu uma data e uma lista de espera, não um modelo.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
