
Reflection Beam vs Claude Opus 5.5: Um que você pode chamar hoje, outro pelo qual você precisa esperar
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Reflection Beam e Claude Opus 5.5 ainda não são realmente rivais, e o motivo é administrativo, não técnico. O Beam, primeiro modelo da Reflection, foi anunciado em 5 de outubro de 2026 e é um modelo esparso de mistura de especialistas com 501 bilhões de parâmetros, ativando 23 bilhões de parâmetros por token — mas só é acessível por meio de uma lista de espera, seus pesos estão prometidos para ainda este mês sob a licença Apache 2.0, e nenhum preço foi publicado em lugar algum. O Opus 5.5 foi lançado em 22 de setembro de 2026 como o carro-chefe da Anthropic: uma janela de 1 milhão de tokens, entrada de texto, imagem e arquivo, e um preço de tabela de US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída. Então, a versão honesta desta comparação é que um desses modelos você pode colocar em produção hoje à tarde com um custo conhecido, e o outro não — e todo o resto aqui é uma projeção sobre o que acontece quando os pesos chegarem.
A resposta curta
Se a pergunta é em qual modelo construir esta semana, é o Opus 5.5 sem muita discussão: ele está disponível de forma geral, é avaliado de forma independente, é multimodal, tem preço definido e é servido por meio de uma API que você pode chamar em cinco minutos. O caso do Beam não se baseia em superar o Opus 5.5 — nada no próprio material da Reflection afirma isso. Ele se baseia em uma proposição muito mais restrita: que, em uma dada pontuação de raciocínio, o Beam consome cerca de um quarto do poder computacional de inferência. Se isso se confirmar quando alguém de fora da Reflection fizer a medição, o Beam se torna interessante para trabalhos de alto volume, em que a resposta precisa ser boa, mas não a melhor. Se não se confirmar, o Beam é um modelo aberto de meio de tabela com uma lista de espera.
O que se segue separa as partes deste confronto que são fatos hoje das partes que são apostas.
O que cada modelo é, exatamente
Opus 5.5 é o sucessor fechado e hospedado do Claude Opus 5, posicionado pela Anthropic para alterações em várias etapas em grandes bases de código, revisão de código e sessões autónomas longas. Aceita texto, imagens e ficheiros, devolve texto, disponibiliza uma janela de contexto de 1 000 000 de tokens com até 128 000 tokens de saída e expõe raciocínio alargado com um esforço de raciocínio configurável. Não tem pesos abertos, e o seu conhecimento está limitado pela data de corte de treino da Anthropic, e não por algo que possa controlar.
Reflection Beam é a construção oposta. Ele tem 501 bilhões de parâmetros totais, com 23 bilhões ativos — cerca de 4,6% do modelo desperto por token, uma proporção agressiva mesmo em comparação com os cerca de 5,4% do GLM 5.2 — projetado para ser barato de servir, em vez de barato de treinar. Ele é apenas texto. Seu contexto de API é de 256.000 tokens, com uma nota de rodapé avisando que o número pode mudar durante o beta, e sua saída máxima é de 128.000 tokens. O endpoint é compatível com OpenAI em api.reflection.ai/openai/v1 e expõe Chat Completions, além de uma lista de modelos, e nada mais. Seu parâmetro reasoning_effort aceita cinco valores, tem medium como valor padrão e não pode ser desativado.
• Preço — Claude Opus 5.5: US$ 4,00 de entrada e US$ 20,00 de saída por milhão de tokens, com leituras de cache a US$ 0,20 e gravações de cache a US$ 5,00, em comparação com Reflection Beam: não publicado no post do blog, na documentação ou na listagem do modelo.
• Disponibilidade — O Opus 5.5 está em disponibilidade geral hoje; o Beam é uma lista de espera para uma beta, com os pesos, o relatório técnico e o cartão do modelo prometidos para ainda este mês.
• Modalidade — Opus 5.5 aceita texto, imagens e arquivos; Beam aceita apenas texto.
• Contexto — 1.000.000 de tokens contra 256.000, com o número do Beam carregando uma ressalva de beta.
• Pesos abertos — não para o Opus 5.5, prometidos sob Apache 2.0 para o Beam, ainda não entregues.
• Pontuação independente — Opus 5.5 possui uma; Beam não.

O preço é a parte que não se compara
Os US$ 4,00 e US$ 20,00 do Opus 5.5 são o preço de tabela do provedor e, no nosso catálogo, são repassados sem alteração, sem nada acrescentado. Leituras de cache a US$ 0,20 e gravações de cache a US$ 5,00 importam enormemente para a carga de trabalho para a qual o Opus 5.5 é vendido — uma longa sessão agêntica que relê a mesma base de código de 200.000 tokens turno após turno paga o preço de cache sobre quase tudo, e não o preço de entrada. Essa é uma alavanca real e muitas vezes subestimada, e vale a pena modelá-la antes de concluir que um modelo de fronteira está fora do orçamento.
Beam não tem um número comparável. Não há preço de tabela para comparar, nenhuma camada de cache para modelar e nenhuma tarifa publicada para o beta. A Reflection não disse se o Beam será vendido por token, cobrado por assento ou distribuído gratuitamente junto com os pesos. Qualquer pessoa que cite um custo por milhão para o Beam hoje está inventando isso.
A consequência prática: a comparação de preços não é "o Opus 5.5 é caro e o Beam é mais barato". É "um deles tem um preço e o outro tem uma data". Para uma equipe que precisa decidir hoje, essa assimetria decide mais do que os benchmarks.
Benchmarks: os dois números que se sobrepõem, e por que eles ainda não são comparáveis
As tabelas de lançamento do Reflection não incluem o Opus 5.5, nem qualquer modelo fechado de fronteira. Seu conjunto de comparação é inteiramente aberto ou semiaberto: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max e DeepSeek V4.1 Flash. Assim, qualquer tabela Beam-versus-Opus precisa ser montada à mão, e montá-la com honestidade significa nomear as diferenças de harness em vez de suavizá-las.
Existem exatamente dois benchmarks em que ambos os modelos têm um valor publicado, e nenhum dos emparelhamentos é controlado.
• Humanity's Last Exam — Reflection relata Beam em 36,2 sem ferramentas; Artificial Analysis afirma que o Opus 5.5 está em 61,4. Duas estruturas de avaliação diferentes, duas configurações diferentes — o valor do Opus 5.5 não é sem ferramentas — e uma diferença de vinte e cinco pontos diz menos sobre os modelos do que sobre a configuração.
• SciCode — Reflection relata Beam em 49,7; Artificial Analysis registra 66,9 para Opus 5.5. Mesmo benchmark, mesmo problema: um número é a execução do próprio fornecedor, o outro é uma estrutura de avaliação de terceiros.
Todo o resto não se sobrepõe em nada. A tabela do Beam baseia-se no Terminal-Bench v2.1, enquanto o índice atual da Artificial Analysis usa o Terminal-Bench 4.0 — uma versão diferente da mesma suíte, e é por isso que o 80,1 do Beam e o 59,6 do Opus 5.5 nesse quadro não constituem uma comparação e nunca devem ser impressos lado a lado. No próprio índice, a Artificial Analysis coloca o Opus 5.5 em 57,6 na configuração Max / Default Fallback, classificado em quarto lugar entre os 147 modelos dessa execução. O Beam não tem linha no índice: as páginas do modelo retornam 404 e o ranking não traz nenhuma entrada do Beam até esta manhã.
A única declaração genuinamente independente sobre o Beam de que se tem registro é a da Artificial Analysis dizendo, em 5 de outubro, que a Reflection lhe havia dado acesso e que ela estava avaliando o modelo de forma independente — e que os primeiros indicadores sugerem que o Beam será um dos modelos abertos mais eficientes em tokens que ela já viu para o seu nível de inteligência. Essa é uma frase forte vinda da fonte certa e ainda é uma frase sem um número. É o número que vai decidir este confronto.

Onde a alegação de eficiência realmente pesa
O argumento da Reflection não é que o Beam seja mais inteligente do que um modelo de fronteira. É que o Beam é comparável ao GLM 5.2 usando de 3 a 4× menos inferência, e que a diferença aumenta em relação aos modelos da família de 2 trilhões de parâmetros, onde o Q-3.8-Max se situa. O gráfico por trás disso estima os FLOPs gerados como duas vezes a contagem de parâmetros ativos vezes a média de tokens gerados por tentativa, e sua própria legenda admite que isso exclui o pré-preenchimento do prompt, a atenção e a sobrecarga de serviço.
Se levarmos isso ao pé da letra, o alvo interessante não é o Opus 5.5 de forma alguma — é o meio do mercado. O Opus 5.5 compete em capacidade por tarefa e vence nas tarefas que exigem julgamento: refatorações em várias etapas, revisão de código, trabalhos em que uma resposta errada custa mais do que os tokens. Um modelo que está 4,6 por cento acordado por token compete em custo por tarefa e vence onde o volume domina e o padrão de qualidade é "suficientemente bom e verificado a jusante". Esses são produtos diferentes, e uma comparação que coloca o Beam contra o Opus 5.5 num único placar está medindo a coisa errada.
Há um efeito de segunda ordem que vale a pena nomear. Se a alegação de eficiência da Beam se sustentar, seu lugar natural é o tipo de carga de trabalho em que, de outra forma, você gastaria tokens de um modelo de fronteira em uma tarefa para a qual ele está superqualificado. Essa é uma decisão de roteamento, não uma escolha de modelo, e é por isso que a questão do preço importa mais do que a questão do benchmark aqui: você não pode rotear com base em custo para um modelo sem custo.
Executando-os lado a lado, quando Beam é chamável
O Opus 5.5 está no nosso catálogo hoje a US$ 4,00 e US$ 20,00 por milhão de tokens, preço de tabela repassado sem nada acrescentado, e ele fica ao lado de mais de 200 outros modelos por trás de uma única chave compatível com OpenAI em api.orcarouter.ai/v1. Se você quisesse fazer um teste A/B de uma carga de trabalho entre um modelo de fronteira e um modelo aberto barato, é esse o formato da configuração: dois IDs de modelo, uma chave, nenhum segundo contrato e nenhuma alteração no código — e o failover automático no roteamento significa que um provedor tendo uma tarde ruim não leva o seu pipeline junto.
Beam ainda não pode fazer parte disso, e não vamos fingir o contrário. Reflection Beam não é uma das nossas rotas, e não vamos direcionar você para quem quer que possa revendê-lo. Quando os pesos forem lançados sob Apache 2.0, você poderá hospedá-lo por conta própria e encaminhar para seu próprio endpoint; até então, o único caminho é a lista de espera da Reflection.
Para uma carga de trabalho em que um modelo de fronteira é genuinamente necessário, a comparação a ser feita não é com o Beam. É com todo o resto do catálogo: GLM 5.3 a US$ 1,26 e US$ 3,96, Qwen 3.8-Max a US$ 2,00 e US$ 6,00, e DeepSeek V4.1 Flash a US$ 0,15 e US$ 0,60, todos consultados ao vivo nesta manhã. Essa é a faixa em que o Beam vai entrar se praticar preços competitivos, e é um entorno muito mais difícil do que o gráfico de lançamento sugere.

O que mudaria este veredito?
Três coisas, em ordem de quanto importariam.
Uma linha do Artificial Analysis para o Beam. Não o anúncio de que uma está chegando — a linha. Se o índice ficar perto dos 57,6 do Opus 5.5 enquanto a alegação de eficiência de tokens sobrevive ao contato com um harness de terceiros, o meio do mercado fica genuinamente desconfortável e o Beam se torna o padrão para muito trabalho de alto volume. Se ficar mais perto do cluster de open-weights, na casa dos quarenta baixos, o Beam é um modelo barato e sólido, e nada mais.
Um preço. Um modelo sem preço de tabela não pode vencer uma discussão de custo, porque não há nada com que comparar. Se o Beam ficar abaixo do nível do GLM 5.3, a história de eficiência se transforma em uma história de orçamento muito rapidamente. Se ficar acima dos US$ 0,15 e US$ 0,60 do DeepSeek V4.1 Flash sem uma vantagem em capacidade, terá dificuldades para o trabalho em volume para o qual foi criado.
Os pesos. Até que existam, "open-weight" é uma afirmação sobre uma licença que não foi concedida, e ninguém pode conferir a aritmética de FLOPs por pontuação contra um modelo que consiga de fato executar. Essa é a verificação que a Reflection solicitou e ainda não viabilizou.
Até que pelo menos um desses se concretize, a escolha prática não chega nem perto. Opus 5.5 é o modelo sobre o qual você consegue raciocinar, calcular custos e lançar. Beam é o modelo que você observa.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
