Um cartão hero gerado intitulado "Reflection Beam vs Kimi K3", com a sublinha "O mesmo nome de benchmark, dois harnesses diferentes." e três chips de estatísticas com os dizeres "Terminal-Bench 2.1: 80,1 vs 88,3", "execução independente: 85,0" e "preço: não publicado vs $3 / $15". Três ícones de linha plana ficam abaixo: uma prancheta com uma marca de verificação, uma régua medindo uma barra e uma lupa sobre um gráfico de barras. O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Reflection Beam vs Kimi K3: O Mesmo Nome de Benchmark, Duas Estruturas Diferentes

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Reflection Beam marca 80,1 no Terminal-Bench 2.1. O Kimi K3 marca 88,3. Coloque esses dois números lado a lado, como fez a maior parte da cobertura desta semana, e você conclui que o Beam está cerca de oito pontos atrás do melhor modelo aberto da área. Mas esses dois números não vêm do mesmo lugar. O 80,1 do Beam é informado pelo fornecedor, retirado da tabela do próprio post de lançamento da Reflection. O 88,3 do Kimi K3 também é informado pelo fornecedor, desta vez pela própria tabela da Moonshot — e a tabela de um fornecedor só mostra a pontuação do concorrente quando ela foi obtida no harness do próprio fornecedor, sob o próprio conjunto de prompts do fornecedor, na própria configuração de esforço do fornecedor. Uma terceira parte, a Artificial Analysis, desde então executou o Kimi K3 em um benchmark com o mesmo nome e publicou 85,0. Isso é uma diferença de 4,9 pontos, não de 8,2 — e a direção da correção é totalmente previsível, porque o número que está sendo corroído é sempre o que veio do laboratório com algo a provar.

Esse é todo o problema da comparação que o título deste artigo promete, e é a razão pela qual este texto dedica sua primeira metade à proveniência em vez das pontuações. Reflection Beam é um modelo esparso de mistura de especialistas com 501 bilhões de parâmetros, com 23 bilhões de parâmetros ativos por token, anunciado em 5 de outubro de 2026 pela Reflection AI, com um endpoint beta compatível com OpenAI no ar no mesmo dia. Kimi K3 é o principal modelo aberto da Moonshot AI, listado em nosso próprio catálogo com data de lançamento de 15 de julho de 2026 e pontuado de forma independente pela Artificial Analysis. Um deles é um produto já disponível, com tabela de preços e execução de harness de terceiros; o outro é um beta em lista de espera cujos pesos, relatório técnico e preço ainda não existem. Compará-los não é um exercício simétrico, e fingir o contrário produziria uma página que parece precisa e está errada.

A versão de 30 segundos

• Beam é mais rápido por FLOP no papel, sem preço na prática e não reproduzido. O Kimi K3 é avaliado por terceiros, com preço de US$ 3,00 para entrada e US$ 15,00 para saída por milhão de tokens, e está disponível em geral.

• No único benchmark em que ambos foram executados — o Terminal-Bench 2.1 —, a diferença honesta é de cerca de cinco pontos, não oito, quando os números de cada lado vêm de um harness neutro.

• As verdadeiras vantagens do Beam são estruturais, não numéricas: um perfil de serviço com 23B de parâmetros ativos e uma licença Apache 2.0 prometida. Nenhuma das duas é utilizável hoje.

• Se você precisa de um modelo esta semana, isso não é um jogo de cara ou coroa. É um modelo disponível para envio e uma lista de espera.

O que a Reflection de fato publicou, e contra quem

O post de lançamento do Reflection traz um quadro comparativo com sete outros modelos: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max e DeepSeek V4.1 Flash. Todos os números da tabela são informados pelos fornecedores, nenhum deles foi reproduzido de forma independente, e não existe página do Artificial Analysis para o Reflection Beam — a página do modelo retorna erro 404 no site deles em 6 de outubro de 2026. Várias células do original estão marcadas como NR porque o modelo não foi executado.

Aqui está todo o recorte Beam-versus-K3 dessa tabela, uma linha por dimensão:

• Terminal-Bench 2.1 — Beam 80,1 vs Kimi K3 88,3

• SWE-Bench Pro v2-Hard — Beam 77,2 vs. Kimi K3 88,2

• DeepSWE v1.1 — Beam 44,4 vs. Kimi K3 68,0

• SWE Atlas Codebase QnA — Beam 34,6 vs Kimi K3 68,0

• HLE, sem ferramentas — Beam 36.2 vs Kimi K3 46.9

• GPQA Diamond — Beam 90.5 vs Kimi K3 93.5

• SciCode — Beam 49,7 vs Kimi K3 58,7

• MCP Atlas — Beam 78,7 vs Kimi K3 82,3

• BrowseComp com gerenciamento de contexto — Beam 77,4 vs Kimi K3 91,2

• DeepSearchQA com gerenciamento de contexto — Beam 80.1 vs Kimi K3 95.0

Leia essa lista com honestidade e a forma do lançamento aparece. A Reflection não está reivindicando uma vitória sobre o K3 em lugar algum. Ela está reivindicando chegar perto do topo de um nível enquanto gasta de três a quatro vezes menos cômputo de inferência do que o GLM 5.2 em pontuações de raciocínio comparáveis — e a única linha em que os dois modelos estão próximos, o Terminal-Bench 2.1, é a linha em que a comparação é menos confiável.

Por que a estrutura de avaliação importa mais que a pontuação

Um nome de benchmark é um rótulo, não uma especificação. Terminal-Bench 2.1 significa um conjunto específico de tarefas executadas sob uma estrutura de agente específica, com uma política de retentativas específica, um orçamento de tokens específico e uma configuração de esforço de raciocínio específica. Dois laboratórios podem ambos relatar honestamente um valor de "Terminal-Bench 2.1" e produzir números que não são comparáveis, porque é na estrutura do agente e na configuração do esforço que reside a maior parte da variância. A Artificial Analysis existe como organização precisamente por causa disto: executa uma única infraestrutura de avaliação, numa única configuração, em muitos modelos, para que os seus números possam ser subtraídos uns dos outros.

Então, o 80,1 que a Reflection imprime para o Beam é um número de fornecedor num harness de fornecedor, e o 88,3 que ela imprime para o K3 é também um número de fornecedor — sendo o fornecedor a Reflection, medindo seu próprio concorrente. Esse segundo número é o menos confiável da linha: um laboratório que executa os pesos de um rival em seu próprio scaffold não tem incentivo para executá-los na melhor configuração do rival, e nenhuma obrigação de divulgar a que escolheu. Não há nada de desonesto nisso; é simplesmente um número cuja proveniência não sustenta o peso que a cobertura lhe atribuiu.

A própria execução da Artificial Analysis coloca o Kimi K3 em 85,02 no Terminal-Bench 2.1 e também em 12,6 no Terminal-Bench v4.0 — um teste diferente e mais difícil —, com um AA Coding Index de 76,2 (9.º lugar entre os modelos da tabela), um Intelligence Index de 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 e um Long-Context Recall de 88,7. Esses valores são lidos da ficha de catálogo do K3 no nosso próprio sistema, com fonte em artificialanalysis.ai, e o instantâneo de avaliação tem data de 15 de julho de 2026. A Beam tem um número no universo dessa lista, e ele vem da Reflection. Essa ausência deve ser temporária, e não permanente: a Artificial Analysis disse que a Reflection lhe deu acesso e que está a avaliar o modelo em benchmark, e a sua própria formulação inicial — de que a Beam "será um dos modelos abertos mais eficientes em tokens que já vimos para o seu nível de inteligência" — é uma casa de benchmarks a sinalizar uma expectativa, não a relatar um resultado. Até que essa pontuação seja publicada, os números deste artigo não são subtraíveis, e não vamos fingir o contrário.

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

Quanto custa cada um, e o que cada um é

A comparação de custos não é nem de perto equilibrada e, na verdade, não é uma comparação de modo algum, porque um dos lados está em branco.

• Preço — Kimi K3 US$ 3,00 de entrada / US$ 15,00 de saída por milhão de tokens, com leituras de cache a US$ 0,30, vs. Reflection Beam: nenhum preço publicado em lugar algum no blog, na documentação ou na listagem de modelos da Reflection, com o console da plataforma atrás de uma barreira de cadastro.

• Contexto — 1.048.576 tokens no Kimi K3 vs 256.000 no beta do Beam, com uma nota de rodapé na própria documentação do Beam que diz "a janela de contexto pode mudar durante o beta".

• Modalidade — Kimi K3 aceita texto e imagens; Reflection Beam é entrada de texto e saída de texto, sem caminho para imagem ou áudio no lançamento.

• Disponibilidade — O Kimi K3 está disponível em geral hoje; o Reflection Beam é uma beta com lista de espera, com pesos prometidos para o final de outubro sob a Apache 2.0.

• Pontuações independentes — o K3 tem uma linha completa no Artificial Analysis; o Beam não tem nenhuma.

• Perfil de serving — O Kimi K3 é um modelo de fronteira grande e quase denso, a 46,8 tokens de saída por segundo na nossa própria medição no playground ao longo da última semana; os 23B de parâmetros ativos do Beam são um argumento arquitetural genuíno a favor de menor latência e menor custo por token, mas não há nenhum endpoint aberto ao público para fazer essa medição.

A alegação de eficiência merece mais uma frase de cautela, porque é a manchete do lançamento e está fazendo mais trabalho do que consegue suportar. O "3 a 4× menos computação de inferência" do Reflection vem de um gráfico que aproxima FLOPs como duas vezes a contagem de parâmetros ativos multiplicada pelo número médio de tokens gerados. Essa fórmula exclui deliberadamente o prefill do prompt, o custo de atenção e a sobrecarga de serving — as partes da conta que dominam o trabalho agêntico de contexto longo. É uma estimativa de guardanapo de um índice de computação, não uma medição, não um valor em dólares, e foi construída pelo fornecedor. Trate-a como uma hipótese que os pesos permitirão que outra pessoa teste.

Onde o OrcaRouter se encaixa nisto

O Kimi K3 é uma das nossas rotas. Ele está listado a $3,00 de entrada e $15,00 de saída por milhão de tokens, com leituras de cache a $0,30, que é a tarifa do provedor Moonshot repassada sem acréscimo algum — então, se a Moonshot alterar sua tabela de preços, o valor na nossa página muda no mesmo dia, em vez de quando um revendedor atualizar. Ele pode ser chamado a partir de uma chave compatível com OpenAI, junto com mais de 200 outros modelos, o que importa aqui por um motivo específico: a resposta honesta para "Beam ou K3?" é que uma equipe que está hedgeando não deveria escolher. Porque o failover automático faz parte do roteamento, em vez de ser algo que você constrói, um modelo como o Beam — beta, sem preço, sem avaliação de terceiros — é exatamente a coisa que você coloca em uma fração do tráfego, em vez de no seu caminho crítico. Você roteia o trabalho para o K3 por padrão, envia uma fatia para o Beam quando seu convite da lista de espera chegar, e deixa o roteamento voltar para o K3 em caso de erro. Essa é uma decisão que você pode tomar sobre um modelo não comprovado. Apostar um caminho de produção em um não é.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

O que mudaria este veredito?

Três coisas, em ordem decrescente do quanto importam.

Um preço. O Beam ficar abaixo do patamar K3 tornaria o argumento de eficiência concreto em vez de teórico. Segundo, os pesos. Apache 2.0 mais um relatório técnico permitiria a qualquer pessoa com alguns nós medir tokens por segundo por GPU em um patamar de qualidade fixo — o teste que de fato resolve uma alegação de computação. Terceiro, uma execução do harness por terceiros. A Reflection concedeu à Artificial Analysis acesso, e espera-se uma pontuação disso; até que esse número seja publicado, todos os números de Beam-versus-K3 em circulação remontam a um documento escrito por um dos dois fornecedores.

Duas perguntas que vale a pena responder diretamente

O Reflection Beam é melhor que o Kimi K3?

Com as evidências disponíveis hoje, não — e ninguém publicou evidências de que seja. A própria tabela da Reflection mostra o K3 à frente em todas as dez linhas compartilhadas acima, várias delas por margens (SWE Atlas 34.6 vs 68.0, DeepSearchQA 80.1 vs 95.0) que não são nada próximas. A tese da Beam é o custo por unidade de capacidade, e essa tese é um gráfico desenhado pelo fornecedor enquanto não existirem os pesos e um preço.

Devo esperar pelos pesos do Beam antes de construir sobre o K3?

Somente se a auto-hospedagem for um requisito, e não uma preferência, porque esse é o único eixo em que os dois não são substitutos — o K3 é somente API, enquanto o Beam promete pesos Apache 2.0. Se você estiver chamando uma API, o K3 está disponível, avaliado e precificado, e o Beam é uma lista de espera. Não existe nenhuma versão dessa decisão que justifique atrasar um projeto.

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

A Reflection nos deu uma data e um gráfico, e uma data não é um modelo. A única coisa que o lançamento realmente estabelece é que um modelo de 501B que ativa 23B parâmetros pode ser treinado para ficar a poucos pontos da fronteira aberta — o que, se os pesos chegarem e os números se mantiverem, é um resultado significativo sobre eficiência. Ainda não é motivo para transferir trabalho de um modelo que um terceiro realmente mediu.