Um card hero gerado para o artigo 'Reflection Beam vs Gemini 3.1 Pro Preview: Um lê vídeo, um lê texto', intitulado 'Reflection Beam vs Gemini 3.1 Pro Preview', com o subtítulo 'Um lê vídeo, um lê texto' e três chips com os textos 'Somente texto vs cinco modalidades', '256K vs 1M de contexto' e 'Sem preço vs uma tarifa escalonada'.
Guides & Insights

Reflection Beam vs Gemini 3.1 Pro Preview: Um Lê Vídeo, Outro Lê Texto

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Comece pela assimetria que nenhuma tabela de benchmarks nesta comparação menciona. Reflection Beam, anunciado em 5 de outubro de 2026, é um modelo esparso de mistura de especialistas com 501 bilhões de parâmetros, com 23 bilhões de parâmetros ativos por token, e recebe texto e devolve texto. Nada mais. Gemini 3.1 Pro Preview, o modelo multimodal de fronteira do fornecedor desde 19 de fevereiro de 2026, aceita texto, imagens, vídeo, áudio e arquivos, e é o único modelo desta comparação em que a pergunta "ele consegue ver aquilo sobre o que quero perguntar" tem uma resposta diferente para cada lado. Todo o resto — as proporções de esparsidade, as janelas de contexto, os níveis de preço — é um argumento. Essa é uma especificação.

Isso também significa que este é o par menos simétrico do conjunto, e o mais útil, porque expõe para que serve, na prática, uma comparação de modelos. Se sua carga de trabalho for texto, Beam e Gemini 3.1 Pro são duas opções em um espectro que vai do barato e não medido ao caro e minuciosamente pontuado. Se sua carga de trabalho tiver um frame de vídeo, não há comparação a fazer.

O que cada modelo é

O Gemini 3.1 Pro Preview é o carro-chefe de nível preview do Google: 1.048.576 tokens de contexto, uma saída máxima de 65.536 tokens, modalidades de entrada e uma janela de 1 milhão de tokens alcançada por uma escada de preços em vez de uma tarifa fixa. O Google o posiciona para engenharia de software aprimorada, confiabilidade agêntica melhorada e uso mais eficiente de tokens em fluxos de trabalho complexos. Ele não é de pesos abertos. Seu nome ainda carrega "Preview", um status que o Google mantém para este modelo desde fevereiro.

Reflection Beam é o primeiro modelo da Reflection e o início de uma série de pesos abertos. Quinhentos e um bilhões de parâmetros totais, 23 bilhões ativos — cerca de 4,6 por cento do modelo ativo por token. Vinte e três vírgula oito trilhões de tokens de pré-treinamento em 6.144 chips GB300 em menos de quatro semanas, depois uma campanha de aprendizado por reforço em 10.500 chips GB300 durante quatro semanas com mais de 100 milhões de rollouts em aproximadamente um milhão de ambientes. Sua API é compatível com OpenAI em api.reflection.ai/openai/v1 com Chat Completions e uma lista de Models, seu contexto é de 256.000 tokens com uma nota de rodapé beta, seu parâmetro reasoning_effort tem cinco níveis e não tem opção de desligar, e seus pesos estão prometidos para ainda este mês sob a licença Apache 2.0.

• Modalidade — Gemini 3.1 Pro Preview aceita texto, imagem, vídeo, áudio e arquivo; Reflection Beam aceita apenas texto.

• Contexto e saída — 1.048.576 tokens de entrada e 65.536 de saída para o Gemini, contra 256.000 de entrada e 128.000 de saída para o Beam.

• Preço — Gemini 3.1 Pro Preview a US$ 2,00 de entrada e US$ 12,00 de saída por milhão de tokens até 200.000 tokens, subindo para US$ 4,00 e US$ 18,00 acima disso, com leituras de cache a US$ 0,20; Reflection Beam não tem preço publicado.

• Superfície de ferramentas — chamadas nativas de ferramentas, saídas estruturadas e fundamentação de pesquisa do lado do Google; chamadas de ferramentas e saídas estruturadas do lado do Beam, com um endpoint limitado a Chat Completions.

• Pesos — proprietários para o Gemini; Apache 2.0 prometido para o Beam, ainda não lançado.

• Pontuação independente — Gemini 3.1 Pro Preview tem um índice da Artificial Analysis; Beam não tem linha no quadro.

A lacuna de modalidade é todo o argumento

Vale a pena ser concreto, em vez de fazer alusões vagas ao "multimodal", porque as consequências práticas são específicas.

Uma carga de trabalho que ingere uma gravação de tela, uma foto de produto, um contrato digitalizado ou um arquivo de áudio de central de atendimento não pode ser atendida pelo Beam a preço algum, com prompt algum, em plano algum. Não há solução alternativa na camada de API: a documentação do Beam descreve uma única modalidade de entrada e uma única modalidade de saída, e nenhum caminho para imagem ou áudio é listado. O Gemini 3.1 Pro Preview lida com todas as cinco, o que significa que é o único modelo aqui que pode ser encaixado em um fluxo de trabalho em que a entrada ainda não é texto.

O caso inverso também merece ser dito, porque é o que as pessoas costumam errar. Se a sua entrada é texto e continuará sendo texto, as cinco modalidades do Gemini não lhe trazem nada, e você está pagando o preço de um modelo multimodal para executar uma carga de trabalho de texto. Isso não é um argumento a favor do Beam — é um argumento de que a questão da modalidade deve ser respondida antes da questão do benchmark, porque ela elimina opções de forma mais barata e confiável do que qualquer comparação de pontuação.

Duas pré-visualizações, dois significados diferentes

Ambos os nomes dos modelos trazem uma ressalva, e as ressalvas não se assemelham, o que é a coisa mais interessante neste emparelhamento.

O “Preview” do Gemini 3.1 Pro é uma convenção de nomenclatura de um modelo que é geralmente chamável desde fevereiro, com uma pontuação independente, uma tabela de preços publicada — incluindo um nível de contexto longo documentado — e uma superfície completa de ferramentas. Na prática, “preview” aqui significa que o Google reserva o direito de substituí-lo, não que seja difícil de obter ou não tenha pontuação.

A beta da Beam é uma barreira genuína. O acesso é por lista de espera, o ID do modelo foi criado em 5 de outubro de 2026, não há tabela de preços, nem pontuação de terceiros, e os artefactos que permitiriam a qualquer pessoa verificar a alegação central — pesos, relatório técnico, cartão de modelo — são prometidos, não entregues. O número de contexto traz uma nota de rodapé a avisar que pode mudar durante a beta, o que é uma salvaguarda que nenhum modelo de disponibilidade geral precisa.

A consequência é assimétrica de um modo que importa para compras. Uma equipe que adota o Gemini 3.1 Pro Preview está aceitando o risco de rotatividade de modelos. Uma equipe que adota o Beam hoje está aceitando um preço desconhecido, uma pontuação independente desconhecida e nenhuma capacidade de executar o modelo por conta própria. Essas são categorias diferentes de risco, e o preço é o que mais frequentemente decide.

A generated two-column scoreboard titled 'Reflection Beam vs Gemini 3.1 Pro Preview — the scoreboard'. Left column 'Reflection Beam': Input modalities text only; Context 256,000 tokens (beta); Max output 128,000 tokens; Price not published; Availability waitlisted beta; Independent score none yet. Right column 'Gemini 3.1 Pro Preview': Input modalities text, image, video, audio, file; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 / $12.00 to 200K, then $4.00 / $18.00; Availability preview, callable since February 2026; Independent score AA index 29.7. Footer reads 'Beam figures vendor-reported and unaudited. Gemini price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

Benchmarks, e o problema de citação

As tabelas de lançamento do Reflection não incluem o Gemini 3.1 Pro Preview nem qualquer modelo do Google. Seu conjunto de comparação é apenas aberto e semiaberto: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max e DeepSeek V4.1 Flash. Assim, os dois modelos nunca foram executados um contra o outro em uma tabela publicada, e os números abaixo vêm de estruturas de avaliação diferentes de ambos os lados.

• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview registra 29,7, classificado em 58º de 147 em sua execução. Beam não tem nenhuma linha no índice.

• GPQA Diamond — Gemini 3.1 Pro Preview com 94,1 segundo a Artificial Analysis, contra os 90,5 relatados pelo fornecedor da Beam.

• SciCode — 58,7 para o Gemini, contra os 49,7 relatados pelo fornecedor do Beam.

• Humanity's Last Exam — 47,0 para o Gemini contra os 36,2 da Beam relatados pelo fornecedor, este último explicitamente sem ferramentas.

• Terminal-Bench v2.1 — 73,8 para o Gemini segundo a Artificial Analysis, contra 80,1 relatado pelo fornecedor da Beam. Esta é a linha mais forte da Beam no confronto, e é uma colheita contra um modelo que está no mercado desde fevereiro.

• Recall de contexto longo — 82,0 para o Gemini, contra 79,3 relatados pelo fornecedor do Beam no AA-LCR.

• tau-squared Bench — 95,6 para o Gemini contra os 78,7 do Beam no MCP Atlas e 38,0 no tau3 banking. Avaliações relacionadas ao uso agêntico de ferramentas, não a mesma avaliação, e a diferença de nomenclatura importa.

Há um problema de honestidade separado no lado Gemini desta tabela que merece uma frase própria. Pontuações de índice independentes para o Gemini 3.1 Pro Preview foram citadas como 30, 46, 47,7 e 57 em diferentes fontes, e a Artificial Analysis disponibiliza diferentes revisões do índice em diferentes páginas de modelos no mesmo momento. O valor de 29,7 acima é o que consta na página que lemos em 6 de outubro de 2026, e é o único que citaremos — mas qualquer artigo que coloque um único número de índice do Gemini ao lado de um concorrente sem dizer de qual snapshot ele veio está apresentando um número flutuante como se fosse fixo. A mesma cautela se aplica, inversamente, ao Beam, onde não há snapshot algum.

Preço, e o nível para o qual ninguém se prepara

O Gemini 3.1 Pro Preview custa $2,00 de entrada e $12,00 de saída por milhão de tokens até 200.000 tokens, e $4,00 e $18,00 acima disso. As leituras de cache custam $0,20 por milhão, e as gravações de cache, $0,375. O limite entre os níveis é a parte em torno da qual vale a pena planejar: o principal argumento de venda do modelo é uma janela de 1.048.576 tokens, e no momento em que uma requisição ultrapassa 200.000 tokens, a tarifa de entrada dobra e a de saída aumenta em 50%. Uma carga de trabalho projetada em torno da janela de um milhão de tokens é, portanto, uma carga de trabalho cobrada no segundo nível na maior parte de seu tráfego, e não no primeiro.

A Beam não tem tabela de preços, portanto não há nível para modelar nem nada para comparar. Essa ausência não é neutra: significa que a afirmação defensável mais económica sobre o custo da Beam é que ele é desconhecido, e o único suporte quantitativo para o seu posicionamento de eficiência é o próprio gráfico da Reflection, que estima os FLOPs gerados como o dobro da contagem de parâmetros ativos multiplicado pela média de tokens gerados por tentativa em DeepSWE, HLE e Terminal-Bench 2.1 — com uma legenda que admite que o pré-preenchimento do prompt, a atenção e a sobrecarga de serviço estão excluídos. Nas cargas de trabalho em que um contexto de um milhão de tokens importa, o pré-preenchimento não é um erro de arredondamento, e é precisamente o termo que a fórmula deixa de fora.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), captured 6 October 2026, showing the model name and id, the INPUT $2.00 and OUTPUT $12.00 pricing tiles, p50 TTFT 10.00 s, p95 TTFT 10.00 s, 13.9M tokens of 7-day traffic, the provenance lines 'Public benchmarks by Google - 2026-02-19' and 'AI Analysis', the summary describing a frontier reasoning model with improved agentic reliability, and a code sample using base_url https://api.orcarouter.ai/v1.

Uso de ferramentas, pesquisa e onde os dois designs diferem

Os pontos fortes anunciados do Gemini 3.1 Pro Preview são engenharia de software, confiabilidade agêntica e eficiência de tokens, e sua superfície de ferramentas publicada inclui chamada de funções, saídas estruturadas e fundamentação de pesquisa. Esse último item é o que se deve observar para quem compara stacks agênticas: a pesquisa fundamentada é uma capacidade própria do Google e muda o que um agente que usa ferramentas pode fazer sem um serviço externo de recuperação integrado.

A história das ferramentas do Beam é mais interessante do que uma linha de especificação sugere e mais difícil de avaliar. O Reflection relata MCP Atlas em 78,7, AutomationBench público em 37,0, tau3 banking em 38,0, BrowseComp com gerenciamento de contexto em 77,4 e DeepSearchQA com gerenciamento de contexto em 80,1 — e observa que, durante o aprendizado por reforço, o modelo aprendeu organicamente a consultar outros modelos de linguagem e a chamar APIs de OCR quando recebeu acesso à web, apesar de tarefas de navegação estarem ausentes da mistura de treinamento. Se essa generalização se mantiver, é um sinal real sobre transferência agêntica. Também é, neste momento, uma observação de fornecedor a partir de uma execução de treinamento, sem verificação independente.

Nas linhas de uso de ferramentas em que ambos os lados têm números, o quadro é misto, e não unilateral. A tabela de fornecedores do Beam coloca-o à frente do GLM 5.2 no MCP Atlas e em pé de igualdade com o GLM 5.2 e o Kimi K3 no tau3 banking, enquanto o valor de 95,6 do Gemini no tau-squared Bench é o número agêntico mais alto publicado por qualquer um dos lados. Suites diferentes, harnesses diferentes e nenhuma avaliação compartilhada — que é o problema recorrente nesta comparação.

Escolher, e como fazer hedge

A regra de decisão que decorre do que foi dito acima é simples o bastante para ser enunciada em uma linha: se qualquer entrada não for texto, Beam não é uma opção e a comparação acabou. Se todas as entradas forem texto, a questão passa a ser se a afirmação de eficiência não atribuída do Beam vale um preço desconhecido e nenhuma pontuação independente, em contraste com um modelo que custa $2.00 e $12.00, com uma escada documentada e uma superfície de ferramentas completa.

O Gemini 3.1 Pro Preview está no nosso catálogo, com a tarifa de tabela do provedor repassada e nada acrescentado, por trás de uma única chave compatível com OpenAI em api.orcarouter.ai/v1, ao lado de mais de 200 outros modelos — e a mesma chave atende os modelos com os quais a Beam compete em preço, do GLM 5.3 a $1,26 e $3,96 ao DeepSeek V4.1 Flash a $0,15 e $0,60, lidos ao vivo nesta manhã. Como o limite de camada em 200.000 tokens é um problema de roteamento e não um problema de modelo, a DSL de roteamento permite expressá-lo diretamente: mantenha as solicitações curtas na camada barata e fixe as genuinamente longas onde a janela é o motivo pelo qual você escolheu o modelo, em uma única chamada em vez de no código da aplicação.

O Reflection Beam não é uma das nossas rotas, e não vamos indicar você a ninguém que afirme tê-lo. Se os pesos do Apache 2.0 chegarem este mês conforme prometido, a auto-hospedagem se torna uma terceira opção para trabalho somente com texto, e a alegação de eficiência se torna testável no seu próprio hardware.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

O que mudaria a resposta

O argumento de Beam contra Gemini baseia-se nos mesmos dois itens em que todas as comparações de Beam se baseiam, e este confronto acrescenta um terceiro.

Um preço. Sem ele, o argumento de eficiência não pode ser convertido em uma decisão orçamentária, e o modelo está competindo com base em um diagrama, e não em uma tabela de preços.

Uma pontuação independente. A Artificial Analysis disse em 5 de outubro que a Reflection lhe tinha dado acesso e que estava avaliando o Beam, descrevendo indicadores iniciais como sugestivos de que o Beam será um dos modelos abertos mais eficientes em tokens que já viu para o seu nível de inteligência. Essa é a fonte certa a dizer a coisa certa, e ainda não há uma linha do Beam no quadro — as páginas do modelo retornam 404 e a tabela de classificação não contém nenhuma entrada do Beam até esta manhã.

E o que não muda: o Beam é apenas texto. Nenhum lançamento de pesos, nenhum corte de preço e nenhuma pontuação de índice altera isso, o que significa que, para toda uma classe de cargas de trabalho, esta comparação nunca chegará a ser uma comparação. Se o seu pipeline tiver um vídeo, a resposta já era Gemini 3.1 Pro Preview antes de o primeiro benchmark carregar.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente