Cartela de título gerada intitulada "Union Alpha vs Gemini 3.8 Flash" com o subtítulo "Um tem uma pontuação, o outro tem uma alegação", acima de três cartões arredondados que dizem "Gemini 3.8 Flash: tabela de avaliação com data, preço publicado", "Union Alpha: nenhum benchmark do seu operador" e "Saída máxima: 131.072 vs 65.536 tokens". O rodapé informa que os números da Union Alpha não são auditados, com os números do Gemini segundo o Google e a Artificial Analysis.
Guides & Insights

Union Alpha vs Gemini 3.8 Flash: Um tem uma pontuação, o outro tem uma alegação

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Union Alpha e Gemini 3.8 Flash são o mesmo discurso de venda apresentado em dois níveis de prova completamente diferentes. O operador da Union Alpha descreve-o como tendo "desempenho de nível frontier numa ampla gama de tarefas de uso geral" e não publicou qualquer benchmark, contagem de parâmetros, licença ou nome. O Gemini 3.8 Flash foi lançado com uma tabela de avaliação datada, um Artificial Analysis Intelligence Index, valores de custo por tarefa de testadores independentes e uma tabela de preços documentada que se estende até 2027. Se está a escolher entre eles com base em algo que não seja o preço, está a escolher entre um número que pode verificar e uma frase que não pode.

Lado a lado, antes da discussão

• Janela de contexto — Union Alpha 262.144 tokens vs. Gemini 3.8 Flash 1.048.576 tokens.

• Saída máxima — 131.072 tokens vs 65.536 tokens. O Union Alpha vence nesta, e é o único eixo estrutural em que vence.

• Entradas — texto e imagem em ambos, mas o Gemini 3.8 Flash também aceita vídeo, áudio e arquivos.

• Preços — Union Alpha US$ 0 durante sua prévia vs Gemini 3.8 Flash US$ 0,75/M de entrada, US$ 3,75/M de saída, US$ 0,075/M de entrada em cache, dobrando para US$ 1,50/US$ 7,50 em 1º de janeiro de 2027.

• Controles de raciocínio — nenhum exposto no Union Alpha vs {{1}}níveis de pensamento{{/1}} no Gemini 3.8 Flash que afetam diretamente tanto a qualidade quanto o custo.

• Avaliação publicada — nenhuma do operador da Union Alpha vs. uma tabela completa datada sobre o Gemini 3.8 Flash.

• Proveniência — operador anônimo, sem pesos vs. lançamento datado e linhagem documentada do Gemini 3.8 Flash.

Generated two-column comparison scoreboard for Union Alpha and Gemini 3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published evals from its operator, 10.00 s p50 time to first token. Gemini 3.8 Flash column: context window 1,048,576 tokens, max output 65,536 tokens, text, image, video and audio input, $0.75 input and $3.75 output per 1M tokens, a full dated evaluator table, 3.46 s p50 time to first token. Footer reads latency per OrcaRouter over the last 7 days with Union Alpha benchmarks unaudited.

O que os números do Gemini 3.8 Flash realmente dizem

Gemini 3.8 Flash foi lançado em 2 de setembro de 2026 — o terceiro lançamento do Flash da Google em cerca de seis semanas, o que mostra o quanto a história deste modelo é feita de cadência, e não de um avanço revolucionário. A tabela de avaliação publicada credita artificialanalysis.ai e deepmind.google em conjunto, então leia-a como uma mistura de números independentes e de fornecedor, e não como uma auditoria de terceiros isenta.

• AA Coding — 76.3, que é uma pontuação de codificação genuinamente forte.

• AA Intelligence — 41.2. Observe que a Artificial Analysis relata separadamente 59 no Intelligence Index com esforço de raciocínio alto, então o número varia muito conforme a configuração de esforço; cite a configuração, ou o número não significa nada.

• GPQA Diamond — 95,3, de longe o maior valor individual desta comparação.

• HLE-Verified — 54,9, com o Humanity's Last Exam padrão em 47,8.

• Terminal-Bench 2.1 — 89,4 na própria tabela do Google, um pouco à frente dos 89,1 do Claude Opus 5.

• Recuperação de contexto longo — 81,3; SciCode 56,6; tau_banking 44,9.

• Vazão observada — 323 tokens de saída por segundo em uma janela recente de sete dias, com uma taxa de erro de 0,63%, um tempo mediano até o primeiro token de 3,46 segundos e 498,5 milhões de tokens de tráfego medido.

As fraquezas são tão documentadas quanto os pontos fortes. No Terminal-Bench 4.0, obtém 19,1 contra os 51,8 do Claude Opus 5. No OSWorld 2.0, alcança 59,0% contra 75,4%. No GDPVal-AA v2, fica atrás com 1545 Elo contra 1824. O Gemini 3.8 Flash é excelente numa faixa específica de trabalho e despenca nas avaliações de agentes gerais mais difíceis — que é exatamente o tipo de forma que uma tabela publicada permite ver.

A reviravolta de preços que pega as pessoas desprevenidas

O Google manteve o preço por token inalterado em relação ao Gemini 3.7 Flash. Ainda assim, a conta aumentou.

O modelo trabalha mais: mais etapas de raciocínio, mais chamadas iterativas de ferramentas. Testes independentes da Artificial Analysis mediram aproximadamente 30% mais tokens de saída por tarefa e cerca de 40% mais custo por tarefa do que o 3.7 Flash. Com raciocínio alto, isso fica em torno de US$ 0,58 por tarefa; o médio fica perto de US$ 0,41 e o baixo perto de US$ 0,24.

Isto é a coisa mais útil da comparação para quem está a fazer um orçamento, e aplica-se muito para além destes dois modelos: preço unitário e custo por tarefa são números diferentes, e apenas um deles aparece numa página de preços. O Google manteve o 3.7 Flash disponível como a opção mais barata, o que é um reconhecimento tácito da mudança.

O que a Union Alpha oferece em vez disso

Union Alpha apareceu em catálogos de terceiros em 16 de setembro de 2026 e funciona no nível gratuito do OrcaRouter. É anônimo — sem laboratório, sem pesos, sem licença, sem data de corte de conhecimento — e gratuito por uma janela declarada de cerca de uma semana, sujeito a limites de taxa, sem preço pós-prévia anunciado.

Seu endpoint é verificável mesmo onde sua proveniência não é: contexto de 262.144 tokens, saída máxima de 131.072 tokens, entrada de texto e imagem com saída apenas de texto, chamada de ferramentas e saída JSON, temperature, top_p, max_tokens, e nenhum controle de raciocínio de qualquer tipo. A escolha de ferramenta, na prática, só oferece suporte a "auto".

Há exatamente uma medição independente. O SMF Clearinghouse executou 157 testes Official A com o raciocínio desativado e obteve 136/157 — 86,6%, zero erros, décimo entre vinte e seis. O raciocínio foi perfeito em 30/30, ferramentas 2/2, programação 26/30, matemática 24/30. A escrita ficou em 2/5.

Isso não é um resultado ruim. Simplesmente não é um resultado comparável. O Official A é uma suíte geral ampla de 157 testes; AA Coding e GPQA Diamond são instrumentos diferentes que medem coisas diferentes em níveis de dificuldade diferentes. Colocar 136/157 ao lado de 95,3 no GPQA Diamond e declarar um vencedor seria exatamente o tipo de manipulação que torna os números dos fornecedores inúteis.

The OrcaRouter model page for Gemini 3.8 Flash, showing a 1M-token context window, a 65K max output, text plus image, video, file and audio input, $0.75 per million input tokens and $3.75 per million output tokens, a p50 time to first token of 3.46 s, and 498.5M tokens of traffic over seven days.The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

A comparação de custos que ninguém consegue realmente concluir

Aqui está o exemplo resolvido, e ele está deliberadamente incompleto.

Pegue uma tarefa que você executa mil vezes por mês. No Gemini 3.8 Flash com raciocínio alto, o valor publicado por tarefa, de cerca de US$ 0,58, resulta em aproximadamente US$ 580 por mês. Esse é um número real e defensável, calculado a partir do consumo de tokens medido.

Na Union Alpha, essas mesmas mil tarefas custam $0 hoje. Quanto custarão daqui a três semanas é desconhecido, porque não existe preço pós-preview. Quanto custam em confiabilidade também é desconhecido, porque o modelo tem limite de taxa, roda em um único endpoint sem provedor de fallback e responde com HTTP 429 assim que você ultrapassa um limite que ninguém publicou.

Então, a resposta honesta é que a Union Alpha vence a única comparação de custos disponível e perde a capacidade de prever isso. Para um teste comparativo pontual, isso é aceitável. Para uma linha orçamentária, não é um número — é uma esperança com uma URL.

Onde cada um pertence

O Gemini 3.8 Flash é indicado sempre que você precisa de um piso medido: trabalho com documentos de contexto longo com entrada de vídeo ou áudio, tarefas de codificação em que a pontuação AA Coding de 76,3 é o instrumento relevante, e qualquer carga de trabalho com um orçamento associado, porque você pode calcular o custo antes de se comprometer e sabe que ele dobra em 1º de janeiro de 2027.

Union Alpha pertence ao slot exploratório — experimentar um modelo de 256K com capacidade de visão cujo teto de saída é o dobro do Gemini, em trabalhos nos quais um endpoint que desaparece não custa nada a você.

O motivo de executá-los por trás de um único endpoint, em vez de duas integrações, é que essa comparação vai mudar de forma repetidas vezes. Uma DSL de roteamento permite compor os dois em uma única chamada — Gemini 3.8 Flash como o caminho medido, Union Alpha como o ramo experimental — em vez de codificar de forma rígida uma decisão que você vai querer revisitar quando a janela gratuita fechar ou quando o preço introdutório do Google expirar. Nenhuma dessas datas está longe, e ambas vão alterar as contas.

O que resolveria isso

Uma entrada datada para o Union Alpha em um ranking que também inclui o Gemini 3.8 Flash. É exatamente essa a peça que falta. Até lá, a posição defensável não é "o Union Alpha é tão bom quanto o Gemini 3.8 Flash" — é "o Union Alpha é gratuito por uma semana e ninguém o mediu contra qualquer coisa que o Google publique". Essas são frases muito diferentes, e apenas uma delas é verdadeira atualmente.

A metade medida do par está documentada aqui: página do modelo Gemini 3.8 Flash traz as tarifas de $0.75/$3.75, o desconto de 90% na entrada em cache e o teto de saída de 65,536 tokens que decide o trabalho de relatórios longos.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente