
Union Alpha vs Qwen3.8 Flash: Um Único Ponto Conta Toda a História
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha e Qwen3.8 Flash estão a um ponto de distância no único teste que mediu ambos. No conjunto SMF Clearinghouse Official A — 157 testes, raciocínio desativado —, o Union Alpha marcou 136 e uma execução local do Qwen3.8-Flash-Next marcou 137. Esse é o resultado frente a frente mais próximo que qualquer um dos modelos tem, e também é o número mais enganoso desta comparação, porque as duas entradas não foram executadas sob as mesmas condições e apenas uma delas é um modelo que você pode realmente alugar agora mesmo.
O que a diferença de um ponto lhe diz e não lhe diz
Comece pelo que ele estabelece. Union Alpha não é um blefe no sentido trivial — uma ampla suíte de 157 testes com zero erros, raciocínio perfeito (30/30) e uso perfeito de ferramentas (2/2) não é algo que um endpoint oco produza. Seu resultado em programação de 26/30 e em matemática de 24/30 o colocam em território crível, e sua pontuação em escrita de 2/5 o coloca muito longe de trabalho de prosa de uso geral.
Agora, as ressalvas, que são estruturais.
A entrada do Qwen3.8 Flash foi uma execução local do Qwen3.8-Flash-Next — o checkpoint de pesos abertos —, e não a API Qwen3.8 Flash hospedada. Servir localmente significa usar a sua própria quantização, a sua própria stack de inferência e o seu próprio parser de chamadas de ferramentas. Nada disso tem garantia de corresponder ao que o endpoint hospedado retorna, e as pessoas que executaram o teste sinalizaram a comparação como não definitiva exatamente por esse motivo.
Uma suíte não é um perfil. O Official A é amplo, mas raso por categoria: ferramentas tem 2 testes. Uma categoria de ferramentas com dois testes que pontua 2/2 é um bom sinal, não evidência de confiabilidade agêntica, e o Union Alpha é explicitamente posicionado como um modelo agêntico e de codificação. O instrumento está medindo algo adjacente à alegação.
E o próprio ponto isolado está dentro do ruído de uma suíte de 157 testes. Trate 136 e 137 como "estes estão na mesma faixa", não como um ranking.
Lado a lado
• Janela de contexto — Union Alpha 262.144 tokens vs. Qwen3.8 Flash 1.000.000 tokens servidos (262.144 nativos, estendidos via YaRN).
• Saída máxima — Union Alpha 131.072 tokens vs. Qwen3.8 Flash 131.000 tokens. Praticamente no mesmo nível.
• Entradas — texto e imagem no Union Alpha vs texto, imagem e vídeo no Qwen3.8 Flash.
• Preços — $0 durante a prévia do Union Alpha vs. Qwen3.8 Flash a $0,150/M de entrada, $0,470/M de saída, $0,018/M de leitura em cache, $0,230/M de gravação em cache.
• Controles de raciocínio — nenhum no Union Alpha vs um modo de pensamento no Qwen3.8 Flash que é ativado por padrão e pode ser desativado.
• Tempo até o primeiro token — Union Alpha 10,00 s p50 vs Qwen3.8 Flash 6,62 s p50, ambos medidos em nosso endpoint na mesma janela de sete dias. A velocidade bruta de decodificação é mais próxima do que a reputação sugere: 170 tokens por segundo contra 103.
• Proveniência — operador anônimo, sem pesos, em contraste com Alibaba/Qwen, com os pesos do Qwen3.8-Flash-Next de código aberto no Hugging Face e no ModelScope.

Qwen3.8 Flash: uma aposta na eficiência com 6B ativos
O Qwen3.8 Flash foi lançado em 26 de agosto de 2026 como a versão de produção gerenciada do checkpoint de pesos abertos Qwen3.8-Flash-Next, que a Alibaba lançou simultaneamente. É um modelo de mistura de especialistas de 125B parâmetros que ativa cerca de 6B parâmetros por token, além de 51B parâmetros de embedding N-gram, construído sobre atenção híbrida que combina Gated DeltaNet com um indexador de atenção esparsa.
O enquadramento do fornecedor gira em torno da economia de treinamento: a Alibaba relata que o custo de execução é cerca de um nono do Qwen3.7-Plus, com alegações de prefill até 7,6× mais rápido e decode até 4,9× mais rápido em cargas de trabalho de 1 milhão de tokens com alta taxa de acertos de cache. Esses são números do fornecedor e não foram reproduzidos de forma independente.
Sua tabela de benchmarks também é reportada pelo fornecedor e não reproduzida: SWE-bench Pro 62,5, DeepSWE v1.1 58,7, SWE-bench Multilingual 81,0, NL2Repo 48,1, CoWorkBench 73,9, JobBench 55,7, RealWorldQA 88,5, LVBench 76,6, AndroidWorld 84,5. O número que vale a pena citar de volta ao marketing é o Humanity's Last Exam, com 35,9, que fica abaixo dos 40,0 do Claude Opus 4.6 na mesma comparação.
Na nossa própria página do modelo, a seção de benchmarks públicos ainda exibe "pending" — nenhum terceiro o avaliou ainda. O que temos são nossos próprios dados de tráfego: um tempo mediano de 6,62 segundos até o primeiro token, uma taxa de saída de 103 tokens por segundo e uma taxa de erro de 4,5%. Essa taxa de erro é alta o suficiente para valer a pena acompanhar, e é o tipo de número que só aparece quando você mede um endpoint em produção, e não um post de lançamento.

Union Alpha: o modelo sem dono
Union Alpha apareceu em catálogos de terceiros em 16 de setembro de 2026 e é disponibilizado no nível gratuito do OrcaRouter. Não tem laboratório nomeado, nem pesos, nem licença, nem contagem de parâmetros, e nenhuma nota de arquitetura. Seu campo de provedor diz "Stealth".
Seu endpoint, pelo menos, é legível: contexto de 262.144 tokens, saída máxima de 131.072 tokens, entrada de texto e imagem com saída somente de texto, chamada de ferramentas, saída JSON, temperature, top_p e max_tokens, e nenhum controle de raciocínio. A escolha de ferramentas, na prática, só aceita "auto". A janela gratuita dele foi descrita como de cerca de uma semana, com limitação de taxa, e nenhum preço pós-preview anunciado.
A alegação declarada — "desempenho de nível de fronteira em uma ampla gama de tarefas de propósito geral" — é relatada pelo operador e não auditada. O resultado 136/157 do Official A é a única medição independente existente.

A velocidade é onde eles deixam de se parecer.
Os números de throughput em destaque não os distinguem da forma que você esperaria, e vale a pena entender o motivo.
Na nossa própria telemetria de roteamento dos últimos sete dias, o Qwen3.8 Flash transmite a 103 tokens de saída por segundo, com um tempo até o primeiro token p50 de 6,62 segundos e uma taxa de erro de 4,5%. O Union Alpha, medido da mesma forma, transmite a 170 tokens por segundo. Em velocidade bruta de decodificação, o modelo anônimo é o mais rápido dos dois.
O que ele não faz é começar. O p50 e o p95 do tempo até o primeiro token do Union Alpha estão ambos fixados em 10,00 segundos, o que significa que pelo menos metade de todas as requisições espera dez segundos ou mais antes de o primeiro token aparecer, e sua taxa de erro na mesma janela é de 7,7% — cerca de 1,7 vezes a do Qwen. A execução Official A de 157 testes em que as seções anteriores se baseiam levou 4,6 horas de tempo real, com uma latência mediana de 91,9 segundos e uma média de 104,8 segundos por teste, e quatro testes atingiram o tempo limite de 300 segundos do harness. Testadores independentes que o executaram no dia do lançamento relataram uma vazão muito menor do que a que nosso endpoint mostra, o que se esperaria de um serviço ainda absorvendo uma enorme carga do primeiro dia.
Portanto, a diferença prática não está na velocidade de decodificação. Está no tempo até o primeiro token e na confiabilidade. O Union Alpha não é utilizável para nada interativo — sem autocomplete, sem assistência inline, sem loop de agente ágil — porque dez segundos de silêncio são indistinguíveis de um travamento. Ele é adequado para trabalho assíncrono: tarefas em lote durante a noite, processamentos longos de documentos, execuções de avaliação offline em que nada está esperando pelo primeiro token e uma taxa de falha de 7,7% é absorvida por uma nova tentativa.
O Qwen3.8 Flash a 103 tokens por segundo, com um tempo mediano até o primeiro token de 6,62 segundos, também não é rápido. A leitura honesta é que ambos são lentos, e apenas um deles falha aproximadamente uma requisição em cada treze.
O argumento da eficiência, e quem pode fazê-lo
A Alibaba apresenta um argumento de custo de treinamento: um nono do custo de treinar o Qwen3.7-Plus, seis bilhões de parâmetros ativos por token, portanto barato de servir. Essa é uma afirmação sobre um modelo cujos pesos existem e cuja linhagem é documentada.
A história de eficiência da Union Alpha é implícita, e não declarada — um modelo anônimo de 256K que é gratuito para chamar. Gratuito não é o mesmo que barato. Alguém está pagando por essas GPUs, a prévia tem um término declarado, e a própria admissão do operador de que estava ajustando para velocidade sugere que a economia de serviço ainda não está estabelecida. Um modelo que é gratuito por uma semana e impossível de precificar depois tem um argumento de eficiência que expira com a janela.
Experimentar o desconhecido sem apostar nele
A razão pela qual vale a pena ter este confronto específico em mente é que ele é o teste mais barato possível de um modelo não comprovado. O Qwen3.8 Flash é a grandeza conhecida: fornecedor identificado, pesos abertos, benchmarks publicados (ainda que com viés do fornecedor), um preço real por token de $0,150/$0,470. O Union Alpha é o desconhecido, com preço zero, cuja reivindicação competitiva assenta inteiramente num único resultado de 157 testes.
Em vez de escolher, coloque o desconhecido por trás de uma regra de failover. O OrcaRouter repassa o preço de tabela do provedor com 0% de markup e oferece suporte a failover automático entre provedores, de modo que um endpoint Union Alpha com limite de taxa ou que desapareceu recorre a um modelo que ainda está respondendo, em vez de aparecer como um job com falha às 3 da manhã. Ambos os modelos usam a mesma chave, então o experimento custa uma mudança de configuração em vez de uma segunda integração — e nenhum deles precisa ser uma decisão que você defende, porque você pode inverter o roteamento quando a janela gratuita fechar.
Veredito
Qwen3.8 Flash é o modelo sobre o qual construir. Seis bilhões de parâmetros ativos, pesos irmãos de código aberto, uma janela de 1M de tokens, entrada de vídeo, um desempenho real de 103 tokens por segundo e um preço publicado que você pode prever. Seus benchmarks são relatados pelo fornecedor e vale a pena monitorar sua taxa de erro, mas ele pertence a alguém, e esse alguém está entregando.
Union Alpha é o modelo a medir. A diferença de um ponto em Official A é genuinamente interessante — sugere que, seja lá o que isto for, não é um brinquedo — e, por $0, com um limite de saída de 131K e entrada de visão, vale uma semana da sua atenção. Mas uma diferença de um ponto em um único conjunto de testes, produzida por um operador anônimo com uma taxa de erro de 7,7%, é um motivo para investigar, e não um motivo para trocar.
O que se deve observar é a mesma coisa que sempre resolveu essa questão: um nome. Ox Alpha, a entrada anterior desta série, teve seu nome revelado seis dias depois de aparecer como o GLM-5.3-Flash da Zhipu. Se Union Alpha conseguir um, a comparação deixa de ser sobre um ponto e passa a ser sobre um preço.
O valor conhecido tem preço e documentação: página do modelo Qwen3.8 Flash mostra as tarifas de $0.150/$0.470, o contexto servido de 1M de tokens e o teto de saída de 131K, com benchmarks públicos ainda pendentes.
