
Union Alpha vs DeepSeek V4.1 Flash: Uma semana grátis contra pesos abertos
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha está gratuito hoje. O DeepSeek V4.1 Flash custa US$ 0,15 por milhão de tokens de entrada — e ainda estará lá em dezembro. Essa assimetria é a comparação inteira: um desses dois modelos é uma prévia anônima com uma janela declarada de uma semana e sem pesos publicados, e o outro é um checkpoint de mistura de especialistas licenciado sob MIT que você pode baixar, auditar e auto-hospedar. Se você está escolhendo um modelo para construir em cima, e não para brincar, a opção gratuita não é a aposta mais segura.
O que Union Alpha realmente é
Union Alpha surgiu em catálogos de modelos de terceiros em 16 de setembro de 2026 e agora é disponibilizado no nível gratuito do OrcaRouter. Seu operador é anônimo — no campo do provedor lê-se literalmente "Stealth" — e nenhum laboratório reivindicou sua autoria. Isso não é uma crítica ao modelo; é o fato mais importante a seu respeito, porque tudo o mais que se pode dizer decorre disso.
O que é verificável é o formato do endpoint, porque você pode chamá-lo e ler os metadados:
• Janela de contexto — 262.144 tokens (256K), com uma saída máxima de 131.072 tokens.
• Entradas e saídas — aceita texto e imagens, emite apenas texto. Sem entrada de vídeo, sem áudio.
• Superfície da API — tools, tool_choice, response_format, temperature, top_p e max_tokens. A saída JSON estruturada funciona; a aplicação estrita de esquema JSON não. Na prática, tool_choice só aceita "auto".
• Controles de raciocínio — nenhum exposto. Não há dial de esforço, nem orçamento de pensamento, nem canal de raciocínio visível.
• Proveniência — sem pesos, sem licença, sem contagem de parâmetros, sem nota de arquitetura, sem data de corte de conhecimento declarada. O tokenizer está arquivado como "Outro".
• Preço — $0 por milhão de tokens de entrada e saída durante a pré-visualização, com limite de taxa, com HTTP 429 assim que você atingir o limite do seu plano.
A única alegação de desempenho associada a ele, "desempenho de nível de fronteira em uma ampla gama de tarefas de propósito geral", vem do operador e nunca foi reproduzida de forma independente. Não há entrada em ranking, nem tabela de benchmark do fornecedor, e nem cartão de modelo por trás disso.
O que o DeepSeek V4.1 Flash realmente é
DeepSeek V4.1 Flash foi lançado em 10 de setembro de 2026, seis dias antes de Union Alpha surgir, e é um objeto do tipo oposto. É um modelo esparso de mistura de especialistas construído sobre uma nova arquitetura Causal Encoder-Decoder, com um backbone de 552B parâmetros (16B ativos na saída, 8B na entrada) mais 196B parâmetros de memória condicional Engram — cerca de 763B no total — treinado em 45T tokens e lançado sob a licença MIT.
Dois detalhes de engenharia importam mais do que a contagem de parâmetros. A Compressed Sparse Attention 2 combinada com o cache KV FP4 reduz o cache para cerca de 890 bytes por token, aproximadamente um quarto do que o DeepSeek V4 Flash usava, e é isso que torna um contexto de 1M de tokens economicamente viável. E a DeepSeek está integrando sua própria linha de produtos nisso: solicitações dos modelos legados V4 Flash e V4 Pro estão sendo encaminhadas para o V4.1 Flash com o preço do Flash.
• Janela de contexto — 1.000.000 tokens, contra os 262.144 da Union Alpha.
• Saída máxima — 384.000 tokens por resposta, em comparação com 131.072.
• Entradas — texto e imagem (visão nativa); saída somente texto.
• Preço — $0,15/M de entrada, $0,60/M de saída, $0,003/M de entrada em cache fora de pico; dobrado para $0,30/$1,20/$0,006 durante os horários de pico (seg–sex, 01:00–04:00 e 06:00–10:00 UTC). Os fins de semana estão sempre fora de pico.
• Pesos — MIT, disponíveis para download, auto-hospedáveis.
• Velocidade observada — 215 tokens de saída por segundo, com um tempo até o primeiro token p50 de 842 ms, um p95 de 2,40 s e uma taxa de erro de 1,2%.
O panorama dos benchmarks é desequilibrado, e não da forma que você imaginaria.
A DeepSeek publica. A Union Alpha não. É isso, e mais nada.
O V4.1 Flash vem com uma tabela completa, embora seja em grande parte relatórios do próprio DeepSeek mais entradas de agregadores, em vez de uma única auditoria independente: GPQA Diamond 90,9, HLE 63,9 com ferramentas e 36,8 sem, Terminal-Bench 2.1 em 90,6, DeepSWE v1.1 em 74,2, CyberGym 88,1, MathArena Apex 65,6, e um Artificial Analysis Intelligence Index de 40. Observe as lacunas dentro dessa tabela — o Terminal-Bench 4.0 apresenta 31,2, drasticamente abaixo da pontuação 2.1, o que é um lembrete de que os números de destaque dos fornecedores se agrupam em torno da suíte que favorece o modelo.
Para a Union Alpha, existe exatamente uma medição independente. O SMF Clearinghouse o submeteu a 157 testes da suíte Official A com o raciocínio desativado e obteve 136/157 — 86,6%, zero erros, ficando em décimo lugar entre vinte e seis entradas. Raciocínio 30/30, ferramentas 2/2, programação 26/30, matemática 24/30, e uma suíte de redação notavelmente fraca com 2/5. Esse é um dado real e é o único.
Então, o resumo honesto é: o V4.1 Flash tem muitos números, a maioria deles com viés de fornecedor, mas pelo menos visíveis e com data. O Union Alpha tem um número, e é um número decente.

Preço é o único eixo em que a Union Alpha vence — e vence com folga
Grátis vence US$ 0,15/US$ 0,60. Não há enquadramento engenhoso que mude isso. Para uma semana de trabalho de avaliação, experimentos em lote ou um loop de agente descartável que você quer executar cem vezes, o Union Alpha não custa nada e o V4.1 Flash custa dinheiro de verdade em escala.
Mas “grátis” está carregando um peso incomum aqui. A prévia tem limite de taxa, então a vazão é limitada pelo seu plano, e não pelo modelo. Há um único endpoint por trás dela, o que significa que não há fallback de provedor se esse endpoint apresentar instabilidade. E fechar a janela gratuita é uma decisão do fornecedor — nenhum preço pós-prévia foi anunciado.
É também aqui que o roteamento muda a aritmética. A OrcaRouter repassa o preço de tabela do provedor com 0% de markup, então, quando a DeepSeek altera suas tarifas fora de pico, a mudança entra em vigor do nosso lado no mesmo dia, em vez de esperar por um ciclo de reprecificação. Os dois modelos ficam atrás da mesma chave, o que significa que você pode executar a comparação acima como uma mudança de configuração em vez de duas integrações — e obter o Union Alpha por US$ 0 no plano gratuito e o V4.1 Flash no caminho pago sem um segundo contrato.
Qual deles você deveria realmente ligar?
A questão decisiva não é a capacidade. É se você precisa que a resposta sobreviva no próximo mês.

Use o DeepSeek V4.1 Flash se o trabalho for para produção. O contexto de 1M de tokens, o teto de saída de 384K, os pesos MIT, a tabela de benchmarks datada e o fato de a DeepSeek estar consolidando nele o seu próprio tráfego legado apontam todos na mesma direção: este é um modelo com futuro e com um rastro documental. A US$ 0,003 por milhão de tokens de entrada em cache, uma carga de trabalho de contexto longo com uso intenso de cache é praticamente gratuita de qualquer forma.
Chame o Union Alpha se você estiver explorando, fazendo benchmark contra, ou simplesmente curioso sobre um modelo que pode ser um nível rápido de algo muito maior. Sua entrada de visão e janela de 256K são genuinamente úteis para trabalho com documentos e capturas de tela, e o resultado do Official A sugere que ele é competente, e não constrangedor. Só mantenha-o fora de qualquer caminho em que um 429 repentino ou um desligamento não anunciado lhe custe algo.
E se você quiser fazer os dois sem refazer a fiação, esse é o caso para uma camada de roteamento em vez de uma integração direta.
O que mudaria este veredito?
Três coisas, por ordem de probabilidade.
Um laboratório nomeado reivindica Union Alpha. O precedente diz que isso é plausível: a entrada anônima anterior nesta série, Ox Alpha, foi revelada seis dias depois de aparecer como GLM-5.3-Flash da Zhipu. A revelação traz uma licença, um número de parâmetros e, quase certamente, um preço.
Uma tabela de classificação independente atribui-lhe uma pontuação. Neste momento, um único conjunto de 157 testes constitui todo o registo público. Uma entrada na Artificial Analysis com uma metodologia datada faria a Union Alpha passar de anedota a dado.
A janela gratuita fecha-se em silêncio. Este é o desfecho padrão das pré-visualizações furtivas — o Ox Alpha foi retirado do catálogo após o fim da sua pré-visualização. Se o Union Alpha desaparecer sem um preço após a pré-visualização, "grátis" terá custado exatamente uma semana de trabalho de integração, e é por isso que emparelhá-lo com failover automático é a forma prudente de usá-lo hoje.

O caminho pago está a apenas uma chave de distância: página do modelo DeepSeek V4.1 Flash lista as tarifas de US$ 0,15/US$ 0,60 fora do horário de pico, sem qualquer margem adicionada por token, e a duplicação no horário de pico está discriminada na mesma página.
