
Boreal vs Qwen3.8 Max: A linha que cada fornecedor espera que você pule
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Todo lançamento de modelo publica uma ficha de números, e toda ficha tem uma linha sobre a qual o fornecedor preferia que você não se demorasse. Para o Qwen3.8 Max, lançado em 3 de agosto de 2026, as linhas lisonjeiras são fáceis de encontrar: ele conquistou o primeiro lugar no ranking de front-end do CodeArena com 1.691 pontos, atingiu um Agentic Index de 58 na Artificial Analysis, empatando com o Claude Opus 5 em high effort — o mais perto que um laboratório chinês chegou do topo dessa tabela — e alcançou uma pontuação GDPval-AA de 1.739 Elo, à frente do GPT-5.6 Sol. A linha logo abaixo delas é mais difícil de ler. Na mesma bateria de testes do avaliador, a alucinação medida subiu de 23% na geração anterior para 40%, e a pontuação do modelo em recuperação de contexto longo caiu dois pontos. Boreal, o modelo de vídeo publicitário da Creatify, lançado em 15 de setembro de 2026 a um centavo por segundo, tem uma linha do mesmo tipo em sua própria ficha — e ela é mais específica, porque o fornecedor a publicou.
Nenhuma das linhas é eliminatória. Ambas são mais informativas do que as pontuações de destaque, e é por isso que vale a pena colocá-las lado a lado, em vez de comparar os banners.
Aquilo em que o Qwen3.8 Max é realmente melhor
As vitórias são reais e não são pequenas.
Qwen3.8 Max é um modelo de mistura de especialistas com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por token, e é o primeiro Qwen da classe Max que a Alibaba afirmou que será lançado com pesos abertos — anunciado para a semana de 10 de agosto de 2026, sem licença nem data definitiva, um detalhe que vale a pena notar, porque o anúncio não é o lançamento. Ele tem uma janela de contexto de 1 milhão de tokens, com um teto de saída de 131.072 tokens, e aceita texto, imagens e vídeo como entrada. Esse último ponto merece ênfase nesta comparação específica: dos quatro modelos de texto de ponta que esta série coloca frente a frente com o Boreal, o Qwen3.8 Max é um de apenas dois aos quais se pode entregar um clipe de vídeo finalizado e fazer uma pergunta sobre ele.
A precificação é agressiva de uma maneira que remodelou o segmento. A US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com leituras de cache a US$ 0,25, ela fica cerca de 20% abaixo da geração anterior, ao mesmo tempo que dobra o comprimento máximo de saída. No nosso painel, isso fica em US$ 2,00 e US$ 6,00, um contexto de 1M tokens, um tempo p50 até o primeiro token de 10,00 segundos — o teto que nossa instrumentação reporta, então leia isso como "lento", e não como preciso — e 183,0 milhões de tokens de tráfego nos últimos sete dias.
E a linha de baixo
Aqui está a parte que não entra na manchete do post de lançamento.
A avaliação independente da Artificial Analysis registrou duas regressões entre Qwen3.7-Max e Qwen3.8 Max. Sua medida de recuperação em contexto longo caiu dois pontos. Sua medida de onisciência caiu dez, e a taxa de alucinação medida pelo avaliador subiu de 23% para 40%. Ao mesmo tempo, o custo por tarefa do modelo no índice de inteligência subiu de US$ 0,53 para US$ 1,14 — ele levou cerca de 64 turnos por tarefa, enquanto seu antecessor levou 14.
Leia tudo isso em conjunto e um quadro coerente surge. O Qwen3.8 Max é um modelo que ficou melhor naquilo que benchmarks com uma única resposta correta conseguem medir — código, conclusão de tarefas agênticas, resolução estruturada de problemas — e ficou pior naquilo que é mais difícil de pontuar: saber quando não sabe. Um modelo que delibera mais e alucina mais não está se contradizendo. Cadeias de raciocínio mais longas criam mais oportunidades de assumir uma resposta errada com confiança, e um benchmark que recompensa a conclusão da tarefa não penaliza isso até que a tarefa tenha um invariante oculto a violar.
Para um comprador, a consequência prática é restrita e específica. Se a sua utilização do modelo for geração de código ou um fluxo de trabalho agêntico em que uma resposta errada falha ruidosamente — um teste falha, uma compilação quebra — as regressões são em grande parte invisíveis e os ganhos são o que conta. Se a sua utilização for recuperação, sumarização, ou qualquer coisa em que uma resposta fluente mas errada chega a um humano sem verificação, o movimento de 23 para 40 é o número que deve decidir a sua avaliação, não a colocação no CodeArena.
A pior polêmica da própria Boreal, publicada pelo fornecedor
O contraste que torna este pareamento útil é que a Creatify fez algo que a maioria dos fornecedores não faz: colocou seu resultado mais fraco na mesma publicação que o seu mais forte.
O Boreal foi testado às cegas contra seu próprio modelo base intocado, com prompt, resolução, número de quadros e seed mantidos fixos, em 40 casos de produção. A Creatify relata uma preferência de 81% pelo Boreal — 25 a 6 com 9 empates, teste de sinais p<0,001 — e em seguida detalha essa média. Anúncios de produtos: 83%. Cenas de criador e UGC: 85%. Clipes de uma pessoa falando: 60%.
Esse último número é a linha. Cabeças falantes estão entre os formatos mais comuns na publicidade de resposta direta, e é o formato em que a vantagem do modelo sobre sua própria base é mais tênue — pouco melhor do que um cara ou coroa contra um modelo que ninguém iria lançar. A renderização é cotada a 1:1 com o tempo real na classe 720p, e a retenção de detalhes finos melhorou 11,3% em p=0,004, então o panorama agregado é genuinamente positivo. O detalhamento simplesmente diz para qual metade da categoria este modelo foi ajustado, e não é a metade com uma pessoa falando para a câmera.
Observe também que tipo de evidência cada uma dessas linhas constitui. A regressão do Qwen3.8 Max foi encontrada por um avaliador independente executando seu próprio harness. A linha fraca da Boreal foi divulgada pelo fornecedor, em um teste que o fornecedor projetou e executou. A segunda é mais confiável como declaração de fato e menos informativa como comparação, porque não há nenhum número independente em lugar algum do arquivo da Boreal.

O contraste da especificação
• Saída — Boreal: vídeo renderizado, classe 720p, texto para vídeo e imagem para vídeo. Qwen3.8 Max: somente texto, até 131.072 tokens.
• Entrada — Boreal: um prompt de texto ou uma imagem estática. Qwen3.8 Max: texto, imagens e vídeo.
• Preço — Boreal: $0,01 por segundo de vídeo finalizado. Qwen3.8 Max: $2,00 por 1M de entrada / $6,00 por 1M de saída, leituras de cache a $0,25.
• Contexto — Boreal: não publicado. Qwen3.8 Max: 1M tokens de entrada, 131K de saída.
• Latência — Boreal: cotada em 1:1 com tempo real. Qwen3.8 Max: p50 do tempo até o primeiro token de 10,00 segundos no nosso painel.
• Pesos — Boreal: proprietários, detidos e servidos pela Creatify. Qwen3.8 Max: proprietário no lançamento; a Alibaba anunciou um lançamento de pesos abertos para o primeiro Qwen da classe Max, sem licença ou data confirmadas.
• Evidência — Boreal: teste cego de 40 casos executado pelo fornecedor, sem avaliação independente. Qwen3.8 Max: cobertura de benchmark independente, incluindo duas regressões medidas, ao lado de linhas do fornecedor de 86,1 no OSWorld-Verified e 86,6 no Terminal-Bench 2.1.
Quanto vale uma regressão para alguém que está comprando
Regressões em rankings costumam ser tratadas como trivialidades. Elas estão mais próximas da informação mais relevante para a decisão que um benchmark publica, porque são as únicas linhas que lhe dizem do que um fornecedor abriu mão.
O movimento útil não é ler nenhum dos dois cards, mas sim executar os dois modelos no seu próprio tráfego — e o obstáculo prático é que, normalmente, isso significa dois contratos, dois SDKs e duas relações de cobrança, o que gera atrito suficiente para que a maioria das equipes pule o teste e, em vez disso, compre pela pontuação de manchete.
Essa fricção é a parte que uma camada de roteamento elimina. O Qwen3.8 Max está no nosso catálogo ao lado da geração anterior, então compará-los no seu próprio conjunto de avaliação é uma mudança de uma linha na string do modelo, em vez de um ciclo de aquisição, e a mesma chave alcança o resto do catálogo quando a comparação indica que você quer um modelo diferente para um estágio diferente do pipeline. Ele fica em tarifa de tabela do provedor com 0% de markup, o que importa aqui por um motivo específico: o Qwen3.8 Max chegou cerca de 20% mais barato do que a geração que substituiu, e um reajuste de preços do fornecedor desse tipo é o tipo de coisa que deveria aparecer na sua fatura quando acontece, e não na próxima renovação.
A Boreal não está no nosso catálogo. O OrcaRouter não disponibiliza modelos de geração de vídeo, e nada aqui deve ser interpretado como uma alegação em contrário. O que disponibilizamos é a camada acima disso — o texto, as variantes, a verificação de conformidade, a análise do que teve bom desempenho — e dois dos modelos desta série, entre eles o Qwen3.8 Max, podem receber o clipe finalizado para revisão.

Como ler qualquer um dos cartões
O Qwen3.8 Max é a compra mais vantajosa se o seu trabalho for código, agentes ou raciocínio estruturado, a um preço inferior ao do seu próprio antecessor, e as duas regressões independentes são a razão para o testar no seu tráfego de recuperação e sumarização antes de encaminhar a produção para lá. A taxa de 40% de alucinações não é razão para evitar o modelo; é razão para saber quais das suas cargas de trabalho conseguem tolerá-la.
A Boreal é a única das duas que produz o artefacto sobre o qual esta comparação incide nominalmente, e é a opção credível mais barata nas tarifas publicadas para vídeo publicitário de formato curto. A sua limitação é específica do formato e declarada pelo próprio fornecedor: 60% de preferência em clipes de uma só pessoa a falar. Teste esse formato antes dos anúncios de produto, porque é aí que há menos margem de melhoria.
Duas coisas mudariam isso. Se a Alibaba enviar os pesos abertos que anunciou para o Qwen3.8 Max, tanto o preço quanto a durabilidade do modelo mudam, e a licença sob a qual ele chega importará mais do que a data. E para a Boreal, a primeira avaliação independente — de qualquer tipo, por qualquer pessoa — substituiria um teste de fornecedor de 40 casos que atualmente carrega toda a carga de evidência para um modelo vendido em um formato onde as marcas são excepcionalmente sensíveis a como seu produto se parece.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
