Um cartão de título gerado com o texto "Boreal vs Qwen3.8 Max" e o subtítulo "A linha que cada fornecedor espera que você ignore", ícones lineares simples de um quadro de reprodução de vídeo, um cartão de pontuação com uma linha destacada e uma lupa, com o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Boreal vs Qwen3.8 Max: A linha que cada fornecedor espera que você pule

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Todo lançamento de modelo publica uma ficha de números, e toda ficha tem uma linha sobre a qual o fornecedor preferia que você não se demorasse. Para o Qwen3.8 Max, lançado em 3 de agosto de 2026, as linhas lisonjeiras são fáceis de encontrar: ele conquistou o primeiro lugar no ranking de front-end do CodeArena com 1.691 pontos, atingiu um Agentic Index de 58 na Artificial Analysis, empatando com o Claude Opus 5 em high effort — o mais perto que um laboratório chinês chegou do topo dessa tabela — e alcançou uma pontuação GDPval-AA de 1.739 Elo, à frente do GPT-5.6 Sol. A linha logo abaixo delas é mais difícil de ler. Na mesma bateria de testes do avaliador, a alucinação medida subiu de 23% na geração anterior para 40%, e a pontuação do modelo em recuperação de contexto longo caiu dois pontos. Boreal, o modelo de vídeo publicitário da Creatify, lançado em 15 de setembro de 2026 a um centavo por segundo, tem uma linha do mesmo tipo em sua própria ficha — e ela é mais específica, porque o fornecedor a publicou.

Nenhuma das linhas é eliminatória. Ambas são mais informativas do que as pontuações de destaque, e é por isso que vale a pena colocá-las lado a lado, em vez de comparar os banners.

Aquilo em que o Qwen3.8 Max é realmente melhor

As vitórias são reais e não são pequenas.

Qwen3.8 Max é um modelo de mistura de especialistas com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por token, e é o primeiro Qwen da classe Max que a Alibaba afirmou que será lançado com pesos abertos — anunciado para a semana de 10 de agosto de 2026, sem licença nem data definitiva, um detalhe que vale a pena notar, porque o anúncio não é o lançamento. Ele tem uma janela de contexto de 1 milhão de tokens, com um teto de saída de 131.072 tokens, e aceita texto, imagens e vídeo como entrada. Esse último ponto merece ênfase nesta comparação específica: dos quatro modelos de texto de ponta que esta série coloca frente a frente com o Boreal, o Qwen3.8 Max é um de apenas dois aos quais se pode entregar um clipe de vídeo finalizado e fazer uma pergunta sobre ele.

A precificação é agressiva de uma maneira que remodelou o segmento. A US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com leituras de cache a US$ 0,25, ela fica cerca de 20% abaixo da geração anterior, ao mesmo tempo que dobra o comprimento máximo de saída. No nosso painel, isso fica em US$ 2,00 e US$ 6,00, um contexto de 1M tokens, um tempo p50 até o primeiro token de 10,00 segundos — o teto que nossa instrumentação reporta, então leia isso como "lento", e não como preciso — e 183,0 milhões de tokens de tráfego nos últimos sete dias.

E a linha de baixo

Aqui está a parte que não entra na manchete do post de lançamento.

A avaliação independente da Artificial Analysis registrou duas regressões entre Qwen3.7-Max e Qwen3.8 Max. Sua medida de recuperação em contexto longo caiu dois pontos. Sua medida de onisciência caiu dez, e a taxa de alucinação medida pelo avaliador subiu de 23% para 40%. Ao mesmo tempo, o custo por tarefa do modelo no índice de inteligência subiu de US$ 0,53 para US$ 1,14 — ele levou cerca de 64 turnos por tarefa, enquanto seu antecessor levou 14.

Leia tudo isso em conjunto e um quadro coerente surge. O Qwen3.8 Max é um modelo que ficou melhor naquilo que benchmarks com uma única resposta correta conseguem medir — código, conclusão de tarefas agênticas, resolução estruturada de problemas — e ficou pior naquilo que é mais difícil de pontuar: saber quando não sabe. Um modelo que delibera mais e alucina mais não está se contradizendo. Cadeias de raciocínio mais longas criam mais oportunidades de assumir uma resposta errada com confiança, e um benchmark que recompensa a conclusão da tarefa não penaliza isso até que a tarefa tenha um invariante oculto a violar.

Para um comprador, a consequência prática é restrita e específica. Se a sua utilização do modelo for geração de código ou um fluxo de trabalho agêntico em que uma resposta errada falha ruidosamente — um teste falha, uma compilação quebra — as regressões são em grande parte invisíveis e os ganhos são o que conta. Se a sua utilização for recuperação, sumarização, ou qualquer coisa em que uma resposta fluente mas errada chega a um humano sem verificação, o movimento de 23 para 40 é o número que deve decidir a sua avaliação, não a colocação no CodeArena.

A pior polêmica da própria Boreal, publicada pelo fornecedor

O contraste que torna este pareamento útil é que a Creatify fez algo que a maioria dos fornecedores não faz: colocou seu resultado mais fraco na mesma publicação que o seu mais forte.

O Boreal foi testado às cegas contra seu próprio modelo base intocado, com prompt, resolução, número de quadros e seed mantidos fixos, em 40 casos de produção. A Creatify relata uma preferência de 81% pelo Boreal — 25 a 6 com 9 empates, teste de sinais p<0,001 — e em seguida detalha essa média. Anúncios de produtos: 83%. Cenas de criador e UGC: 85%. Clipes de uma pessoa falando: 60%.

Esse último número é a linha. Cabeças falantes estão entre os formatos mais comuns na publicidade de resposta direta, e é o formato em que a vantagem do modelo sobre sua própria base é mais tênue — pouco melhor do que um cara ou coroa contra um modelo que ninguém iria lançar. A renderização é cotada a 1:1 com o tempo real na classe 720p, e a retenção de detalhes finos melhorou 11,3% em p=0,004, então o panorama agregado é genuinamente positivo. O detalhamento simplesmente diz para qual metade da categoria este modelo foi ajustado, e não é a metade com uma pessoa falando para a câmera.

Observe também que tipo de evidência cada uma dessas linhas constitui. A regressão do Qwen3.8 Max foi encontrada por um avaliador independente executando seu próprio harness. A linha fraca da Boreal foi divulgada pelo fornecedor, em um teste que o fornecedor projetou e executou. A segunda é mais confiável como declaração de fato e menos informativa como comparação, porque não há nenhum número independente em lugar algum do arquivo da Boreal.

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

O contraste da especificação

• Saída — Boreal: vídeo renderizado, classe 720p, texto para vídeo e imagem para vídeo. Qwen3.8 Max: somente texto, até 131.072 tokens.

• Entrada — Boreal: um prompt de texto ou uma imagem estática. Qwen3.8 Max: texto, imagens e vídeo.

• Preço — Boreal: $0,01 por segundo de vídeo finalizado. Qwen3.8 Max: $2,00 por 1M de entrada / $6,00 por 1M de saída, leituras de cache a $0,25.

• Contexto — Boreal: não publicado. Qwen3.8 Max: 1M tokens de entrada, 131K de saída.

• Latência — Boreal: cotada em 1:1 com tempo real. Qwen3.8 Max: p50 do tempo até o primeiro token de 10,00 segundos no nosso painel.

• Pesos — Boreal: proprietários, detidos e servidos pela Creatify. Qwen3.8 Max: proprietário no lançamento; a Alibaba anunciou um lançamento de pesos abertos para o primeiro Qwen da classe Max, sem licença ou data confirmadas.

• Evidência — Boreal: teste cego de 40 casos executado pelo fornecedor, sem avaliação independente. Qwen3.8 Max: cobertura de benchmark independente, incluindo duas regressões medidas, ao lado de linhas do fornecedor de 86,1 no OSWorld-Verified e 86,6 no Terminal-Bench 2.1.

Quanto vale uma regressão para alguém que está comprando

Regressões em rankings costumam ser tratadas como trivialidades. Elas estão mais próximas da informação mais relevante para a decisão que um benchmark publica, porque são as únicas linhas que lhe dizem do que um fornecedor abriu mão.

O movimento útil não é ler nenhum dos dois cards, mas sim executar os dois modelos no seu próprio tráfego — e o obstáculo prático é que, normalmente, isso significa dois contratos, dois SDKs e duas relações de cobrança, o que gera atrito suficiente para que a maioria das equipes pule o teste e, em vez disso, compre pela pontuação de manchete.

Essa fricção é a parte que uma camada de roteamento elimina. O Qwen3.8 Max está no nosso catálogo ao lado da geração anterior, então compará-los no seu próprio conjunto de avaliação é uma mudança de uma linha na string do modelo, em vez de um ciclo de aquisição, e a mesma chave alcança o resto do catálogo quando a comparação indica que você quer um modelo diferente para um estágio diferente do pipeline. Ele fica em tarifa de tabela do provedor com 0% de markup, o que importa aqui por um motivo específico: o Qwen3.8 Max chegou cerca de 20% mais barato do que a geração que substituiu, e um reajuste de preços do fornecedor desse tipo é o tipo de coisa que deveria aparecer na sua fatura quando acontece, e não na próxima renovação.

A Boreal não está no nosso catálogo. O OrcaRouter não disponibiliza modelos de geração de vídeo, e nada aqui deve ser interpretado como uma alegação em contrário. O que disponibilizamos é a camada acima disso — o texto, as variantes, a verificação de conformidade, a análise do que teve bom desempenho — e dois dos modelos desta série, entre eles o Qwen3.8 Max, podem receber o clipe finalizado para revisão.

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

Como ler qualquer um dos cartões

O Qwen3.8 Max é a compra mais vantajosa se o seu trabalho for código, agentes ou raciocínio estruturado, a um preço inferior ao do seu próprio antecessor, e as duas regressões independentes são a razão para o testar no seu tráfego de recuperação e sumarização antes de encaminhar a produção para lá. A taxa de 40% de alucinações não é razão para evitar o modelo; é razão para saber quais das suas cargas de trabalho conseguem tolerá-la.

A Boreal é a única das duas que produz o artefacto sobre o qual esta comparação incide nominalmente, e é a opção credível mais barata nas tarifas publicadas para vídeo publicitário de formato curto. A sua limitação é específica do formato e declarada pelo próprio fornecedor: 60% de preferência em clipes de uma só pessoa a falar. Teste esse formato antes dos anúncios de produto, porque é aí que há menos margem de melhoria.

Duas coisas mudariam isso. Se a Alibaba enviar os pesos abertos que anunciou para o Qwen3.8 Max, tanto o preço quanto a durabilidade do modelo mudam, e a licença sob a qual ele chega importará mais do que a data. E para a Boreal, a primeira avaliação independente — de qualquer tipo, por qualquer pessoa — substituiria um teste de fornecedor de 40 casos que atualmente carrega toda a carga de evidência para um modelo vendido em um formato onde as marcas são excepcionalmente sensíveis a como seu produto se parece.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente