Um cartão de título gerado com o texto "Ember-1 vs Qwen3.8-Max" e o subtítulo "Um derivado econômico em tokens contra o carro-chefe", acima de dois cartões: Ember-1 — "40% menos tokens, conforme alegado" e "nenhum preço publicado"; Qwen3.8-Max — "2 dólares na entrada, 6 dólares na saída" e "contexto de 1M de tokens".
Guides & Insights

Ember-1 vs Qwen3.8-Max: O Derivado Econômico em Tokens Contra o Carro-Chefe

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Os dois modelos neste confronto têm ambos um número real no mesmo benchmark, e isso ainda não resolve nada. O Ember-1 é o derivado especializado da Fireworks Research do Kimi K3 da Moonshot AI, publicado em 23 de setembro de 2026, reportando 82,0% no Terminal Bench 2.1 com aproximadamente metade dos tokens que seu modelo base gasta. O Qwen3.8-Max é o carro-chefe da Alibaba — um modelo esparso de mistura de especialistas com cerca de 2,4 trilhões de parâmetros e cerca de 95 bilhões ativos por token — disponível em geral desde 3 de agosto de 2026, reportando 86,6% no mesmo benchmark. Ambos esses números são informados pelos fornecedores, ambos os laboratórios executaram sua própria estrutura de avaliação, e uma diferença de 4,6 pontos entre duas configurações de avaliação não publicadas não é um veredito. O que é comparável é o dinheiro, e é aí que este confronto fica interessante: a tese inteira de um modelo é que você não deve pagar por tokens de que não precisa, e o outro é um carro-chefe com preço de US$ 2 por milhão na entrada e US$ 6 por milhão na saída.

O que cada modelo realmente é

Ember-1 não é um novo modelo em nenhum sentido arquitetural. É o Kimi K3 retreinado para raciocinar de forma mais concisa, desenvolvido pela Fireworks Research ao longo de mais de 50 experimentos de treinamento e mais de 200 avaliações em sua própria pilha de treinamento serverless. A alegação do laboratório é que o raciocínio do K3 é mais longo do que as tarefas exigem e que o excesso pode ser removido sem alterar as respostas — o comprimento do raciocínio caiu 35–50% sem perda de precisão em sete benchmarks e dois testes A/B de produção de clientes. Ele está disponível como uma prévia de pesquisa na própria plataforma serverless do fornecedor, sem pesos publicados e sem preço publicado.

Qwen3.8-Max é um tipo de objeto completamente diferente. É o nível de fronteira da Aliba​ba, nativamente multimodal para entrada de texto, imagem e vídeo, com uma janela de contexto de um milhão de tokens, e atualizado duas vezes desde o lançamento: uma atualização pós-treinada em 2 de setembro de 2026 voltada para programação e trabalho profissional de escritório, e um nível de serviço mais rápido anunciado em 22 de setembro de 2026. A Aliba​ba o posiciona contra o GPT-5.5, o Claude Opus 4.7 e o Gemini 3.1 Pro, e sua ficha de avaliação publicada reflete essa ambição — GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 e Humanity's Last Exam com 43,6, todos reportados pelo fornecedor.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

As tabelas de tarifas, lado a lado

Um deles tem um preço e o outro não, o que constitui a primeira assimetria prática.

• Entrada — Ember-1: nenhum publicado; a planilha de benchmark calcula dólares a partir da tabela de preços do Kimi K3. Qwen3.8-Max: $2,00 por milhão de tokens no OrcaRouter.

• Saída — Ember-1: nenhum publicado. Qwen3.8-Max: US$ 6,00 por milhão de tokens.

• Entrada em cache — Ember-1: não se aplica. Qwen3.8-Max: US$ 0,25 por milhão de tokens para leituras de cache, o que é um oitavo da tarifa de entrada e é de enorme importância em loops de agentes, onde o mesmo contexto é reenviado a cada turno.

• Janela de contexto — Ember-1: não divulgada para a prévia; seu modelo base suporta 1.048.576 tokens. Qwen3.8-Max: 1.000.000 tokens.

• Multimodalidade — Ember-1: texto. Qwen3.8-Max: texto, imagem e vídeo como entrada, texto como saída.

• Pesos — Ember-1: nenhum. Qwen3.8-Max: existe um lançamento de pesos abertos, mas é somente texto e não possui a janela de contexto completa nem a entrada de visão do endpoint servido.

• Acesso — Ember-1: prévia de pesquisa, janela serverless de duas semanas, permanência atrelada à demanda. Qwen3.8-Max: disponibilidade geral e com preço definido.

Observe um detalhe sobre as tarifas do Qwen3.8-Max antes de modelar qualquer coisa: a Aliba​ba revisou repetidamente o empacotamento deste modelo desde o lançamento, e a tabela de preços internacional nem sempre correspondeu ao valor anunciado em agosto. Considere US$ 2,00 e US$ 6,00 como o preço atual da rota na nossa plataforma — que repassa o preço de tabela do provedor sem nenhuma margem, de modo que uma mudança do fornecedor aparece no mesmo dia — e confira a tabela antes de comprometer um orçamento com isso.

Por que a comparação de benchmark não funciona

Os 82,0% do Ember-1 e os 86,6% do Qwen3.8-Max são ambos do Terminal Bench 2.1, o que faz com que pareçam comparáveis e não os torna comparáveis. A planilha do Ember-1 informa seu número em relação a variantes do Kimi K3 avaliadas pela Fireworks Research, em 89 amostras, com deltas de tokens e custos anexados. O número do Qwen3.8-Max vem da própria planilha de avaliação da Alibaba. Laboratórios diferentes, harnesses diferentes, scaffolds de agente diferentes e, em um benchmark cujas pontuações variam vários pontos só pela escolha de scaffold, uma diferença de 4,6 pontos está dentro do nível de ruído da metodologia.

O que você pode ler na planilha do Ember-1 é a coluna de tokens, que é a única coisa que o modelo foi treinado para mudar. Em comparação com sua própria base, o Ember-1 gasta 51,9% menos tokens no Terminal Bench 2.1, 32,5% menos no SWE-Interact, 23,7% menos no DeepSWE 1.1 e apenas 5,9% menos no τ-2 Bench Airline. A amplitude é a manchete honesta. Um modelo que reduz a deliberação vale muito em benchmarks nos quais o modelo base pensa demais e quase nada onde isso não acontece, e você não pode saber que tipo de carga de trabalho você tem sem medir a sua própria.

Custo por tarefa concluída, com cálculo detalhado

Aqui está a aritmética que na verdade decide isso, usando as tarifas publicadas do Kimi K3 como substituto para o custo do Ember-1, já que o Ember-1 não tem nenhuma. O Kimi K3 custa US$ 3,00 por milhão de tokens de entrada, US$ 0,30 em cache e US$ 15,00 de saída — exatamente a tabela de preços que a Fireworks Research usou em sua própria comparação. O Qwen3.8-Max custa US$ 2,00 de entrada e US$ 6,00 de saída, com leituras de cache a US$ 0,25.

No lado da entrada, o Qwen3.8-Max já é mais barato em um terço. No lado da saída, ele é 2,5 vezes mais barato por token. Isso significa que a redução de tokens do Ember-1 não está competindo contra uma fatura estática — está competindo contra um modelo de ponta que já é mais barato por token antes de qualquer trabalho de eficiência. O próprio teste A/B de produção da Fireworks Research mostrou os tokens de saída caindo de 49,3K para 29,9K, uma redução total de 39%; aplique isso à taxa de saída do Qwen3.8-Max e você obtém a mesma economia de 39%, que é um ganho absoluto menor do que o mesmo percentual aplicado à taxa de US$ 15 do K3.

O argumento de eficiência para o Ember-1 é, portanto, mais forte quando medido em relação ao seu próprio modelo base, e é exatamente esse o argumento apresentado no lançamento. Contra o Qwen3.8-Max, a comparação passa para capacidade por dólar, onde o contexto maior do carro-chefe, a entrada multimodal e a disponibilidade com preço definido são os contra-argumentos — e onde ninguém publicou um confronto direto que a resolveria.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

O que os nossos próprios dados de roteamento mostram

Dois dos três modelos envolvidos aqui são rotas ativas no OrcaRouter, o que proporciona uma visão que nenhuma planilha de benchmark contém. O Qwen3.8-Max é servido com 1.000.000 de tokens de contexto, com latência mediana do primeiro token em torno de 2,0 segundos e aproximadamente 52,7 tokens de saída por segundo nos últimos sete dias, com uma taxa de erro de cerca de 4,2%. O Kimi K3 — modelo base do Ember-1 e ponto de referência para cada economia que o Ember-1 afirma — opera com 1.048.576 tokens de contexto, latência mediana perto de 8,0 segundos, cerca de 43,6 tokens de saída por segundo e uma taxa de erro de aproximadamente 0,27%, com tráfego substancialmente maior. O próprio Ember-1 não está no OrcaRouter.

Esses números reformulam a decisão. O Kimi K3 é substancialmente mais lento até o primeiro token e cerca de duas vezes mais caro por token de saída do que o Qwen3.8-Max, ao mesmo tempo que apresenta uma taxa de erro muito menor sob uma carga bem mais pesada. Uma derivada do K3 que economiza tokens reduz a diferença de custo, mas não fecha a lacuna de latência, porque encurtar o raciocínio encurta a fase de geração, não a fila. Se sua carga de trabalho for sensível à latência em vez de sensível ao custo, o modelo principal é o melhor caminho hoje, e a história da eficiência é irrelevante.

Qual deles rotear

Direcione para o Qwen3.8-Max quando você precisar da janela de contexto, da entrada multimodal, de um preço publicado e de um serviço pelo qual possa definir um orçamento. Ele é o mais seguro dos dois por construção: disponível de forma geral, com preço definido e atualizado duas vezes em dois meses por um fornecedor com um histórico de manter o endpoint atualizado.

Experimente o Ember-1 quando sua conta for dominada por tokens de raciocínio em longos loops de agente e você rodar contra um modelo hospedado em vez do seu próprio hardware. O teste certo é usar as duas semanas que a prévia oferece, em modo sombra contra o tráfego de produção, medindo tokens por tarefa concluída em vez de tokens por requisição. O que você não deve fazer é adotá-lo como um substituto equivalente de um modelo de ponta com base em um número de 40% que varia de 6% a 52% dependendo da carga de trabalho.

Se a verdadeira questão é se vale sequer continuar executando o Kimi K3, essa você pode responder hoje sem nenhuma prévia: tanto o Kimi K3 quanto o Qwen3.8-Max estão no OrcaRouter atrás de uma única chave, com preço de tabela do provedor, sem markup, com failover automático entre provedores. Comparar o custo da sua carga de trabalho nos dois é uma mudança de roteamento, não um projeto de compras — e lhe dá a linha de base que torna qualquer alegação de eficiência sobre o Ember-1 mensurável nos seus próprios números, e não nos do laboratório.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

O resumo honesto é que esses dois modelos são otimizados sob restrições diferentes. O Qwen3.8-Max foi feito para ser o modelo mais capaz disponível e tem preço condizente; o Ember-1 foi feito para tornar mais barato executar um modelo já caro. Ambos são legítimos, e a razão pela qual esse confronto não permite um veredito claro é que as economias do derivado são definidas em relação a uma tabela de preços abaixo da qual o carro-chefe consegue ficar substancialmente.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente