
Ember-1 reduz o raciocínio do Kimi K3 em 40% — e as letras miúdas são o que importa
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
O número que será citado é 40%. A Fireworks Research publicou o Ember-1 em 23 de setembro de 2026, descrevendo-o como um derivado especializado do Kimi K3 da Moonshot AI que mantém a precisão do K3 enquanto gasta cerca de 40% menos tokens para chegar lá. Essa é uma afirmação real e incomumente específica, e vem acompanhada de três coisas: uma planilha completa de benchmarks com colunas de redução de tokens, dois testes A/B de clientes a partir de tráfego de codificação em produção, e um status de lançamento que não é disponibilidade geral. O Ember-1 está disponível como uma prévia de pesquisa, na própria plataforma serverless do fornecedor, com uma janela de acesso de duas semanas e uma decisão de permanência que depende da demanda. Entender qual parte disso é um produto lançado e qual parte é um resultado de pesquisa bem argumentado é todo o exercício.
Há também uma colisão de nomes que vale a pena esclarecer antes de qualquer outra coisa. Um projeto de pesquisa aberto separado chamado Ember (v0.1.5, da Slow Lit Labs) dedicou 2026 a publicar avaliações de coerência de longo horizonte, e ele não tem qualquer relação com este modelo. Qualquer coisa que você leia sobre o Ember não conseguir superar o Qwen3-8B sob configurações de inferência equivalentes diz respeito àquele projeto. O Ember-1, o assunto aqui, é um derivado do Kimi K3 da Fireworks Research.
O que Ember-1 realmente é
{{1}}Ember-1{{/1}} não é uma nova arquitetura nem um novo modelo base. É o {{2}}Kimi K3{{/2}}, retreinado para raciocinar de forma mais concisa. A {{3}}Fireworks Research{{/3}} realizou mais de 50 experimentos de treinamento e mais de 200 avaliações em sua própria pilha de treinamento sem servidor, abrangendo matemática, programação, seguimento de instruções, conversação, busca, uso de ferramentas e engenharia de software, com o objetivo explícito de remover raciocínio que não altera a resposta. O laboratório afirma que o comprimento do raciocínio pôde ser reduzido em 35–50% sem perda de precisão em sete benchmarks e dois conjuntos de tráfego de produção de clientes. Todos esses números são relatados pelo fornecedor e não foram reproduzidos de forma independente; nenhum terceiro publicou uma execução do {{4}}Ember-1{{/4}} até o momento da redação.
O enquadramento importa porque a alternativa óbvia já existia. O Kimi K3 vem com configurações de esforço de raciocínio, e a maneira barata de gastar menos tokens é diminuir o esforço. A Fireworks Research diz que tentou isso e a configuração baixa sacrificou qualidade demais — um resultado familiar para qualquer pessoa que já ajustou níveis de esforço em um modelo de raciocínio. A alegação da Ember-1 é que o ajuste de esforço é grosseiro e o retreinamento é refinado.

Por que os tokens de raciocínio valem todo esse esforço
A conta de um modelo de raciocínio não é dominada pela sua resposta. A Fireworks Research observa que o K3 pode gastar mais de 90% dos tokens que gera em raciocínio interno antes de escrever qualquer coisa que um usuário veja. Em uma única solicitação, isso é apenas caro. Em um loop de agente com múltiplos turnos, isso se acumula, porque cada turno reproduz a conversa anterior, então os rastros de raciocínio dos turnos anteriores são relidos e cobrados novamente a cada chamada subsequente. A Fireworks Research descreve o contexto crescendo aproximadamente de forma quadrática com o número de turnos. Esse é o alvo real deste lançamento, e é por isso que a métrica de destaque é aproximadamente 40% menos tokens, em vez de um salto de qualidade.
O mecanismo também explica o risco. A compressão que remove deliberação desperdiçada é gratuita; a que remove uma etapa de que o modelo precisava não é. O modo de falha amplamente relatado da redução de raciocínio excessivamente agressiva é um modelo que pula uma verificação intermediária e salta para uma conclusão, o que, em um agente, aparece muito mais tarde como uma chamada de ferramenta errada, e não como uma frase errada. A ênfase repetida da Fireworks Research em qualidade equivalente soa como uma resposta a essa preocupação, e os números A/B são o mais próximo de evidência para isso — com a ressalva habitual de que os conjuntos de teste, os critérios de aprovação e os tamanhos de amostra foram todos escolhidos pela parte que faz a alegação.
A planilha de benchmark, com sua proveniência anexada
Estes são os números da Fireworks Research, não reproduzidos. A coluna da direita é a parte que vale a pena ler atentamente: ela relaciona cada pontuação com quantos tokens e dólares foram gastos em relação ao K3 Max.
• Terminal Bench 2.1 (n=89) — Ember-1 82,0% vs. K3 Max 80,9%, K3 High 77,6%, K3 Low 76,4%; 51,9% menos tokens, US$ 23,10 menos por tarefa.
• SWE-bench Verified (n=500) — Ember-1 92,2% vs. K3 Max 93,2%; 15,5% menos tokens, US$ 68,10 menos por tarefa.
• SWE-Interact (n=75) — Ember-1 20,0% vs K3 Max 21,3%, K3 High 13,3%, K3 Low 6,7%; 32,5% menos tokens.
• DeepSWE 1.1 (n=113) — Ember-1 75,2% vs K3 Max 66,4%; 23,7% menos tokens, US$ 126,90 menos por tarefa.
• τ-2 Bench Airline (n=50) — Ember-1 66% vs K3 Max 64%, K3 High e Low ambos 64%; 5,9% menos tokens, US$ 0,30 menos por tarefa.
Duas coisas se destacam. Primeiro, o Ember-1 vence de forma absoluta no Terminal Bench 2.1 e no DeepSWE 1.1, ao mesmo tempo que perde por pouco no SWE-bench Verified e no SWE-Interact — um padrão consistente com um modelo que não perdeu capacidade, mas sim mudou em quais tarefas gasta a sua deliberação. Segundo, a economia de tokens é extremamente desigual: 51,9% no Terminal Bench contra 5,9% no τ-2 Airline. O que quer que o Ember-1 tenha aprendido, não é um corte uniforme de 40% no raciocínio. O "cerca de 40%" da manchete é uma média de um intervalo que vai de aproximadamente 6% a aproximadamente 52%, e uma equipe cuja carga de trabalho se parece com a do τ-2 Airline não deve esperar sentir esse efeito.
Os testes A/B de produção são a evidência mais persuasiva, precisamente porque não foram criados para serem benchmarks. Na carga de trabalho de codificação de um cliente, o Ember-1 obteve 0,753 contra 0,751 do K3, levou 21,4 passos contra 23,8, e emitiu 29,9K tokens de saída contra 49,3K — uma redução de 71,3% em tokens de raciocínio e 39% em tokens totais, com qualidade aproximadamente equivalente. Um segundo cliente viu cerca de 35% menos tokens por tarefa com qualidade comparável, e a Fireworks Research diz que fez a troca em seu próprio tráfego interno de codificação e coworking primeiro, com o resultado relatado de que ninguém notou. Trate tudo isso como informação relatada pelo fornecedor, mas trate como a forma mais forte de informação relatada pelo fornecedor: dados de preferência A/B e de conclusão de tarefas são mais difíceis de manipular do que um ranking.
Há mais uma avaliação, no Bedside Bench da Doximity — 500 casos clínicos validados por médicos em dez categorias — em que a Fireworks Research afirma que o Ember-1 estabeleceu uma nova fronteira de Pareto em custo por tarefa, comparando-o com modelos abertos e fechados, incluindo GPT-5.6 Sol, GPT-6 Astra e Claude Opus 5. Essa é uma alegação de fornecedor sobre uma posição de Pareto, que é uma alegação sobre um trade-off bidimensional, e não uma pontuação única, e vale apenas tanto quanto as premissas de custo por trás dela. Essas premissas vieram da tabela pública de tarifas da API do Kimi K3. O que nos leva à parte da história que um leitor pode de fato verificar hoje.

O modelo base é a parte que você já consegue rotear
Todo o argumento de custo do Ember-1 é medido em relação às tarifas publicadas do Kimi K3. O Kimi K3 está disponível no OrcaRouter a US$ 3,00 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de entrada em cache e US$ 15,00 por milhão de tokens de saída, com uma janela de contexto de 1.048.576 tokens. Essa é a mesma tabela de preços usada na comparação do Fireworks Research, e vale saber que as economias nessas colunas de redução de tokens são calculadas com base em números que você pode ver por si mesmo, e não no modelo de custo interno de um fornecedor.
O próprio Ember-1 não está no OrcaRouter. Está disponível apenas através da plataforma serverless do próprio fornecedor, como prévia de pesquisa, e a Fireworks Research não publicou um preço para ele — pelo que os valores em dólares na tabela de benchmark são derivados das tarifas do K3 e das contagens de tokens, não de uma tabela de preços do Ember-1 que exista. Se o que lhe interessa é a aritmética, a sequência honesta é precificar a carga de trabalho na rota do K3 hoje, considerar as percentagens de redução de tokens como o limite superior daquilo que uma mudança pode comprar, e esperar por uma tarifa publicada antes de modelar a poupança como dinheiro.
Onde o OrcaRouter ajuda aqui é com a proteção. Uma prévia de pesquisa com uma janela de acesso de duas semanas é exatamente o tipo de modelo que você quer experimentar sem apostar um caminho de produção nele, e a forma de fazer isso sem um segundo contrato é colocá-lo atrás do mesmo endpoint que todo o resto que você chama. O OrcaRouter disponibiliza 200+ modelos atrás de uma única API com failover automático, então um modelo de prévia que se revele indisponível no próximo mês é uma mudança de roteamento em vez de uma migração. Nada no Ember-1 exige isso — mas nada numa janela de duas semanas argumenta contra isso também.
O que fazer com este lançamento
Se você já executa o Kimi K3 em um loop de agente, os números do Ember-1 descrevem sua conta. O problema de replay multi-turno é real, é o custo dominante em execuções longas de agentes, e um modelo que encurta seus próprios traces sem alterar suas respostas vale o tempo de avaliação. O teste certo não é a tabela de benchmark; é o seu próprio tráfego, executado em shadow — envie uma parte das requisições reais para ambos os modelos, compare as saídas, mantenha os resultados ao vivo intocados por uma ou duas semanas antes de mudar qualquer coisa. Esse também é o conselho que os próprios leitores críticos do lançamento estão dando, e é sensato.
Se você executar uma carga de trabalho de baixa deliberação, ou uma dominada por chamadas curtas de turno único, a economia basicamente evapora e a linha τ-2 Airline é a sua expectativa realista. E se você precisar de um compromisso de nível de produção — um preço, um nível de serviço, uma garantia de que o endpoint existirá daqui a seis meses — a Ember-1 ainda não oferece isso. É uma prévia de pesquisa cuja permanência a Fireworks Research vincula explicitamente à demanda. A questão interessante ao longo do próximo mês é se a janela de duas semanas se tornará uma opção de serviço permanente e se terceiros reproduzirão algum desses números. Até que uma dessas coisas aconteça, este é um resultado forte para ler e ruim para basear um orçamento.

Nada disso deve ser interpretado como uma forma de diminuir o trabalho. Remover raciocínio sem remover precisão é um problema mais difícil do que adicioná-lo, e fazê-lo em cima do modelo de fronteira de outra pessoa, em vez de treinar o seu próprio, é a forma que muito do trabalho de capacidades de 2026 tem assumido. Ember-1 é o primeiro lançamento do que a Fireworks Research diz que será uma série contínua, e o padrão — pegue um modelo que já é bom, retreine um eixo do seu comportamento, venda o delta em tokens — é um que vale a pena acompanhar, independentemente de como esta prévia em particular for recebida.
