
Ember-1 vs LFM2.5 2.6B Base: Um comportamento acabado contra um substrato bruto
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Nem o Ember-1 nem o LFM2.5 2.6B Base são um modelo que você possa pegar e usar, e são inutilizáveis por razões opostas. O Ember-1, publicado pela Fireworks Research em 23 de setembro de 2026, é um derivado especializado do Kimi K3 da Moonshot AI que o laboratório retreinou para alcançar a precisão do K3 com cerca de 40% menos tokens — um comportamento finalizado, disponível apenas como prévia de pesquisa na própria plataforma serverless do fornecedor, sem pesos e sem preço publicado. O LFM2.5 2.6B Base, publicado pela Liquid AI em 4 de agosto de 2026, é um checkpoint pré-treinado de 2,69 bilhões de parâmetros sob a LFM Open License v1.0 que não passou por nenhum ajuste de instrução e continuará seu texto em vez de responder à sua pergunta — um substrato bruto, baixável hoje, deliberadamente inacabado. Lê-los lado a lado é uma boa maneira de ver os dois argumentos que estão sendo feitos sobre de onde os ganhos de eficiência agora vêm.
A pergunta que ambos os modelos estão respondendo
Ambos os lançamentos partem da mesma premissa: a de que os ganhos fáceis de tornar um modelo maior já foram em grande parte obtidos, e o trabalho interessante passou a ser como um modelo gasta o que já tem. Os dois laboratórios respondem a isso de forma diferente. A Fireworks Research pegou um modelo de fronteira existente e mudou seu comportamento. A Liquid AI construiu um modelo pequeno do zero e mudou a escala. Nenhum dos dois é uma história de nova arquitetura, e nenhum está tentando chegar ao topo de um ranking.
Resposta do Ember-1: manter o modelo, retreinar o comportamento
Ember-1 não mexe na arquitetura do Kimi K3 e ataca uma ineficiência específica. Modelos de raciocínio podem queimar mais de 90% dos tokens gerados em deliberação interna e, em um loop de agente com múltiplos turnos, esses traços são reproduzidos e cobrados novamente a cada turno subsequente — a Fireworks Research descreve o crescimento de contexto resultante como aproximadamente quadrático no número de turnos. A afirmação do laboratório é que o raciocínio do K3 é mais longo do que a tarefa exige e que o excesso pode ser removido sem alterar as respostas. Ele relata ter executado mais de 50 experimentos de treinamento e mais de 200 avaliações em sua própria pilha de treinamento serverless, e afirma que o comprimento do raciocínio caiu de 35–50% sem perda de precisão em sete benchmarks e dois conjuntos de tráfego de produção de clientes. Tudo isso é relatado pelo fornecedor e não reproduzido.
Os resultados são irregulares de uma maneira que o número principal oculta. As reduções de tokens do Ember-1 variam de 51,9% no Terminal Bench 2.1 a 5,9% no τ-2 Bench Airline. Em um A/B de codificação em produção de um cliente, os tokens de saída caíram de 49,3K para 29,9K, enquanto a pontuação se manteve em 0,753 contra 0,751 — um corte de 71,3% nos tokens de raciocínio. Isso é um efeito grande em um formato de carga de trabalho e um quase invisível em outro, que é o que se esperaria de um modelo treinado para parar de pensar demais, em vez de pensar menos.

Resposta do LFM2.5 2.6B Base: mude a escala, mantenha a receita
O LFM2.5 2.6B Base é um tipo diferente de aposta. É a arquitetura híbrida da Liquid AI em pequena escala: 30 camadas, das quais 22 são blocos de convolução curta com portas duplas e 8 são camadas de atenção por consultas agrupadas, treinada em cerca de 34 trilhões de tokens em 16 idiomas, com uma janela de contexto de 131.072 tokens. O checkpoint completo tem 2,69 bilhões de parâmetros densos — pequeno o suficiente para que a conversa sobre custo deixe de ser sobre tokens e passe a ser sobre qual única GPU você tem sobrando.
O que o torna incomum é o que ele deliberadamente não faz. Não há ajuste por instruções, que é justamente o ponto do sufixo "Base": apresente-lhe uma pergunta e ele continuará o texto no estilo da pergunta, em vez de respondê-la. O próprio cartão de modelo da Liquid AI o recomenda para tarefas que exigem fine-tuning intenso. Também não há avaliação publicada dele, e isso não é um descuido — avaliar um checkpoint base em benchmarks de seguimento de instruções não mediria nada, porque o comportamento que está sendo medido ainda não foi treinado.
O contraste, uma linha por dimensão
• O que é — Ember-1: um derivado retreinado do Kimi K3 com raciocínio encurtado. LFM2.5 2.6B Base: um checkpoint pré-treinado do zero, sem ajuste de instrução.
• Parâmetros — Ember-1: não divulgados; herdados do Kimi K3. LFM2.5 2.6B Base: 2,69B denso.
• Pesos — Ember-1: nenhum publicado. LFM2.5 2.6B Base: disponível sob a LFM Open License v1.0.
• Preço — Ember-1: nenhum publicado; os dólares de benchmark usam a tabela de preços do Kimi K3. LFM2.5 2.6B Base: gratuito para download; você fornece o hardware.
• Contexto — Ember-1: não publicado para a prévia. LFM2.5 2.6B Base: 131.072 tokens.
• Avaliação publicada — Ember-1: sete benchmarks e dois testes A/B, todos executados pelo fornecedor. LFM2.5 2.6B Base: nenhuma, por design.
• O que você recebe no final — Ember-1: um endpoint que produz raciocínio mais curto com precisão de nível K3. LFM2.5 2.6B Base: um ponto de partida cujo comportamento é aquilo que você treinar nele.
Dois tipos diferentes de saudade
As lacunas nesses dois lançamentos parecem simétricas e não são. A ausência de avaliação do LFM2.5 2.6B Base é uma propriedade do artefato: um checkpoint base não tem comportamento a ser pontuado, e a ausência de ajuste de instruções é uma característica documentada, e não uma deficiência. A ausência não cria incerteza comercial, porque o que você está comprando é um arquivo com uma licença anexada, e o entregável está completo no momento em que o download termina.
As lacunas do Ember-1 permanecem genuinamente sem solução. Não há preço publicado, então a alegação de custo é uma aritmética sobre a tabela de preços do Kimi K3, e não uma tarifa sobre a qual você possa basear seu orçamento. Não há liberação de pesos, então o modelo não pode durar mais do que a decisão do fornecedor de continuar a servi-lo. E a janela de acesso é descrita como temporária: a Fireworks Research enquadra seus lançamentos de pesquisa como janelas serverless de duas semanas cuja permanência depende da demanda da comunidade. Uma prévia que pode não existir no mês que vem é uma proposta diferente de uma prévia que é meramente não comprovada, e o segundo A/B com clientes no anúncio — cerca de 35% menos tokens por tarefa — revela o que o laboratório espera, não o que ainda estará acessível em novembro.
Essa assimetria é a resposta honesta à pergunta “qual destes está mais pronto”. Nenhum dos dois está pronto no sentido de ser uma dependência de produção pronta para uso imediato. LFM2.5 2.6B Base está finalizado como matéria-prima e não finalizado como modelo. Ember-1 está finalizado como modelo e não finalizado como serviço.

O que fazer com cada um neste trimestre
Se você tem um pipeline de ajuste fino e uma tarefa restrita com rótulos limpos, o LFM2.5 2.6B Base é o mais previsível dos dois. O checkpoint é pequeno, a licença é permissiva, a arquitetura foi projetada para ser eficiente na inferência, e o trabalho de transformá-lo em algo útil — ajuste fino supervisionado, um conjunto de avaliação, uma stack de serving — é um trabalho que você já domina de ponta a ponta. De qualquer forma, você executará suas próprias avaliações, porque a Liquid AI não publicou nenhuma.
Se você tem uma carga de trabalho de agente hospedado cuja fatura é dominada por tokens de raciocínio, o Ember-1 aborda um termo real na sua equação de custos, e vale as duas semanas. O teste certo é tráfego sombra contra o seu fornecedor atual: envie uma parte das requisições reais para ambos, compare as saídas, deixe os resultados em produção intactos. Esse também foi o conselho dado pela cobertura crítica independente do lançamento, junto com um alerta justo — comprimir a deliberação corre o risco de perder uma etapa de que o modelo precisava e, em um agente, isso aparece mais tarde como uma chamada de ferramenta errada, e não como uma frase errada.
Nenhum dos dois modelos está no OrcaRouter. Se você quiser testar o padrão em vez desses dois artefatos — um modelo pequeno ajustável por fine-tuning e um raciocinador grande hospedado em um único pipeline — é exatamente para isso que a DSL de roteamento serve: compor vários modelos em uma única chamada e deixar que cada um cuide da parte em que é bom, por trás de uma única chave e uma única fatura. A comparação aqui vale a pena ser feita no nível da arquitetura mesmo enquanto ambos os endpoints específicos permanecem fora de alcance.
A troca, dita uma vez
O Ember-1 vende certeza de comportamento e incerteza de disponibilidade: um modelo cuja qualidade é cuidadosamente argumentada e cuja disponibilidade é explicitamente condicional. O LFM2.5 2.6B Base vende certeza de disponibilidade e incerteza de comportamento: um arquivo que você sempre terá e cuja competência é inteiramente função do treinamento que você coloca nele. Equipes com um problema de serving e sem capacidade de treinamento devem acompanhar a prévia e torcer para que ela se torne permanente. Equipes com capacidade de treinamento e uma tarefa restrita devem baixar a base e parar de esperar pelo roadmap de quem quer que seja.

O que o pareamento realmente mostra é que "eficiência" deixou de significar uma única coisa. Para o Ember-1, significa menos tokens com a mesma qualidade no hardware de outra pessoa. Para o LFM2.5 2.6B Base, significa um modelo pequeno o suficiente para que o hardware deixe de ser de outra pessoa por completo. Essas são ambas boas respostas e não são intercambiáveis.
