
Ember-1 vs Gemma 4 12B: Um aluga menos tokens para você, o outro entrega os pesos
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Ember-1 e Gemma 4 12B não estão competindo pela mesma linha em uma ordem de compra, e a maneira mais rápida de ver por que é perguntar o que você possuiria ao fim de cada mês. O Gemma 4 12B é o modelo multimodal denso de 11,95 bilhões de parâmetros do Google, lançado em 3 de junho de 2026 sob Apache 2.0 — você o baixa, e o checkpoint é seu. O Ember-1 é um derivado especializado do Kimi K3, da Moonshot AI, criado pela Fireworks Research, publicado em 23 de setembro de 2026 como uma prévia de pesquisa na própria plataforma serverless do fornecedor — você o chama, e não possui nada além da fatura. Um é um argumento de aluguel com opção de compra sobre tokens; o outro é uma compra de capital. Coloque-os lado a lado, e a comparação útil não é qual modelo é melhor, porque nada publicado permite resolver isso. É qual das duas formas de aquisição se encaixa naquilo que você está construindo.
Os dois contratos, ditos de forma simples
Gemma 4 12B é uma versão final de pesos abertos. O Google publica os pesos, a arquitetura, a tabela de benchmarks e a licença, e uma comunidade de runtimes — llama.cpp, vLLM, MLX, SGLang, Transformers — o executa em hardware que você controla. O custo de um token depois da compra é eletricidade e amortização, não uma linha na fatura de um fornecedor. As coisas de que você abre mão são as que os pesos abertos sempre custam: o planejamento de capacidade é sua responsabilidade, e seu teto de qualidade fica fixado em 11,95 bilhões de parâmetros.
O Ember-1 é o inverso. Não há pesos para baixar — ele existe como uma opção de serving na própria plataforma do fornecedor — e nenhum preço publicado. O que ele oferece, em vez disso, é uma alegação mais restrita, executada sobre um modelo muito maior: a precisão do Kimi K3, com cerca de 40% menos tokens gastos para chegar lá. A Fireworks Research o treinou especificamente para encurtar os traços de raciocínio sem alterar as respostas, e relata que o comprimento do raciocínio pode ser reduzido em 35–50% sem perda de precisão em sete benchmarks e dois testes A/B de produção de clientes. Todos os números ali são relatados pelo fornecedor e não foram reproduzidos.

O quanto o argumento do token vale depende inteiramente de quem paga pelos tokens.
O argumento de venda do Ember-1 pressupõe uma cobrança por token. Essa suposição está correta para o público para o qual foi projetado — equipes que executam longos loops de agentes contra um modelo de fronteira hospedado, em que a Fireworks Research observa que o Kimi K3 pode gastar mais de 90% dos tokens gerados em raciocínio interno, e em que cada turno reproduz turnos anteriores, de modo que o raciocínio anterior é relido e cobrado novamente. Nesse contexto, reduzir o comprimento do trace é um corte direto na fatura mensal, e o resultado A/B de 29,9K tokens de saída contra os 49,3K do K3 é o número que importa.
Rode o mesmo modelo nos termos do Gemma 4 12B e o argumento se desfaz. Quando você mesmo hospeda um checkpoint Apache-2.0, tokens de raciocínio extras custam tempo de relógio e ocupação de GPU, não dólares por milhão. Um traço de raciocínio verboso no seu próprio laptop de 16 GB é uma resposta mais lenta, não uma conta maior. Isso não torna a ineficiência inofensiva — em um loop de agente, ela ainda se acumula, e ainda aparece como latência —, mas a taxa de câmbio é diferente, e tratar uma redução de 40% de tokens como uma economia de 40% em hardware auto-hospedado é um erro de categoria.
A ficha técnica, uma linha por dimensão.
• O que é — Ember-1: um derivado de prévia de pesquisa do Kimi K3, retreinado para raciocínio mais curto. Gemma 4 12B: um modelo multimodal denso de pesos abertos de 11,95B da família Gemma 4 do Google.
• Pesos — Ember-1: nenhum publicado; disponibilizado apenas por meio da plataforma do fornecedor. Gemma 4 12B: Apache 2.0, baixável, sem restrições de acesso.
• Tamanho — Ember-1: não divulgado; herdado da arquitetura do Kimi K3. Gemma 4 12B: 11,95B denso, 48 camadas, aproximadamente 18 GB de pesos em BF16.
• Janela de contexto — Ember-1: não divulgada para a prévia; seu modelo base tem 1.048.576 tokens. Gemma 4 12B: 256K tokens.
• Entradas — Ember-1: texto. Gemma 4 12B: texto, imagem e áudio por meio de um design unificado sem encoder, com vídeo listado por algumas fontes.
• Preço — Ember-1: nenhum divulgado; os valores em dólares da planilha de benchmark são calculados a partir da tabela de preços do Kimi K3. Gemma 4 12B: gratuito para download; você paga pelo hardware.
• Requisito mínimo de hardware — Ember-1: o que o fornecedor definir. Gemma 4 12B: 16 GB de VRAM ou memória unificada, segundo o posicionamento do Google.
• Evidência — Ember-1: benchmarks de fornecedor e dois testes A/B conduzidos pelo fornecedor, não reproduzidos. Gemma 4 12B: avaliações reportadas pelo Google mais um ecossistema independente de execuções locais.
O que o Gemma 4 12B publica, e como ele lê
Os próprios números do Google para o Gemma 4 12B colocam-no entre o Gemma 4 E4B, de porte edge, e o maior 26B MoE: GPQA Diamond 78,8%, MMLU Pro 77,2%, AIME 2026 sem ferramentas 77,5%, LiveCodeBench v6 72,0, Codeforces ELO 1659, média τ-2 69,0%, MMMU Pro 69,1%, DocVQA 94,9 e BigBench Extra Hard 53,0%. Esses também são relatados pelo fornecedor — o Google avaliou seu próprio modelo e publicou a tabela —, mas têm a vantagem de descrever um checkpoint que qualquer pessoa pode baixar e executar novamente, e é por isso que alegações de pesos abertos tendem a obter confirmação de terceiros rapidamente, enquanto alegações de prévias fechadas não.
A verdadeira distinção do modelo é estrutural, e não numérica. O Gemma 4 12B não tem um codificador de visão nem de áudio separado: patches de imagem e formas de onda de áudio se projetam diretamente no espaço de tokens, e é isso que permite que um modelo de 12B aceite uma captura de tela ou uma gravação como entrada. Ele também inclui modelos de rascunho de previsão multi-token para decodificação especulativa, o que é um recurso de latência, e não de qualidade — o tipo de coisa que importa quando você mesmo executa o modelo e cada milissegundo de prefill é custo seu.
Onde os dois realmente colidem
Ambos os modelos são vendidos para codificação agêntica e uso de ferramentas, e este é o único território em que existe uma escolha real. O número do Ember-1 no Terminal Bench 2.1 é 82,0%, contra 80,9% do Kimi K3 Max, com 51,9% menos tokens; seu resultado no SWE-bench Verified é 92,2%, contra 93,2% do K3 Max. O Gemma 4 12B não tem número algum de Terminal Bench ou SWE-bench no conjunto publicado do Google — sua evidência agêntica é τ-2 com 69,0%. Portanto, não se pode colocar os dois lado a lado em um benchmark compartilhado, e qualquer artigo que o faça está inventando a comparação.
O que você pode dizer é que eles ocupam pontos diferentes numa curva de custos. Se a sua carga de trabalho de agentes roda contra um modelo de fronteira hospedado e a conta é dominada por tokens de raciocínio, o Ember-1 ataca exatamente esse termo — ao preço de uma janela de acesso de duas semanas e nenhuma tarifa publicada. Se a sua carga de trabalho precisa rodar em hardware que você controla, lidar com uma captura de tela, ou sobreviver a um fornecedor que decide não continuar uma prévia, o Gemma 4 12B é o único dos dois que sequer responde à pergunta.

Um caminho do meio, e onde encontrá-lo
Existe uma terceira opção em torno da qual o marketing de nenhum dos modelos foi construído: usar os tiers maiores do Gemma 4 como a metade hospedada de um híbrido. O OrcaRouter encaminha o Gemma 4 26B-A4B do Google e Gemma 4 31B ao lado de mais de 200 outros modelos atrás de uma única API pelo preço de tabela do provedor com 0% de margem, então a mesma chave que acessa um Gemma de porte médio também acessa os modelos de fronteira para os quais você precisaria, de outra forma, de um segundo contrato. O próprio Gemma 4 12B não está na nossa plataforma, e o Ember-1 também não — se você precisa do 12B localmente, baixe-o; se quiser testar primeiro se um Gemma maior fecha a lacuna, esse teste custa um endpoint.
Essa configuração também é a maneira honesta de avaliar uma prévia de pesquisa. O failover automático entre provedores significa que um modelo que desaparece de uma janela de prévia não leva sua aplicação junto, que é o risco específico que o status de lançamento do Ember-1 introduz e o risco específico que nada em sua tabela de benchmarks aborda.
Qual deles pertence ao seu roadmap?
Escolha o Gemma 4 12B se a propriedade for um requisito — privacidade, operação offline, um piso de custo fixo, ou um produto que precise continuar funcionando caso um fornecedor mude de ideia. Seu teto publicado é mais baixo que o de um derivado de fronteira, e sua entrada multimodal é genuinamente diferenciadora, e nenhum desses fatos depende do roadmap de qualquer outra pessoa.
Escolha o Ember-1 se o seu problema for uma cobrança por token em execuções longas de agentes e você puder absorver o risco de preview. Execute-o em shadow em paralelo com o seu fornecedor atual pelas duas semanas que você tem, meça tokens por tarefa concluída no seu próprio tráfego e trate os 40% como uma hipótese, não como uma taxa. O que você não deve fazer é escolher entre eles com base na qualidade, porque ninguém — incluindo o laboratório que criou o Ember-1 — publicou uma comparação que permitiria fazer isso.

O ponto mais amplo é que esses dois lançamentos representam as duas maneiras pelas quais a capacidade está sendo vendida no final de 2026. Um laboratório publica um checkpoint e deixa o ecossistema encontrar seu nível; outro pega um modelo treinado por outra pessoa, melhora um eixo de seu comportamento e vende a melhoria como serviço. Ambos são legítimos, e falham de maneiras diferentes: pesos abertos falham lentamente e em público; prévias falham de repente e por anúncio.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
