Um cartão de destaque comparando Sakana Namazu e Gemma 4 12B, com legenda 'Uma API soberana ou pesos abertos que você possui', com cartões para Sakana Namazu (API hospedada, US$ 0,95/US$ 4,00) e Gemma 4 12B (pesos abertos de 12B, roda em 16 GB). Logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Sakana Namazu vs Gemma 4 12B: Uma API Soberana ou Pesos Que Você Possui

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Sakana Namazu e Gemma 4 12B respondem à mesma pergunta de extremos opostos: qual é a forma mais barata de obter um comportamento de modelo de língua japonesa genuinamente útil? Sakana Namazu é uma API hospedada — Kimi K2.6 pós-treinada para a cultura empresarial japonesa, $0.95 / $4.00 por milhão de tokens, com busca na web e execução de código integradas. Gemma 4 12B é o modelo multimodal de pesos abertos de 12 bilhões de parâmetros do Goog​le, Apache 2.0, pequeno o suficiente para rodar em uma máquina de 16 GB e gratuito para download. Um pede que você confie no console do fornecedor; o outro pede que você confie no seu próprio hardware.

Duas respostas diferentes para "onde isso roda"

Sakana Namazu é um produto: você se inscreve, troca um base_url e o modelo — ajustado, servido, com ferramentas — está lá. Gemma 4 12B é matéria-prima: você baixa os pesos e tudo depois disso é problema seu, desde o mecanismo de inferência (vLLM, llama.cpp, Ollama, MLX, SGLang todos funcionam) até a GPU. Essa diferença não é uma nota de rodapé; ela decide toda a comparação. Um modelo denso de 12B é território de laptop — o Google projetou este para rodar em aproximadamente 16 GB de memória — o que faz do Gemma 4 12B o único dos dois que funciona offline, em uma máquina isolada de rede ou em um dispositivo que nunca envia dados para casa.

O contraste da especificação

• Preço — Sakana Namazu $0,95 / $4,00 por 1M de tokens vs Gemma 4 12B $0 para baixar, ~$0,10 / $0,30 por 1M se você alugar hospedagem

• Pesos — Namazu fechado, servido pelo fornecedor vs Gemma 4 12B aberto (Apache 2.0), auto-hospedável, ajustável

• Contexto — Namazu não divulgado vs Gemma 4 12B 256K tokens (262.144), saída de até 262K

• Modalidade — Namazu texto + imagem vs Gemma 4 12B texto, imagem, áudio e vídeo como quadros (entrada de áudio nativa)

• Japonês — Namazu ajustado para keigo e cultura empresarial vs Gemma 4 12B generalista multilíngue

• Verificação — Namazu somente relatado pelo fornecedor vs Gemma 4 12B medido de forma independente (77.2 MMLU-Pro, 78.8 GPQA Diamond conforme BenchLM, agosto de 2026)

A two-column scoreboard comparing Sakana Namazu and Gemma 4 12B: Namazu at $0.95/$4.00, hosted on Sakana's API, undisclosed context, keigo and culture tuning, vendor FairPoliticsQA 56.3%, no independent scores; Gemma 4 12B at ~$0.10/$0.30 hosted, Apache-2.0 open weights, 256K context, runs on 16 GB RAM, MMLU-Pro 77.2%, AA Intelligence 22, independently measured. Footer notes Namazu figures are vendor-reported and Gemma figures are per BenchLM/Artificial Analysis. OrcaRouter logo composited bottom-right.

Keigo não é um benchmark.

A questão da linguagem é onde os dois modelos realmente divergem. O Gemma 4 12B é um modelo multilíngue forte — o Google o treinou em 140+ idiomas —, mas ser multilíngue não é o mesmo que ser culturalmente japonês. O ajuste fino do Sakana Namazu é especificamente sobre registro: honoríficos que sobrevivem a um e-mail formal, jargão da indústria representado corretamente e respostas sobre história politicamente sensível que não carregam o enquadramento de outro país (a pontuação interna da Sakana no FairPoliticsQA salta de 34,10% para 56,30%). Se a sua carga de trabalho é texto em japonês voltado ao cliente, isso é uma diferença de produto, não uma diferença de especificação. Se a sua carga de trabalho é de propósito geral — resumos, classificação, extração, transcrição de áudio —, o áudio nativo e o contexto maior do Gemma 4 12B dão a ele uma abrangência que o Namazu não alega ter.

Quem vê os dados

A comparação de privacidade pende fortemente a favor do Gemma 4 12B. Execute-o localmente e nada sai da máquina — sem telemetria, sem alegações de treinamento, sem questões de jurisdição. O Sakana Namazu, por outro lado, usa seus dados de entrada para treinamento por padrão (com opção de exclusão disponível no console), não garante processamento apenas no Japão e não está disponível na UE/EEE, no Reino Unido ou na Suíça de forma alguma. Para uma empresa japonesa que lida com DPI de clientes, "o modelo vive no nosso laptop" é uma narrativa de conformidade que nenhuma API hospedada consegue igualar atualmente. Para uma empresa que não pode executar ou manter sua própria inferência, o inverso é verdadeiro: uma API hospedada com ferramentas integradas é a única opção realista.

A pricing card for Sakana Namazu v1.0 showing $0.95 input, $4.00 output, and $0.15 cached input per 1M tokens, web search at $7.00 per 1,000 calls, code execution at $0.12 per hour, and a note that the model is not available in the EU/EEA, UK, or Switzerland and may train on inputs by default.

A questão do teto

O contrapeso honesto para as vantagens de propriedade do Gemma 4 12B é a capacidade. Um modelo de 12B é diligente como um júnior: 72.0 no LiveCodeBench v6, um teto baixo no Humanity's Last Exam e problemas de confiabilidade de OCR de documentos em layouts densos. É um burro de carga, não um cérebro. O Sakana Namazu herda o piso de raciocínio do Kimi K2.6, uma base de classe de fronteira com 1T de parâmetros que a Artificial Analysis classifica como topo do campo de pesos abertos — com a ressalva de que os deltas de pós-treinamento do Namazu são integralmente relatados pelo fornecedor. Se suas tarefas exigem raciocínio complexo ou agentes de horizonte longo, um modelo de 12B é uma limitação; se suas tarefas são de alto volume e bem delimitadas, é uma pechincha.

The Hugging Face model card for google/gemma-4-12B-it in English, showing Gemma 4 12B under the Apache 2.0 license from Google DeepMind, a 12B parameter model size, and 2.97M downloads in the last month, captured August 11, 2026.

A chamada

Escolha o Gemma 4 12B quando as condições de contorno importarem mais do que a capacidade de pico: dados que nunca devem sair da sua rede, um piso orçamentário de zero, operação offline ou uma carga de trabalho multimodal que queira áudio. Escolha o Sakana Namazu quando o trabalho for especificamente a linguagem de negócios japonesa, ou quando você precisar de comportamento agêntico com ferramentas integradas e não puder operar sua própria stack de inferência. E observe que nenhuma das duas é uma decisão de uma tecla só: o Gemma 4 12B é de pesos abertos que você mesmo serve; o Sakana Namazu roda no console da própria Sakana — portanto, uma stack que quer ambas já é uma stack multimodelo, e é aí que um roteador que coloca 200+ modelos atrás de um endpoint compatível com OpenAI e faz failover automaticamente deixa de ser algo bom de ter e passa a ser a arquitetura.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube