一张用于对比Sakana Namazu与Gemma 4 12B的主视觉标题卡片,副标题为“自主API或你拥有的开放权重”,包含两个信息卡片:Sakana Namazu(托管API,$0.95/$4.00)和Gemma 4 12B(12B开放权重,可在16GB上运行)。OrcaRouter标志合成于右下角。
Guides & Insights

Sakana Namazu 对比 Gemma 4 12B:主权API还是你拥有的权重

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Sakana Namazu 和 Gemma 4 12B 从相反的角度回答了同一个问题:以最便宜的方式获得真正有用的日语模型行为是什么?Sakana Namazu 是一种托管 API——Kimi K2.6 针对日本商业文化进行了后训练,每百万个 token 0.95 美元 / 4.00 美元,内置网络搜索和代码执行功能。Gemma 4 12B 是 Google 的开源权重 120 亿参数多模态模型,采用 Apache 2.0 许可,体积小到可以在 16 GB 内存的机器上运行,并且可以免费下载。一个要求你信任供应商的控制台;另一个要求你信任自己的硬件。

“这在哪里运行”的两个不同答案

Sakana Namazu 是一个产品:你注册,替换 base_url,模型——经过调优、部署、工具化——就在那里。Gemma 4 12B 是原材料:你拉取权重,之后的一切都是你的问题,从推理引擎(vLLM、llama.cpp、Ollama、MLX、SGLang 都能用)到 GPU。这个差别不是脚注;它决定了整个对比。12B 稠密模型属于笔记本电脑的范畴——Goog​le 设计它时预计在约 16 GB 内存中运行——这使得 Gemma 4 12B 成为这两者中唯一能离线工作、能在气隙隔离的机器上工作、或能在永不联网回传的设备上工作的模型。

规格对比

• 价格 — Sakana Namazu 每100万token $0.95 / $4.00,而 Gemma 4 12B 下载免费,若租用托管则每100万token约 $0.10 / $0.30

• 权重 — Namazu 闭源、由供应商提供服务,而 Gemma 4 12B 开源(Apache 2.0),可自行托管、可微调

• 上下文 — Namazu 未公开,Gemma 4 12B 为 256K tokens(262,144),最高 262K 输出

• 模态 — Namazu 文本 + 图像 vs Gemma 4 12B 文本、图像、音频和视频帧(原生音频输入)

• 日语 — 针对敬语和商务文化微调的 Namazu 对比多语言通用模型 Gemma 4 12B

• 验证 — Namazu 仅厂商报告 vs Gemma 4 12B 独立测量(77.2 MMLU-Pro、78.8 GPQA Diamond,依据 BenchLM,2026 年 8 月)

A two-column scoreboard comparing Sakana Namazu and Gemma 4 12B: Namazu at $0.95/$4.00, hosted on Sakana's API, undisclosed context, keigo and culture tuning, vendor FairPoliticsQA 56.3%, no independent scores; Gemma 4 12B at ~$0.10/$0.30 hosted, Apache-2.0 open weights, 256K context, runs on 16 GB RAM, MMLU-Pro 77.2%, AA Intelligence 22, independently measured. Footer notes Namazu figures are vendor-reported and Gemma figures are per BenchLM/Artificial Analysis. OrcaRouter logo composited bottom-right.

Keigo 不是基准。

语言方面才是这两款模型真正产生分歧之处。Gemma 4 12B 是一款强大的多语言模型——Google 在 140 多种语言上进行了训练——但多语言并不等同于符合日本文化。Sakana Namazu 的微调则专门针对语域:敬语在正式邮件中依然得体、行业术语准确呈现、对政治敏感历史问题的回答不带有他国框架(Sakana 内部的 FairPoliticsQA 评分从 34.10% 跃升至 56.30%)。如果你的工作负载是面向日本客户的文本,那这就是产品差异,而非规格差异。如果你的工作负载是通用型的——摘要、分类、抽取、音频转录——Gemma 4 12B 的原生音频能力和更大的上下文窗口,使其具备 Namazu 并未宣称的广度。

谁能看到数据

隐私对比结果明显偏向 {{1}}Gemma 4 12B{{/1}}。在本地运行,数据就不会离开设备——没有遥测、没有训练声明,也没有司法管辖问题。相比之下,{{2}}Sakana Namazu{{/2}} 默认会将你的输入用于训练(可在控制台中选择退出),不保证仅在日本境内处理,而且完全不在 {{3}}欧盟/欧洲经济区、英国或瑞士{{/3}} 提供服务。对于处理客户个人身份信息(PII)的日本企业来说,“模型就运行在我们的笔记本电脑上”是当前任何托管 API 都无法比拟的合规叙事。对于无法运行或维护自身推理系统的企业,情况则恰恰相反:内置工具的托管 API 才是唯一现实的选择。

A pricing card for Sakana Namazu v1.0 showing $0.95 input, $4.00 output, and $0.15 cached input per 1M tokens, web search at $7.00 per 1,000 calls, code execution at $0.12 per hour, and a note that the model is not available in the EU/EEA, UK, or Switzerland and may train on inputs by default.

天花板问题

对 Gemma 4 12B 所有权优势的诚实制衡,是能力本身。12B 模型属于初级勤勉型:在 LiveCodeBench v6 上得分 72.0,在 Humanity's Last Exam 上天花板很低,而且在密集版式的文档 OCR 上存在可靠性问题。它是匹干活的马,而不是大脑。Sakana Namazu 继承了 Kimi K2.6 的推理下限——这是一个 1T 参数、前沿级别的基座模型,Artificial Analysis 将其排在开放权重领域的顶尖位置——但附带条件是 Namazu 自身的后训练增量全部由供应商自行报告。如果你的任务是高难度推理或长周期智能体,12B 模型就是一种制约;如果你的任务是高吞吐、范围明确的工作,它则是划算之选。

The Hugging Face model card for google/gemma-4-12B-it in English, showing Gemma 4 12B under the Apache 2.0 license from Google DeepMind, a 12B parameter model size, and 2.97M downloads in the last month, captured August 11, 2026.

呼叫

当边界条件比峰值能力更重要时,选择 Gemma 4 12B:数据绝不能离开你的网络、预算下限为零、需要离线运行,或者需要音频的多模态工作负载。当任务专门面向日语商务语言时,或者当你需要内置工具的智能体行为却又无法自行运维推理栈时,选择 Sakana Namazu。另外请注意,这两者都不是一键式决策:Gemma 4 12B 是开放权重,由你自己部署;Sakana Namazu 运行在 Sakana 自己的控制台上——因此,一个两者兼要的技术栈本身就已经是多模型架构了。在这种情况下,一个在单一 OpenAI 兼容端点背后代理 200+ 个模型并自动故障转移的路由器,就不再是锦上添花,而是架构本身。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube