
Sakana Namazu 对比 Gemma 4 12B:主权API还是你拥有的权重
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimax新MiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 2143 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
Sakana Namazu 和 Gemma 4 12B 从相反的角度回答了同一个问题:以最便宜的方式获得真正有用的日语模型行为是什么?Sakana Namazu 是一种托管 API——Kimi K2.6 针对日本商业文化进行了后训练,每百万个 token 0.95 美元 / 4.00 美元,内置网络搜索和代码执行功能。Gemma 4 12B 是 Google 的开源权重 120 亿参数多模态模型,采用 Apache 2.0 许可,体积小到可以在 16 GB 内存的机器上运行,并且可以免费下载。一个要求你信任供应商的控制台;另一个要求你信任自己的硬件。
“这在哪里运行”的两个不同答案
Sakana Namazu 是一个产品:你注册,替换 base_url,模型——经过调优、部署、工具化——就在那里。Gemma 4 12B 是原材料:你拉取权重,之后的一切都是你的问题,从推理引擎(vLLM、llama.cpp、Ollama、MLX、SGLang 都能用)到 GPU。这个差别不是脚注;它决定了整个对比。12B 稠密模型属于笔记本电脑的范畴——Google 设计它时预计在约 16 GB 内存中运行——这使得 Gemma 4 12B 成为这两者中唯一能离线工作、能在气隙隔离的机器上工作、或能在永不联网回传的设备上工作的模型。
规格对比
• 价格 — Sakana Namazu 每100万token $0.95 / $4.00,而 Gemma 4 12B 下载免费,若租用托管则每100万token约 $0.10 / $0.30
• 权重 — Namazu 闭源、由供应商提供服务,而 Gemma 4 12B 开源(Apache 2.0),可自行托管、可微调
• 上下文 — Namazu 未公开,Gemma 4 12B 为 256K tokens(262,144),最高 262K 输出
• 模态 — Namazu 文本 + 图像 vs Gemma 4 12B 文本、图像、音频和视频帧(原生音频输入)
• 日语 — 针对敬语和商务文化微调的 Namazu 对比多语言通用模型 Gemma 4 12B
• 验证 — Namazu 仅厂商报告 vs Gemma 4 12B 独立测量(77.2 MMLU-Pro、78.8 GPQA Diamond,依据 BenchLM,2026 年 8 月)

Keigo 不是基准。
语言方面才是这两款模型真正产生分歧之处。Gemma 4 12B 是一款强大的多语言模型——Google 在 140 多种语言上进行了训练——但多语言并不等同于符合日本文化。Sakana Namazu 的微调则专门针对语域:敬语在正式邮件中依然得体、行业术语准确呈现、对政治敏感历史问题的回答不带有他国框架(Sakana 内部的 FairPoliticsQA 评分从 34.10% 跃升至 56.30%)。如果你的工作负载是面向日本客户的文本,那这就是产品差异,而非规格差异。如果你的工作负载是通用型的——摘要、分类、抽取、音频转录——Gemma 4 12B 的原生音频能力和更大的上下文窗口,使其具备 Namazu 并未宣称的广度。
谁能看到数据
隐私对比结果明显偏向 {{1}}Gemma 4 12B{{/1}}。在本地运行,数据就不会离开设备——没有遥测、没有训练声明,也没有司法管辖问题。相比之下,{{2}}Sakana Namazu{{/2}} 默认会将你的输入用于训练(可在控制台中选择退出),不保证仅在日本境内处理,而且完全不在 {{3}}欧盟/欧洲经济区、英国或瑞士{{/3}} 提供服务。对于处理客户个人身份信息(PII)的日本企业来说,“模型就运行在我们的笔记本电脑上”是当前任何托管 API 都无法比拟的合规叙事。对于无法运行或维护自身推理系统的企业,情况则恰恰相反:内置工具的托管 API 才是唯一现实的选择。

天花板问题
对 Gemma 4 12B 所有权优势的诚实制衡,是能力本身。12B 模型属于初级勤勉型:在 LiveCodeBench v6 上得分 72.0,在 Humanity's Last Exam 上天花板很低,而且在密集版式的文档 OCR 上存在可靠性问题。它是匹干活的马,而不是大脑。Sakana Namazu 继承了 Kimi K2.6 的推理下限——这是一个 1T 参数、前沿级别的基座模型,Artificial Analysis 将其排在开放权重领域的顶尖位置——但附带条件是 Namazu 自身的后训练增量全部由供应商自行报告。如果你的任务是高难度推理或长周期智能体,12B 模型就是一种制约;如果你的任务是高吞吐、范围明确的工作,它则是划算之选。

呼叫
当边界条件比峰值能力更重要时,选择 Gemma 4 12B:数据绝不能离开你的网络、预算下限为零、需要离线运行,或者需要音频的多模态工作负载。当任务专门面向日语商务语言时,或者当你需要内置工具的智能体行为却又无法自行运维推理栈时,选择 Sakana Namazu。另外请注意,这两者都不是一键式决策:Gemma 4 12B 是开放权重,由你自己部署;Sakana Namazu 运行在 Sakana 自己的控制台上——因此,一个两者兼要的技术栈本身就已经是多模型架构了。在这种情况下,一个在单一 OpenAI 兼容端点背后代理 200+ 个模型并自动故障转移的路由器,就不再是锦上添花,而是架构本身。
