
Sakana Namazu 對比 Gemma 4 12B:自主 API 或自有權重
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimax新MiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2143 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
Sakana Namazu 和 Gemma 4 12B 從相反的兩端回答同一個問題:取得真正有用的日語模型行為,最便宜的方式是什麼?Sakana Namazu 是託管式 API — Kimi K2.6 專為日本商業文化進行後訓練,每百萬 tokens 收費 $0.95 / $4.00,內建網頁搜尋與程式執行。Gemma 4 12B 是 Google 的開放權重 120 億參數多模態模型,採用 Apache 2.0,小到可以在 16 GB 記憶體的機器上執行,而且免費下載。一個要求你信任供應商的主控台;另一個則要求你信任自己的硬體。
對於「這個在哪裡運行」有兩種不同的答案。
Sakana Namazu 是一個產品:你註冊、換掉 base_url,然後模型——經過調校、部署、工具化——就緒。Gemma 4 12B 是原材料:你拉取權重,之後的一切都是你的問題,從推理引擎(vLLM、llama.cpp、Ollama、MLX、SGLang 都能用)到 GPU。這個差異不是註腳;它決定了整個比較。12B 密集模型屬於筆電領域——Google 設計這款模型時讓它能在約 16 GB 記憶體中運行——這使得 Gemma 4 12B 是這兩者中唯一能離線運作、在氣隙機器上運作、或在永不回傳資料的設備上運作的。
規格對比
• 價格 — Sakana Namazu 每 1M tokens 為 $0.95 / $4.00;Gemma 4 12B 下載免費,若租用主機則每 1M tokens 約 $0.10 / $0.30
• 權重 — Namazu 封閉、由供應商提供,對比 Gemma 4 12B 開放(Apache 2.0)、可自行部署、可微調
• 上下文 — Namazu 未公開 vs Gemma 4 12B 256K tokens (262,144),最高 262K 輸出
• 模態 — Namazu 文字 + 影像 vs Gemma 4 12B 文字、影像、音訊,以及視訊幀(原生音訊輸入)
• 日語 — 針對敬語與商業文化調校的 Namazu,對比多語言通用模型 Gemma 4 12B
• 驗證 — 僅 Namazu 廠商回報 vs Gemma 4 12B 獨立實測(根據 BenchLM,2026 年 8 月:MMLU-Pro 77.2、GPQA Diamond 78.8)

Keigo 不是基準
語言能力正是兩款模型真正產生分歧之處。Gemma 4 12B 是一款強大的多語言模型——Google 以超過 140 種語言訓練它——但多語言並不等於深諳日本文化。Sakana Namazu 的調校特別聚焦於語域:能撐過正式郵件的敬語、正確呈現的產業術語,以及對政治敏感的歷史議題不會帶有他國框架的回答(Sakana 內部的 FairPoliticsQA 分數從 34.10% 躍升至 56.30%)。如果你的工作負載是面向日本客戶的文字,那是產品差異,而非規格差異。如果你的工作負載是一般用途——摘要、分類、抽取、音訊轉錄——Gemma 4 12B 的原生音訊與更大的上下文範圍,賦予它 Namazu 未能企及的廣度。
誰能看到資料
隱私權比較結果{{1}}明顯有利於 Gemma 4 12B{{/1}}。在本機執行時,沒有任何資料會離開裝置——沒有遙測、沒有訓練聲明、沒有管轄權問題。相較之下,Sakana Namazu 預設會使用你的輸入內容進行訓練(可在主控台中選擇退出),不保證僅在日本境內處理,而且在歐盟/歐洲經濟區、英國或瑞士完全無法使用。對於處理客戶個人識別資訊(PII)的日本企業而言,{{2}}"模型就在我們的筆電上"{{/2}}是現今任何託管 API 都無法比擬的合規優勢。對於無法自行執行或維護推論的企業而言,{{3}}情況正好相反{{/3}}:內建工具的託管 API 是唯一現實的選擇。

天花板問題
對 Gemma 4 12B 的所有權優勢而言,誠實的制衡點在於能力。12B 模型屬於初階勤奮型:LiveCodeBench v6 得分 72.0,Humanity's Last Exam 的天花板很低,且在密集排版的文件上存在文件 OCR 可靠性問題。它是苦力型工具,而非大腦。Sakana Namazu 繼承了 Kimi K2.6 的推理下限——這是一個 1T 參數的前沿級基礎模型,Artificial Analysis 將其評為開放權重領域的頂尖——但前提是 Namazu 自身的後訓練增量完全由廠商自行宣稱。如果你的任務是困難推理或長程代理任務,12B 模型是一項限制;如果你的任務是高流量且範圍明確,它則是划算的選擇。

那通電話
當邊界條件比峰值能力更重要時,選擇 Gemma 4 12B:資料絕不能離開你的網路、預算下限為零、需要離線運作,或是有音訊需求的多模態工作負載。當任務特別針對日語商業語言,或你需要內建工具的代理式行為、且無法自行營運推論堆疊時,選擇 Sakana Namazu。另請注意,兩者都不是一鍵可決的選擇:Gemma 4 12B 是開放權重、由你自行部署;Sakana Namazu 則在 Sakana 自家的主控台上執行——因此,一個兩者都要的技術棧,本身就是多模型技術棧。到了這個地步,一個以單一 OpenAI 相容端點面向 200+ 模型、並自動容錯移轉的路由器,就不再是錦上添花,而是成為架構本身。
