
Claude Haiku 5.5 對上 Sakana Namazu:兩者都便宜、都快速,除此之外幾乎沒有共同點
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 72 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 382 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
表面上,這兩者看起來像是同級產品。Claude Haiku 5.5是該廠商的小型快速層級,於 2026 年 10 月 7 日推出,每百萬輸入 token 為 $0.10、每百萬輸出 token 為 $0.50,具備一百萬 token 的上下文視窗,專為分類、擷取、路由與子代理工作而打造。Sakana Namazu是 Sakana AI 的日語專精 API 模型,於 2026 年 8 月 3 日推出,計費為每百萬輸入 token $0.95、每百萬輸出 token $4.00,快取輸入費率為 $0.15;它以開源的 Kimi K2.6 基礎模型為底,加上 Sakana 自家的後訓練進行精調,並可透過與 OpenAI 相容的端點取用。
它們在各自的產品陣容中都被定位為實惠選項,而相似之處僅止於此。Claude Haiku 5.5 是當你需要路由流量時會選用的通用型西方模型;Sakana Namazu 則是當任務是日語,而替代方案是一個會把它做得很差的通用模型時,你會選用的特定國家特化模型。有趣的問題不是哪一個更好,而是特化模型能為你帶來什麼、這種特化的界線究竟落在何處,以及離開它要付出什麼代價。
Sakana AI 實際上打造了什麼
在把 Sakana Namazu 與任何東西相比之前,它值得先被理解,因為它的建構方式很不尋常。它不是從零開始訓練的。它是對一個既有開放權重模型——Kimi K2.6——的精煉版本,Sakana 對其進行了進一步的後訓練,並以封閉 API 的形式提供服務。其血統很重要:基礎模型的一般推理與程式編寫能力是繼承而來的,而 Sakana 所添加的是日本專屬的層面。
那一層是有文件記錄的,而這是大多數本地化宣稱所沒有的。Sakana 報告指出,Namazu 在一般評估——AIME26、MMLU-Pro、LiveCodeBench v6——上保留了基礎模型的效能,同時在日語及日本特定資料集上超越它,FairPoliticsQA 從 34.10% 上升到 56.30%。它運行自家的內部日語翻譯基準 JFBench,並報告在該基準上也全面有所提升。另一項個案研究——一個供醫師使用的證據查找工具——報告在第 119 屆全國醫學考試中達到 96.8%,在第 120 屆達到 96.4%。
那些是 Sakana 在 Sakana 自家基準測試上的數字,而 JFBench 並非任何人都能重現的公開標準。在那個但書之下仍站得住腳的主張雖然狹窄,卻很真實:該模型是一個具名基礎模型,加上一個有文件記錄的後訓練步驟,而且所回報的差異是相對於它自己的基礎模型,而不是相對於整個領域。
決定多數商業案例的關鍵,在於 API 與商業條款。Namazu 與 OpenAI 相容——根據 Sakana 自家的說明文件,唯一需要更動的程式碼,就是更換端點與 sakana-namazu 模型名稱。它以美元計費,並在 Enterprise 方案提供日圓付款。它還帶有按 token 計價比較永遠無法浮現的工具成本:每千次網頁搜尋收費 7.00 美元,每小時程式碼執行收費 0.12 美元,而 Sakana 將這些成本一併包入產品中。
有兩項限制比價目表上的任何數字都更重要。根據 Sakana 自家頁面,Namazu 在完成 GDPR 相關合規工作之前,不會在歐盟、歐洲經濟區、英國或瑞士提供。而預設的資料處理政策指出,輸入內容可能會被用於訓練與改進 Sakana 的模型,並可在 Console 設定中選擇退出;該公司表示,目前無法保證處理過程完全留在日本境內。對歐洲或英國團隊而言,第一點就足以讓它出局,第二點則是在第一次通話前就得先釐清的問題。
這條界線,坦白說
這是規格表比較會騙你的部分,所以以下是真正能比較的地方:
• 價格 — Claude Haiku 5.5 每百萬個 token 輸入 $0.10、輸出 $0.50,提示最多 100,000 個 token;之後為 $0.50 與 $2.50。Sakana Namazu 為 $0.95 與 $4.00,並有 $0.15 的快取輸入費率。在第一級方案中,Namazu 的輸入大約貴九點五倍,輸出貴八倍。
• 快取 — Claude Haiku 5.5 的快取讀取費用依層級為每百萬 $0.01 和 $0.05;Sakana Namazu 則一律為 $0.15。最高層級的絕對數字相近,最低層級則相差二十九倍。
• 工具 — 兩者都不是單純的文字模型,收費方式也各不相同。Claude Haiku 5.5 隨附自適應思考功能,具備從 Low 到 Max 的努力程度調節,以及伺服器端工具支援;Sakana Namazu 則以每千次呼叫 7.00 美元的價格提供網頁搜尋,並以每小時 0.12 美元提供程式碼執行。
• 上下文 —— Claude Haiku 5.5 可容納一百萬個 token。Sakana 並未公布 Namazu 的上下文視窗,而任何你看到被引用的數字,都只是對 Kimi K2.6 基礎模型的假設,而非官方規格。
• 獨立評分 — Claude Haiku 5.5 在 Artificial Analysis Intelligence Index 上得分為 43,在該排行榜的同級別中於 182 個裡排名第二,每項 Intelligence Index 任務成本為 $0.21。Sakana Namazu 沒有 Artificial Analysis 的收錄條目,我也找不到任何形式的第三方評估。它公布的數字都是自行提供的。
• 可用性 — Claude Haiku 5.5 可在 Claude API、Amazon Bedrock、Vertex AI、Microsoft Foundry 及 Claude Platform on AWS 上使用,並已公開承諾退役日期不早於 2027 年 10 月 7 日。Sakana Namazu 可在 Sakana 自家的 API、Sakana Chat 和 Sakana Translate 產品上使用,且在歐盟、歐洲經濟區、英國和瑞士無法使用。
• 資料處理 — 供應商的條款符合企業級標準,而模型的思考區塊僅限於產生它們的帳戶使用。Sakana Namazu 的預設是輸入內容可能用於訓練,並提供退出選項。
• 模態 — Claude Haiku 5.5 可接受文字與圖像;Sakana Namazu 除了其文字優先的定位外,並未公布其模態涵蓋範圍。
• 授權與系譜 — Claude Haiku 5.5 為專有且僅限 API。Sakana Namazu 雖為專有,但建立於開放的 Kimi K2.6 權重之上,這意味著其基礎可受檢視,而經調校的模型則不然。
誠實評分問題
讀一下那份清單,並注意少了什麼:任何寫著哪個模型能產生更好的日文輸出的句子。那不是疏忽。它們之間沒有能為這件事定論的共同基準。Claude Haiku 5.5 優異的日文表現,並不是廠商會拿來當作主打宣傳的賣點,而 Sakana 的 JFBench 數字則是它自家的量測工具。一個來自具備強大多語言能力廠商的一般前沿級小型模型,對上一個以 Kimi 為基礎、專門針對日文做後訓練的模型,這種比較是沒有人實際跑過並發表過的。
可以說的是結構性的,而非實證性的。Namazu 的整個商業定位,就是一項主張:通用模型不足以勝任日語工作——特定國家的語言、文化推論與本地脈絡是一項獨特能力,足以證明專門模型收取九倍價格溢價是合理的。你若相信這項主張,Namazu 就是答案,而這個價格就是該答案的代價。你若不信,就使用每百萬個 token 要價 $0.10 的通用模型,而問題在於你是否能用自己的流量衡量出差異。
Sakana 所提供的是這項宣稱中可量化的版本:FairPoliticsQA 從 34.10% 提升到 56.30%,而這是相較於它微調前的基礎模型。這在一個真實的基準上是實實在在的進步,但它是與 Kimi K2.6 相比,而不是與 Claude Haiku 5.5 相比——而且它告訴你,針對日本特定政治脈絡的後訓練在該任務上帶來了實質進展,這是比「日語更強」更狹義、卻也更站得住腳的陳述。

成本差距在大規模下會是什麼樣子
每天讓一條規模不大的管線,透過兩者處理 1,000 萬個輸入 token 和 200 萬個輸出 token。
• 每日輸入成本 — Claude Haiku 5.5 為 $1.00,Sakana Namazu 為 $9.50。
• 輸出成本,每日 — 在 Claude Haiku 5.5 上為 $1.00,在 Sakana Namazu 上為 $8.00。
• 每日總計 — $2.00 對比 $17.50,每月約 $60 對比 $525。
那筆 $525 還不包含任何一次網路搜尋呼叫或一小時的程式碼執行。每天加上 500 次搜尋呼叫後,Namazu 每天還要多花 $3.50,使其來到 $21.00,對比 $2.00——超過十比一的差距,再多的 token 效率也無法弭平。
那算不算多,完全取決於替代方案是什麼。如果你的選擇是 Namazu,或是產出平庸日文、還得讓審查人員手動修正的通用模型,那麼這 $525 買回的是審查人員的工時,比較基準就不是 token 對 token,而是 token 對薪資。如果你的日文流量很例行,而且在通用模型上已經夠好,那麼這筆溢價買不到任何可衡量的東西,同樣的錢可以在別處買到十倍的量。
第三個選項對日語產品來說才是有意思的:在專門模型的宣稱成立之處使用專門模型——翻譯、國內語境、法規與政治文本——並用通用模型處理圍繞這些工作的大量任務。這不是妥協。這正是定價實際上所隱含的架構,因為 Namazu 的溢價是按 token 支付的,而沒有理由在分類上支付這筆溢價。

這兩款型號都不在我們的目錄中
我們應該把話說清楚,因為這類比較很容易夾帶一段關於可用性的說明:OrcaRouter 既不提供 Claude Haiku 5.5,也不提供 Sakana Namazu。Namazu 可透過 Sakana 自家的 API 取得,而 Claude Haiku 5.5 則可透過該供應商及各大雲端平台取得。這兩項事實都不會改變這項比較,因為這項比較所依據的是公開的費率、公開的能力與公開的限制條件。
在這種情況下,單一端點所扮演的角色比外掛更狹窄,也更誠實。它是混合架構中的通用模型那一條腿——你會把不需要專家的非日語分類與擷取流量導向這裡,而不必為此再建立第二個供應商關係。單一 API 串接 200 多個模型,供應商定價原封不動轉嫁、零加成,跨供應商自動容錯移轉,以及當該由請求的語言、而非應用程式來決定路由時所用的路由 DSL。如果你同時運行日語產品與英語產品,那就是你原本得親手打造的接縫。
哪一個,給誰?
當日語本身就是產品,而不是地區設定時,就選擇 Sakana Namazu——當你的審閱人員正在修正輸出時,當領域是國內法、醫學、政治或客戶服務時,當九倍的 token 溢價小於它能省下的修正成本時,以及當你的使用者位於歐盟、歐洲經濟區、英國與瑞士以外,或你的法律顧問已釐清資料處理問題時。
當工作性質通用、用量龐大,而且你想要的是獨立測量出的分數,而不是廠商提供的基準測試時,就選擇 Claude Haiku 5.5——當每百萬個 token 的 $0.10 與 $0.50 正好替你算好這筆帳時,當你在處理長文件而需要百萬 token 的脈絡視窗時,或者當「哪一個日文能力更好」的答案必須來自你自己的評估,而不是任一廠商的評估時。
這兩者其實算不上真正的競爭對手。一個是通用型模型,定價就是為了讓人持續使用;另一個是專用型模型,定價則是要讓人審慎使用。錯誤在於買下專用模型,去做通用模型早已做得很好的工作;而相反的錯誤——以為通用模型處理某個特定國家的語言與脈絡,能像專為此訓練的模型一樣好——正是 Sakana 整個業務所仰賴人們犯下的錯誤。

