一張生成的主視覺卡片,標題為「Claude Haiku 5.5 vs Sakana Namazu」,內含兩個並排面板。左側面板 Claude Haiku 5.5 列出「一般用途」、「每 1M $0.10 / $0.50」與「Index 43」。右側面板 Sakana Namazu 列出「日語專精」、「每 1M $0.95 / $4.00」與「僅供應商基準數據」。下方的全寬橫條寫著「同樣又快又便宜的形態,專精領域卻截然相反」。頁腳寫著「Index 數據來自 Artificial Analysis;Namazu 數據來自 Sakana AI,未經審計」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對上 Sakana Namazu:兩者都便宜、都快速,除此之外幾乎沒有共同點

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

表面上,這兩者看起來像是同級產品。Claude Haiku 5.5是該廠商的小型快速層級,於 2026 年 10 月 7 日推出,每百萬輸入 token 為 $0.10、每百萬輸出 token 為 $0.50,具備一百萬 token 的上下文視窗,專為分類、擷取、路由與子代理工作而打造。Sakana Namazu是 Sakana AI 的日語專精 API 模型,於 2026 年 8 月 3 日推出,計費為每百萬輸入 token $0.95、每百萬輸出 token $4.00,快取輸入費率為 $0.15;它以開源的 Kimi K2.6 基礎模型為底,加上 Sakana 自家的後訓練進行精調,並可透過與 OpenAI 相容的端點取用。

它們在各自的產品陣容中都被定位為實惠選項,而相似之處僅止於此。Claude Haiku 5.5 是當你需要路由流量時會選用的通用型西方模型;Sakana Namazu 則是當任務是日語,而替代方案是一個會把它做得很差的通用模型時,你會選用的特定國家特化模型。有趣的問題不是哪一個更好,而是特化模型能為你帶來什麼、這種特化的界線究竟落在何處,以及離開它要付出什麼代價。

Sakana AI 實際上打造了什麼

在把 Sakana Namazu 與任何東西相比之前,它值得先被理解,因為它的建構方式很不尋常。它不是從零開始訓練的。它是對一個既有開放權重模型——Kimi K2.6——的精煉版本,Sakana 對其進行了進一步的後訓練,並以封閉 API 的形式提供服務。其血統很重要:基礎模型的一般推理與程式編寫能力是繼承而來的,而 Sakana 所添加的是日本專屬的層面。

那一層是有文件記錄的,而這是大多數本地化宣稱所沒有的。Sakana 報告指出,Namazu 在一般評估——AIME26、MMLU-Pro、LiveCodeBench v6——上保留了基礎模型的效能,同時在日語及日本特定資料集上超越它,FairPoliticsQA 從 34.10% 上升到 56.30%。它運行自家的內部日語翻譯基準 JFBench,並報告在該基準上也全面有所提升。另一項個案研究——一個供醫師使用的證據查找工具——報告在第 119 屆全國醫學考試中達到 96.8%,在第 120 屆達到 96.4%。

那些是 Sakana 在 Sakana 自家基準測試上的數字,而 JFBench 並非任何人都能重現的公開標準。在那個但書之下仍站得住腳的主張雖然狹窄,卻很真實:該模型是一個具名基礎模型,加上一個有文件記錄的後訓練步驟,而且所回報的差異是相對於它自己的基礎模型,而不是相對於整個領域。

決定多數商業案例的關鍵,在於 API 與商業條款。Namazu 與 OpenAI 相容——根據 Sakana 自家的說明文件,唯一需要更動的程式碼,就是更換端點與 sakana-namazu 模型名稱。它以美元計費,並在 Enterprise 方案提供日圓付款。它還帶有按 token 計價比較永遠無法浮現的工具成本:每千次網頁搜尋收費 7.00 美元,每小時程式碼執行收費 0.12 美元,而 Sakana 將這些成本一併包入產品中。

有兩項限制比價目表上的任何數字都更重要。根據 Sakana 自家頁面,Namazu 在完成 GDPR 相關合規工作之前,不會在歐盟、歐洲經濟區、英國或瑞士提供。而預設的資料處理政策指出,輸入內容可能會被用於訓練與改進 Sakana 的模型,並可在 Console 設定中選擇退出;該公司表示,目前無法保證處理過程完全留在日本境內。對歐洲或英國團隊而言,第一點就足以讓它出局,第二點則是在第一次通話前就得先釐清的問題。

這條界線,坦白說

這是規格表比較會騙你的部分,所以以下是真正能比較的地方:

• 價格 — Claude Haiku 5.5 每百萬個 token 輸入 $0.10、輸出 $0.50,提示最多 100,000 個 token;之後為 $0.50 與 $2.50。Sakana Namazu 為 $0.95 與 $4.00,並有 $0.15 的快取輸入費率。在第一級方案中,Namazu 的輸入大約貴九點五倍,輸出貴八倍。

• 快取 — Claude Haiku 5.5 的快取讀取費用依層級為每百萬 $0.01 和 $0.05;Sakana Namazu 則一律為 $0.15。最高層級的絕對數字相近,最低層級則相差二十九倍。

• 工具 — 兩者都不是單純的文字模型,收費方式也各不相同。Claude Haiku 5.5 隨附自適應思考功能,具備從 Low 到 Max 的努力程度調節,以及伺服器端工具支援;Sakana Namazu 則以每千次呼叫 7.00 美元的價格提供網頁搜尋,並以每小時 0.12 美元提供程式碼執行。

• 上下文 —— Claude Haiku 5.5 可容納一百萬個 token。Sakana 並未公布 Namazu 的上下文視窗,而任何你看到被引用的數字,都只是對 Kimi K2.6 基礎模型的假設,而非官方規格。

• 獨立評分 — Claude Haiku 5.5 在 Artificial Analysis Intelligence Index 上得分為 43,在該排行榜的同級別中於 182 個裡排名第二,每項 Intelligence Index 任務成本為 $0.21。Sakana Namazu 沒有 Artificial Analysis 的收錄條目,我也找不到任何形式的第三方評估。它公布的數字都是自行提供的。

• 可用性 — Claude Haiku 5.5 可在 Claude API、Amazon Bedrock、Vertex AI、Microsoft Foundry 及 Claude Platform on AWS 上使用,並已公開承諾退役日期不早於 2027 年 10 月 7 日。Sakana Namazu 可在 Sakana 自家的 API、Sakana Chat 和 Sakana Translate 產品上使用,且在歐盟、歐洲經濟區、英國和瑞士無法使用。

• 資料處理 — 供應商的條款符合企業級標準,而模型的思考區塊僅限於產生它們的帳戶使用。Sakana Namazu 的預設是輸入內容可能用於訓練,並提供退出選項。

• 模態 — Claude Haiku 5.5 可接受文字與圖像;Sakana Namazu 除了其文字優先的定位外,並未公布其模態涵蓋範圍。

• 授權與系譜 — Claude Haiku 5.5 為專有且僅限 API。Sakana Namazu 雖為專有,但建立於開放的 Kimi K2.6 權重之上,這意味著其基礎可受檢視,而經調校的模型則不然。

誠實評分問題

讀一下那份清單,並注意少了什麼:任何寫著哪個模型能產生更好的日文輸出的句子。那不是疏忽。它們之間沒有能為這件事定論的共同基準。Claude Haiku 5.5 優異的日文表現,並不是廠商會拿來當作主打宣傳的賣點,而 Sakana 的 JFBench 數字則是它自家的量測工具。一個來自具備強大多語言能力廠商的一般前沿級小型模型,對上一個以 Kimi 為基礎、專門針對日文做後訓練的模型,這種比較是沒有人實際跑過並發表過的。

可以說的是結構性的,而非實證性的。Namazu 的整個商業定位,就是一項主張:通用模型不足以勝任日語工作——特定國家的語言、文化推論與本地脈絡是一項獨特能力,足以證明專門模型收取九倍價格溢價是合理的。你若相信這項主張,Namazu 就是答案,而這個價格就是該答案的代價。你若不信,就使用每百萬個 token 要價 $0.10 的通用模型,而問題在於你是否能用自己的流量衡量出差異。

Sakana 所提供的是這項宣稱中可量化的版本:FairPoliticsQA 從 34.10% 提升到 56.30%,而這是相較於它微調前的基礎模型。這在一個真實的基準上是實實在在的進步,但它是與 Kimi K2.6 相比,而不是與 Claude Haiku 5.5 相比——而且它告訴你,針對日本特定政治脈絡的後訓練在該任務上帶來了實質進展,這是比「日語更強」更狹義、卻也更站得住腳的陳述。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Sakana Namazu - the scoreboard', with six rows carrying both sides. Input price: $0.10 / 1M against $0.95 / 1M. Output price: $0.50 / 1M against $4.00 / 1M. Cached input: $0.01 to $0.05 / 1M against $0.15 / 1M. Focus: general purpose against Japanese language and context. Lineage: proprietary against Kimi K2.6 post-trained. Independent index: 43 against no entry. The footer reads 'Claude Haiku 5.5 index per Artificial Analysis; Namazu figures per vendor.' The OrcaRouter logo is composited in the bottom-right corner.

成本差距在大規模下會是什麼樣子

每天讓一條規模不大的管線,透過兩者處理 1,000 萬個輸入 token 和 200 萬個輸出 token。

• 每日輸入成本 — Claude Haiku 5.5 為 $1.00,Sakana Namazu 為 $9.50。

• 輸出成本,每日 — 在 Claude Haiku 5.5 上為 $1.00,在 Sakana Namazu 上為 $8.00。

• 每日總計 — $2.00 對比 $17.50,每月約 $60 對比 $525。

那筆 $525 還不包含任何一次網路搜尋呼叫或一小時的程式碼執行。每天加上 500 次搜尋呼叫後,Namazu 每天還要多花 $3.50,使其來到 $21.00,對比 $2.00——超過十比一的差距,再多的 token 效率也無法弭平。

那算不算多,完全取決於替代方案是什麼。如果你的選擇是 Namazu,或是產出平庸日文、還得讓審查人員手動修正的通用模型,那麼這 $525 買回的是審查人員的工時,比較基準就不是 token 對 token,而是 token 對薪資。如果你的日文流量很例行,而且在通用模型上已經夠好,那麼這筆溢價買不到任何可衡量的東西,同樣的錢可以在別處買到十倍的量。

第三個選項對日語產品來說才是有意思的:在專門模型的宣稱成立之處使用專門模型——翻譯、國內語境、法規與政治文本——並用通用模型處理圍繞這些工作的大量任務。這不是妥協。這正是定價實際上所隱含的架構,因為 Namazu 的溢價是按 token 支付的,而沒有理由在分類上支付這筆溢價。

A headless capture of Anthropic's Claude Platform model documentation showing the Models overview comparison table with the Claude Haiku 5.5 column alongside Claude Fable 5.1, Claude Opus 5.5 and Claude Sonnet 5.5, including the 'From $0.10 / input MTok' and 'From $0.50 / output MTok' pricing rows, the 1M-token context window entry and the 'Fastest' comparative latency listing for Claude Haiku 5.5.

這兩款型號都不在我們的目錄中

我們應該把話說清楚,因為這類比較很容易夾帶一段關於可用性的說明:OrcaRouter 既不提供 Claude Haiku 5.5,也不提供 Sakana Namazu。Namazu 可透過 Sakana 自家的 API 取得,而 Claude Haiku 5.5 則可透過該供應商及各大雲端平台取得。這兩項事實都不會改變這項比較,因為這項比較所依據的是公開的費率、公開的能力與公開的限制條件。

在這種情況下,單一端點所扮演的角色比外掛更狹窄,也更誠實。它是混合架構中的通用模型那一條腿——你會把不需要專家的非日語分類與擷取流量導向這裡,而不必為此再建立第二個供應商關係。單一 API 串接 200 多個模型,供應商定價原封不動轉嫁、零加成,跨供應商自動容錯移轉,以及當該由請求的語言、而非應用程式來決定路由時所用的路由 DSL。如果你同時運行日語產品與英語產品,那就是你原本得親手打造的接縫。

哪一個,給誰?

當日語本身就是產品,而不是地區設定時,就選擇 Sakana Namazu——當你的審閱人員正在修正輸出時,當領域是國內法、醫學、政治或客戶服務時,當九倍的 token 溢價小於它能省下的修正成本時,以及當你的使用者位於歐盟、歐洲經濟區、英國與瑞士以外,或你的法律顧問已釐清資料處理問題時。

當工作性質通用、用量龐大,而且你想要的是獨立測量出的分數,而不是廠商提供的基準測試時,就選擇 Claude Haiku 5.5——當每百萬個 token 的 $0.10 與 $0.50 正好替你算好這筆帳時,當你在處理長文件而需要百萬 token 的脈絡視窗時,或者當「哪一個日文能力更好」的答案必須來自你自己的評估,而不是任一廠商的評估時。

這兩者其實算不上真正的競爭對手。一個是通用型模型,定價就是為了讓人持續使用;另一個是專用型模型,定價則是要讓人審慎使用。錯誤在於買下專用模型,去做通用模型早已做得很好的工作;而相反的錯誤——以為通用模型處理某個特定國家的語言與脈絡,能像專為此訓練的模型一樣好——正是 Sakana 整個業務所仰賴人們犯下的錯誤。

A headless capture of the OrcaRouter models catalogue page reading '207 models, 16 providers, one API key, one bill', with the filter sidebar showing input-modality counts, a pricing filter and a populated model list, and the panel that reads 'How to call any model' with an OpenAI-compatible curl sample pointing at https://api.orcarouter.ai/v1/chat/completions.