
Claude Haiku 5.5 vs Sakana Namazu: Đều rẻ, đều nhanh, gần như không có gì khác giống nhau
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 72 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 382 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Bề ngoài thì hai mô hình này trông như những đối thủ ngang tầm. Claude Haiku 5.5 là phân hạng nhỏ, nhanh của nhà cung cấp, ra mắt ngày 7 tháng 10 năm 2026 với giá $0,10 mỗi triệu token đầu vào và $0,50 mỗi triệu token đầu ra cùng cửa sổ một triệu token, được xây dựng cho phân loại, trích xuất, định tuyến và công việc của tác nhân con. Sakana Namazu là mô hình API chuyên biệt cho tiếng Nhật của Sakana AI, ra mắt ngày 3 tháng 8 năm 2026, được tính giá $0,95 mỗi triệu token đầu vào và $4,00 mỗi triệu token đầu ra với mức $0,15 cho đầu vào được lưu đệm, được tinh chỉnh dựa trên nền tảng mở Kimi K2.6 với quá trình hậu huấn luyện của chính Sakana, và khả dụng thông qua một endpoint tương thích OpenAI.
Cả hai đều được định vị là lựa chọn phải chăng trong dòng sản phẩm tương ứng của mình, và đó cũng chính là nơi mọi điểm tương đồng chấm dứt. Claude Haiku 5.5 là một mô hình phương Tây đa dụng mà bạn sẽ tìm đến để định tuyến lưu lượng; Sakana Namazu là một mô hình chuyên biệt cho một quốc gia mà bạn sẽ tìm đến khi tác vụ bằng tiếng Nhật và phương án thay thế là một mô hình đa dụng làm việc đó một cách tồi tệ. Câu hỏi thú vị không phải là cái nào tốt hơn. Mà là một mô hình chuyên biệt mang lại cho bạn điều gì, ranh giới của sự chuyên biệt đó thực sự nằm ở đâu, và cái giá phải trả để bước ra khỏi nó là gì.
Sakana AI thực sự đã xây dựng nên những gì
Sakana Namazu đáng để hiểu trước khi được đem so sánh với bất cứ thứ gì, vì cách nó được xây dựng rất khác thường. Nó không được huấn luyện từ đầu. Nó là một bản tinh chỉnh của một mô hình trọng số mở đã có — Kimi K2.6 — mô hình mà Sakana đã huấn luyện thêm, và Sakana cung cấp nó dưới dạng một API đóng. Nguồn gốc đóng vai trò quan trọng: năng lực suy luận tổng quát và lập trình của mô hình nền được kế thừa, còn điều Sakana bổ sung là lớp dành riêng cho Nhật Bản.
Lớp đó được ghi thành tài liệu, một điều mà hầu hết các tuyên bố về bản địa hóa không thể nói là có được. Sakana báo cáo rằng Namazu duy trì hiệu năng của mô hình cơ sở trên các đánh giá tổng quát — AIME26, MMLU-Pro, LiveCodeBench v6 — trong khi vượt trội hơn trên bộ tiếng Nhật và bộ đặc thù Nhật Bản, với FairPoliticsQA tăng từ 34,10% lên 56,30%. Nó vận hành benchmark dịch tiếng Nhật nội bộ của riêng mình, JFBench, và cũng báo cáo cải thiện trên mọi phương diện ở đó. Một nghiên cứu điển hình riêng biệt, một công cụ tra cứu bằng chứng cho bác sĩ, báo cáo đạt 96,8% trong kỳ thi y khoa quốc gia lần thứ 119 và 96,4% trong lần thứ 120.
Đó là những con số của Sakana trên các benchmark của Sakana, và JFBench không phải là một tiêu chuẩn công khai mà bất kỳ ai khác có thể tái tạo. Tuyên bố còn trụ được sau lưu ý đó thì hẹp nhưng có thật: mô hình là một mô hình nền có tên cụ thể cộng với một bước hậu huấn luyện đã được tài liệu hóa, và các mức chênh lệch được báo cáo là so với chính mô hình nền của nó chứ không phải so với mặt bằng chung của lĩnh vực.
API và các điều khoản thương mại là những phần sẽ quyết định phần lớn các trường hợp kinh doanh. Namazu tương thích với OpenAI — thay đổi endpoint và một sakana-namazu tên model là thay đổi mã duy nhất, theo tài liệu của chính Sakana. Nó tính phí bằng đô la Mỹ và cung cấp thanh toán bằng yên trên gói Enterprise. Nó cũng mang theo các chi phí công cụ mà so sánh theo token sẽ không bao giờ phát hiện ra: $7.00 mỗi nghìn lượt gọi tìm kiếm web và $0.12 mỗi giờ thực thi mã, mà Sakana gộp vào sản phẩm.
Có hai ràng buộc quan trọng hơn bất kỳ con số nào trên bảng giá. Namazu không khả dụng ở EU, EEA, Vương quốc Anh hoặc Thụy Sĩ trong khi chờ công việc tuân thủ liên quan đến GDPR, theo chính trang của Sakana. Và chính sách xử lý dữ liệu mặc định nêu rằng các đầu vào có thể được dùng để huấn luyện và cải thiện các mô hình của Sakana, với tùy chọn từ chối có sẵn trong cài đặt Console; công ty cho biết hiện không thể đảm bảo rằng việc xử lý diễn ra hoàn toàn trong Nhật Bản. Đối với một nhóm ở châu Âu hoặc Vương quốc Anh, điều thứ nhất là yếu tố loại trừ và điều thứ hai là câu hỏi cần trả lời trước cuộc gọi đầu tiên.
Ranh giới, nói một cách trung thực
Đây là phần mà việc so sánh thông số kỹ thuật sẽ đánh lừa bạn, vì vậy đây là những gì thực sự có thể so sánh được:
• Giá — Claude Haiku 5.5 $0,10 cho đầu vào và $0,50 cho đầu ra trên mỗi triệu token lên tới 100.000 token prompt, sau đó là $0,50 và $2,00. Sakana Namazu $0,95 và $4,00, với mức giá đầu vào cache là $0,15. Namazu đắt hơn khoảng chín lần rưỡi đối với đầu vào và tám lần đối với đầu ra ở bậc đầu tiên.
• Bộ nhớ đệm (caching) — chi phí đọc bộ nhớ đệm của Claude Haiku 5.5 là $0.01 và $0.05 mỗi triệu tùy theo bậc; còn của Sakana Namazu là $0.15 cố định. Các con số tuyệt đối khá gần nhau ở bậc cao nhất và cách nhau hai mươi chín lần ở bậc thấp nhất.
• Công cụ — cả hai đều không phải là một mô hình văn bản thuần túy và cả hai cũng không tính phí theo cùng một cách. Claude Haiku 5.5 cung cấp khả năng tư duy thích ứng với một núm điều chỉnh mức độ nỗ lực từ Low đến Max và hỗ trợ công cụ phía máy chủ; Sakana Namazu tích hợp sẵn tìm kiếm web với giá $7.00 cho mỗi một nghìn lượt gọi và thực thi mã với giá $0.12 mỗi giờ.
• Ngữ cảnh — một triệu token cho Claude Haiku 5.5. Sakana không công bố cửa sổ ngữ cảnh cho Namazu, và bất kỳ con số nào bạn thấy được trích dẫn cho nó đều là giả định về mô hình cơ sở Kimi K2.6 chứ không phải thông số kỹ thuật.
• Chấm điểm độc lập — Claude Haiku 5.5 có Artificial Analysis Intelligence Index là 43, đứng thứ hai trong số 182 trong cùng lớp trên bảng đó, với chi phí 0,21 USD cho mỗi tác vụ Artificial Analysis Intelligence Index. Sakana Namazu không có mục nào trên Artificial Analysis và không có bất kỳ đánh giá bên thứ ba nào thuộc bất kỳ loại nào mà tôi có thể tìm thấy. Các số liệu được công bố của nó là do chính nó đưa ra.
• Tính khả dụng — Claude Haiku 5.5 có mặt trên Claude API, Amazon Bedrock, Vertex AI, Microsoft Foundry và Claude Platform on AWS, với cam kết ngừng hoạt động đã công bố là không sớm hơn ngày 7 tháng 10 năm 2027. Sakana Namazu có mặt trên API riêng của Sakana, Sakana Chat và sản phẩm Sakana Translate, và không khả dụng tại EU, EEA, Vương quốc Anh và Thụy Sĩ.
• Xử lý dữ liệu — Điều khoản của nhà cung cấp theo tiêu chuẩn doanh nghiệp, và các khối tư duy của mô hình được giới hạn trong phạm vi tài khoản đã tạo ra chúng. Mặc định của Sakana Namazu là các đầu vào có thể được dùng để huấn luyện, kèm tùy chọn từ chối.
• Phương thức — Claude Haiku 5.5 xử lý văn bản và hình ảnh; phạm vi phương thức của Sakana Namazu không được công bố ngoài định hướng lấy văn bản làm trọng tâm.
• Giấy phép và nguồn gốc — Claude Haiku 5.5 là độc quyền và chỉ có sẵn qua API. Sakana Namazu là độc quyền nhưng được xây dựng trên các trọng số mở của Kimi K2.6, nghĩa là có thể kiểm tra phần nền còn mô hình đã tinh chỉnh thì không.
Vấn đề chấm điểm trung thực
Hãy đọc danh sách đó và để ý xem còn thiếu gì: bất kỳ dòng nào nói mô hình nào tạo ra đầu ra tiếng Nhật tốt hơn. Đó không phải là sự sơ suất. Không có benchmark chung nào giữa chúng có thể phân định điều đó. Hiệu năng tiếng Nhật mạnh mẽ của Claude Haiku 5.5 không phải là điều mà nhà cung cấp quảng bá như một tuyên bố nổi bật, và các con số JFBench của Sakana là công cụ đo lường riêng của họ. Một mô hình nhỏ tổng quát ở tầng tiên phong đến từ một nhà cung cấp có năng lực đa ngôn ngữ mạnh, được đánh giá đối chiếu với một mô hình dựa trên Kimi được hậu huấn luyện đặc biệt cho tiếng Nhật, là một so sánh mà chưa ai thực sự tiến hành và công bố.
Điều có thể nói là mang tính cấu trúc chứ không phải thực nghiệm. Toàn bộ bản sắc thương mại của Namazu nằm ở tuyên bố rằng một mô hình tổng quát không đủ tốt cho công việc tiếng Nhật — rằng ngôn ngữ đặc thù theo quốc gia, suy luận văn hóa và bối cảnh trong nước là một năng lực riêng biệt, đủ để biện minh cho một mô hình chuyên biệt với mức giá cao gấp chín lần. Nếu bạn tin vào tuyên bố đó, Namazu là câu trả lời, và cái giá phải trả chính là chi phí của câu trả lời đó. Nếu bạn không tin, một mô hình tổng quát với mức $0.10 mỗi triệu token là thứ bạn dùng, và câu hỏi là liệu bạn có thể đo lường sự khác biệt trên lưu lượng của chính mình hay không.
Phiên bản có thể đo lường được của tuyên bố là phiên bản của Sakana: FairPoliticsQA tăng từ 34,10% lên 56,0% trên mô hình cơ sở mà nó được tinh chỉnh từ đó. Đó là một cải thiện thực sự trên một benchmark thực sự, nhưng nó là so sánh với Kimi K2, không phải Claude Haiku 5.5 — và nó cho bạn biết rằng post-training cho bối cảnh chính trị đặc thù Nhật Bản tạo ra thay đổi đáng kể trên tác vụ đó, vốn là một phát biểu hẹp hơn và dễ bảo vệ hơn so với "giỏi tiếng Nhật hơn".

Chênh lệch chi phí trông như thế nào ở quy mô lớn
Chạy một pipeline vừa phải với 10 triệu token đầu vào và 2 triệu token đầu ra mỗi ngày qua cả hai.
• Chi phí đầu vào, mỗi ngày — 1,00 $ trên Claude Haiku 5.5, 9,50 $ trên Sakana Namazu.
• Chi phí đầu ra, mỗi ngày — 1,00 đô la trên Claude Haiku 5.5, 8,00 đô la trên Sakana Namazu.
• Tổng mỗi ngày — $2.00 so với $17.50, khoảng $60 một tháng so với $525.
Khoản $525 đó vẫn chưa tính đến một lượt gọi tìm kiếm web hay một giờ thực thi mã nào. Cộng thêm 500 lượt gọi tìm kiếm mỗi ngày thì Namazu tốn thêm $3.50 mỗi ngày, nâng nó lên $21.00 so với $2.00 — một tỷ lệ hơn mười trên một mà dù hiệu quả token có đến đâu cũng không thu hẹp được.
Việc đó có phải là một khoản lớn hay không phụ thuộc hoàn toàn vào phương án thay thế là gì. Nếu lựa chọn của bạn là Namazu hay một mô hình tổng quát tạo ra đầu ra tiếng Nhật tầm thường mà người đánh giá của bạn phải sửa thủ công, thì 525 đô-la đang mua lại số giờ của người đánh giá, và phép so sánh không phải là token với token, mà là token với tiền lương. Nếu lưu lượng tiếng Nhật của bạn là thông thường và đã đủ tốt trên một mô hình tổng quát, thì khoản phụ trội chẳng mang lại gì có thể đo lường được, và cùng số tiền đó có thể mua lượng gấp mười lần ở nơi khác.
Lựa chọn thứ ba mới là lựa chọn đáng chú ý đối với một sản phẩm ngôn ngữ Nhật: dùng mô hình chuyên biệt ở những chỗ mà tuyên bố về tính chuyên biệt còn đứng vững — dịch thuật, ngữ cảnh nội địa, văn bản pháp quy và chính trị — và dùng một mô hình tổng quát cho khối lượng công việc xoay quanh đó. Đó không phải là một sự thỏa hiệp. Đó chính là kiến trúc mà cách định giá thực sự hàm ý, bởi vì khoản phí cao cấp của Namazu được trả theo token và chẳng có lý do gì phải trả nó cho việc phân loại.

Cả hai mẫu đều không có trong danh mục của chúng tôi.
Chúng ta nên thẳng thắn về điều này, bởi đây là kiểu so sánh mà ở đó một đoạn về tính khả dụng rất dễ bị lén đưa vào: OrcaRouter không cung cấp Claude Haiku 5.5 lẫn Sakana Namazu. Namazu có sẵn qua API riêng của Sakana, còn Claude Haiku 5.5 thì qua API của nhà cung cấp và các đám mây lớn. Cả hai sự thật đó đều không làm thay đổi phép so sánh, vốn dựa trên các mức giá đã công bố, các năng lực đã công bố và các hạn chế đã công bố.
Vai trò mà một endpoint đảm nhận trong một trường hợp như thế này thì hẹp hơn và trung thực hơn so với một plug. Đó là chân mô hình tổng quát của một hybrid — nơi bạn sẽ định tuyến lưu lượng phân loại và trích xuất không phải tiếng Nhật, vốn không cần đến chuyên gia, mà không phải dựng lên một mối quan hệ nhà cung cấp thứ hai cho việc đó. Một API cho hơn 200 mô hình, bảng giá của nhà cung cấp được chuyển tiếp với mức markup 0%, tự động chuyển đổi dự phòng giữa các nhà cung cấp, và DSL định tuyến khi ngôn ngữ của yêu cầu nên quyết định tuyến thay vì ứng dụng. Nếu bạn đang vận hành một sản phẩm tiếng Nhật song song với một sản phẩm tiếng Anh, thì đó chính là đường nối mà nếu không có nó, bạn sẽ phải tự tay xây dựng.
Cái nào, cho ai
Chọn Sakana Namazu khi tiếng Nhật là sản phẩm chứ không phải chỉ là một locale — khi những người đánh giá của bạn đang sửa đầu ra, khi lĩnh vực là luật trong nước, y học, chính trị hoặc dịch vụ khách hàng, khi mức phụ trội token gấp chín lần vẫn nhỏ hơn chi phí của những chỉnh sửa mà nó loại bỏ, và khi người dùng của bạn ở ngoài EU, EEA, Vương quốc Anh và Thụy Sĩ hoặc bạn có cố vấn pháp lý đã giải quyết ổn thỏa vấn đề xử lý dữ liệu.
Chọn Claude Haiku 5.5 khi công việc mang tính phổ thông, khối lượng lớn, và bạn muốn một điểm số được đo lường độc lập thay vì benchmark của nhà cung cấp — khi mức $0.10 và $0.50 mỗi triệu token đang tự làm phép tính thay bạn, khi bạn cần cửa sổ một triệu token cho một tài liệu dài, hoặc khi câu trả lời cho câu hỏi "mô hình nào giỏi tiếng Nhật hơn" phải đến từ đánh giá của chính bạn chứ không phải từ bất kỳ nhà cung cấp nào.
Hai mô hình này thực sự không phải là đối thủ của nhau. Một bên là mô hình đa dụng được định giá để dùng liên tục; bên kia là mô hình chuyên biệt được định giá để dùng một cách có chủ đích. Sai lầm là mua mô hình chuyên biệt cho công việc mà mô hình đa dụng vốn đã làm tốt, còn sai lầm ngược lại — cho rằng một mô hình tổng quát xử lý ngôn ngữ và bối cảnh của một quốc gia cụ thể tốt ngang với thứ được huấn luyện chuyên cho việc đó — chính là sai lầm mà toàn bộ hoạt động kinh doanh của Sakana được xây dựng dựa trên việc người ta mắc phải.

