
Fugu Max vs Claude Opus 5: rẻ hơn bốn lần, và một con số chưa từng được công bố
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Max tốn 6,00 USD để tạo ra một triệu token đầu ra. Claude Opus 5 tốn 25,00 USD. Sakana AI đã phát hành Fugu Max vào ngày 11 tháng 9 năm 2026 như một bộ điều phối định tuyến từng tác vụ đến mô hình tinh gọn nhất trong nhóm của nó, và định giá nó đủ quyết liệt đến mức khoảng cách đầu ra gấp bốn lần so với mô hình chủ lực của Anthropic trở thành thông tin nổi bật nhất của bản phát hành. Điều mà bản phát hành không có là một con số duy nhất mô tả hiệu năng thực tế của Fugu Max. Sakana nói nó đạt "điểm tổng thể tốt nhất" trên sáu bộ đánh giá và mở rộng biên giới hạn chi phí-hiệu năng trên bảy trong số mười — những phát biểu về vị trí trên biểu đồ hơn là giá trị trên một trục. Ngược lại, Claude Opus 5 ra mắt với điểm số được công bố cho gần như mọi thứ nó làm. Vậy nên phiên bản trung thực của so sánh này không phải là rẻ so với đắt. Đó là được đo lường so với được khẳng định, và khoảng cách giá chính là thứ khiến sự đánh đổi đó đáng để tranh luận.
Khoảng cách, và phép so sánh mà Sakana đã chọn không thực hiện
Trang phát hành của Sakana biện minh cho mức giá đầu ra của Fugu Max bằng cách so sánh nó với các mô hình khác. Ba mô hình được nêu tên là Claude Sonnet 5, GPT-5.6 Terra và Kimi K3, và tuyên bố là giá đầu ra của Fugu Max thấp hơn chúng 40 đến 60 phần trăm. Hãy để ý xem ai vắng mặt. Claude Opus 5 không có trong danh sách đó, và lý do là số học: ở mức $6.00 so với $25.00, Fugu Max không rẻ hơn Opus 5 40 phần trăm, mà rẻ hơn 76 phần trăm. Nêu tên Opus 5 sẽ khiến tuyên bố trông khó tin thay vì có tính cạnh tranh, nên phép so sánh được đưa ra với phân khúc dưới flagship.
Đó không phải là lời chỉ trích về mức giá, vốn thực sự thấp. Đó là một lưu ý về điều mà câu bao quanh đang làm. Cách diễn đạt của chính Sakana — hiệu năng "trong tầm với của các mô hình ưu tú với chi phí thấp hơn hai đến sáu lần" — được hiệu chỉnh theo các mô hình mà họ chọn để nêu tên. So với Claude Opus 5, bội số không phải hai đến sáu, mà là hơn bốn ở đầu ra; việc liệu Opus 5 có còn là một "mô hình ưu tú" theo tiêu chuẩn của câu đó hay không thì không được nói rõ, một thiếu sót đáng tò mò trong một bản công bố mà toàn bộ lời quảng bá là hiệu quả chi phí-hiệu năng ở tuyến đầu.
• Giá đầu vào — Fugu Max 2,00 USD mỗi 1 triệu token so với Claude Opus 5 5,00 USD mỗi 1 triệu token
• Giá đầu ra — Fugu Max 6,00 USD mỗi 1 triệu token so với Claude Opus 5 25,00 USD mỗi 1 triệu token
• Đầu vào đã cache — Fugu Max $0.25 mỗi 1 triệu token so với Claude Opus 5, với giá cache được chiết khấu lên đến 90% trên đầu vào đã cache
• Điểm benchmark — Fugu Max không công bố con số nào, khẳng định thắng sáu bài benchmark mà không kèm số liệu, so với Claude Opus 5 do Anthropic báo cáo 96,0% SWE-bench Verified, 79,2% SWE-bench Pro, khoảng 30,2% trên ARC-AGI 3
• Kiến trúc — Fugu Max, một bộ điều phối đã được huấn luyện trên một nhóm không được tiết lộ, so với Claude Opus 5, một mô hình đơn lẻ có thể ghim theo phiên bản
• Ngữ cảnh — Fugu Max không được công bố so với Claude Opus 5 1M token, với giới hạn đầu ra 128K
• Đánh giá độc lập — Fugu Max: không có đánh giá nào như vậy cho bất kỳ mô hình Fugu nào, so với 5 tháng góp mặt trên bảng xếp hạng bên thứ ba của Claude Opus
Sáu chiến thắng không có tỷ số đi kèm
Sáu benchmark là Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench và SWEFish. Năm trong số đó là những bài đánh giá công khai dễ nhận biết. Cái thứ sáu, SWEFish, là benchmark lập trình của chính Sakana, nghĩa là một trong sáu chiến thắng được chấm điểm bằng một bài kiểm tra do nhà cung cấp tự viết ra và chưa công bố.
Đối với năm mục còn lại, thông cáo nêu rằng Fugu Max đạt điểm tổng thể tốt nhất mà không nói điểm đó là bao nhiêu, cũng không nói bất kỳ đối thủ nào đạt được bao nhiêu. Đó là một dạng thức bất thường đối với một thông báo ra mắt mô hình. Các nhà cung cấp thường nói quá, nhưng họ thường nói quá bằng những con số, bởi vì con số là thứ lan truyền được. Một thông cáo tuyên bố sáu chiến thắng mà không in ra chiến thắng nào trong số đó là đang đòi hỏi người ta phải tin chỉ dựa vào sức mạnh của lời tuyên bố.
Có một cách đọc thiện chí và điều đó đáng được nói thẳng. Fugu Max là một bộ điều phối tối ưu chi phí, không phải một nỗ lực đẩy năng lực — Sakana phát hành nó cùng ngày với Fugu Ultra v2, phiên bản nhắm tới năng lực tối đa với giá đầu vào $5.00 và đầu ra $30.00. Nhiệm vụ của Max là đạt chất lượng chấp nhận được ở mức $6.00 cho đầu ra, và điểm số hàng đầu của một bộ điều phối ít ý nghĩa hơn điểm trên mỗi đô-la, đúng như biểu đồ Pareto thể hiện. Truyền thông trực quan của Sakana cho bản phát hành này là các biểu đồ Pareto. Nếu lập luận là “hãy nhìn vào đường cong, không phải đỉnh,” thì một con số benchmark thô là không còn đúng trọng tâm.
Cách hiểu kém thiện chí là việc đưa ra một con số sẽ mời gọi sự so sánh mà nhà cung cấp thà không có. Cả hai cách hiểu đều nhất quán với bằng chứng, và hiện không có gì trong hồ sơ công khai phân biệt được chúng. Điều có thể nói là chưa có bên độc lập nào đánh giá bất kỳ mô hình Fugu nào, và không có mục Artificial Analysis nào cho Fugu Max hay bất kỳ mô hình anh em nào của nó. Mọi con số trong thông cáo, kể cả sáu chiến thắng, đều bắt nguồn từ Sakana.

Giao dịch mua mà bạn thực sự đang thực hiện
Khi một nhà cung cấp mô hình đơn lẻ công bố một benchmark, bạn đang mua một lời khẳng định về một mô hình. Khi một bộ điều phối công bố một benchmark, bạn đang mua một lời khẳng định về một nhóm — những mô hình mà nhà cung cấp không huấn luyện, vận hành dưới một bộ điều phối mà các quyết định định tuyến của nó cố tình không được tiết lộ. Nhóm ở đây được mô tả là lớn nhất mà Fugu từng sử dụng, được mở rộng bằng các mô hình trọng số mở và chuyên biệt, bao gồm dòng NVIDIA Nemotron thông qua hợp tác với NVIDIA. Các thành viên khác thì không được tiết lộ.
Hệ quả thực tế là hành vi của Fugu Max có thể thay đổi mà phiên bản của nó không đổi. Việc một phòng thí nghiệm tiên phong ngừng hỗ trợ, thay đổi giá, hoặc một mô hình bị rút khỏi một khu vực sẽ làm thay đổi những gì bộ điều phối có thể gọi, và Sakana nói rõ rằng khả năng phục hồi này chính là mục đích — họ đang bán sự bảo vệ chống lại tình trạng khóa nhà cung cấp và việc thu hồi API. Đó là một lợi ích thực sự và nó không miễn phí. Đó cũng là lý do một bản đánh giá Fugu Max, nếu được công bố, sẽ mang ngày hết hạn mà một bản đánh giá Claude Opus 5 không có.
Đề xuất giá trị của Claude Opus 5 thì ngược lại và dễ định giá hơn. Đó là một mô hình ở một phiên bản duy nhất, chạy tư duy thích ứng theo mặc định với một thang điều chỉnh nỗ lực rõ ràng từ thấp đến tối đa, mang cửa sổ ngữ cảnh 1M token và giới hạn đầu ra 128K, với khả năng thị giác, sử dụng công cụ và chế độ JSON. Anthropic báo cáo 96,0% trên SWE-bench Verified và 79,2% trên SWE-bench Pro, và những con số đó được đo trên thứ bạn nhận được khi gọi endpoint — không phải trên một ensemble mà thành phần của nó có thể thay đổi ngay dưới chân bạn. Đối với một khối lượng công việc chạy trong môi trường sản xuất và được đánh giá, sự ổn định đó là một tính năng mà bạn đang trả $19.00 cho mỗi triệu token đầu ra để có được.
Chi phí cho mỗi tác vụ hoàn thành, không phải cho mỗi token
Mức giá đầu ra $6.00 của Fugu Max thực sự hấp dẫn, và cách để kiểm chứng điều đó là ngừng so sánh giá token. Một orchestrator sinh ra các agent; mỗi agent ghi token suy luận và token đầu ra; coordinator ghi một bản tổng hợp. FAQ về giá của Sakana cho dòng Fugu cam kết một mức giá trộn duy nhất dựa trên mô hình tham gia hàng đầu, với các lượt chạy đa agent không cộng dồn hóa đơn — điều này loại bỏ phép nhân fan-out trong trường hợp xấu nhất khiến các hệ thống đa agent ngây thơ trở nên không thể chi trả nổi. Nó không loại bỏ khối lượng. Số token đầu ra mà bạn bị tính phí là một hàm của số lượng agent đã chạy, và ở mức $6.00 mỗi triệu, khối lượng đó chính là biến số mà một trang giá không thể cho bạn biết.
Claude Opus 5 có cấu trúc chi phí gồm một lệnh gọi, một mô hình, một nút điều chỉnh nỗ lực do bạn kiểm soát và xử lý theo lô với mức giá bằng một nửa cho công việc có thể chờ được. Bạn có thể dự báo chi phí trước khi chạy. Qua hơn mười nghìn lần thực thi, khả năng dự báo có giá trị lớn hơn nhiều so với một mức chênh lệch điểm chuẩn mà chưa ai công bố.
Đây là chỗ câu hỏi về định tuyến tách khỏi câu hỏi về mô hình. Claude Opus 5 có trên OrcaRouter ở mức giá niêm yết của Anthropic với 0% phụ giá — mức giá của nhà cung cấp được chuyển thẳng qua, nên khi Anthropic thay đổi giá, thay đổi đó có hiệu lực trên cùng khóa ngay trong cùng ngày, kèm tính năng tự động chuyển đổi dự phòng giữa các đường của nhà cung cấp khi một đường bị giới hạn tốc độ hoặc không khả dụng. Fugu Max không có trong danh mục của chúng tôi; nó đến với bạn qua API tương thích OpenAI của chính Sakana và một số nền tảng bên thứ ba, và chuyển sang nó từ một Fugu đời trước chỉ là thay đổi một dòng tham số. Nếu bạn muốn nền tảng bằng chứng của Opus 5 và một hóa đơn có thể dự đoán được, thì router là con đường ngắn hơn. Nếu bạn muốn một hệ thống tự tổ chức việc fan-out của riêng nó khi gặp những bài toán khó, thì Fugu Max chính là thứ làm được điều đó — và bạn nên chạy thử nó với tính năng hạch toán token được bật ngay từ yêu cầu đầu tiên.

Những trường hợp mà Fugu Max có lẽ là câu trả lời đúng
Hãy đánh giá thiết kế này một cách xứng đáng. Nếu công việc của bạn có khối lượng lớn, có thể kiểm chứng, và bạn quan tâm đến chi phí trung vị của một tác vụ đã hoàn thành hơn là năng lực đỉnh của bất kỳ lệnh gọi đơn lẻ nào, thì một bộ điều phối chọn mô hình đủ dùng rẻ nhất cho mỗi yêu cầu đang làm được điều mà một mô hình chủ lực cố định không thể làm. Fugu Max nhắm thẳng vào loại khối lượng công việc đó, và mức giá đầu vào $2.00 với mức $0.25 cho đầu vào được cache được định giá cho những ngữ cảnh dài, lặp đi lặp lại mà những khối lượng công việc ấy tạo ra. Sự hợp tác với NVIDIA cũng quan trọng hơn vẻ ngoài của nó: các mô hình Nemotron là open-weights, nghĩa là bậc rẻ nhất của nhóm không chịu sự chi phối bởi các quyết định về giá của một phòng thí nghiệm khác.
Điều đó không cho bạn lý do để tin rằng Fugu Max sẽ sánh ngang Claude Opus 5 trong những tác vụ mà các con số đã công bố của Opus 5 mạnh nhất — kỹ thuật phần mềm quy mô kho mã và suy luận khó. Đó chính xác là những hàng mà bảng sáu benchmark của Sakana không đưa ra một con số nào cả. Nếu vấn đề của bạn là loại mà việc giỏi nhất quan trọng hơn việc rẻ, thì mức phí đầu ra $25.00 sẽ mua thứ bạn thực sự cần.
Điểm mấu chốt
Claude Opus 5 là lựa chọn mua có bằng chứng tốt hơn và là mặc định sản xuất an toàn hơn: các điểm chuẩn được nhà cung cấp công bố, một phiên bản bạn có thể ghim, một cửa sổ ngữ cảnh không thay đổi, giới hạn đầu ra 128K, một nút điều chỉnh nỗ lực cho phép bạn chỉ mua suy luận khi nó đáng giá, và nhiều tháng kết quả từ bên thứ ba đứng sau nó. Fugu Max là canh bạc thú vị hơn và thực sự rẻ hơn — khoảng 60% ít hơn trên đầu vào và 76% ít hơn trên đầu ra, với tốc độ bộ nhớ đệm thấp hơn một bậc độ lớn so với giá đầu vào cơ bản của Opus 5.
Nếu bạn vận hành công việc có thể kiểm chứng, lặp lại, khối lượng lớn và bạn ở ngoài EU/EEA, Fugu Max xứng đáng có một thí điểm có phạm vi xác định, với mức trần token đầu ra được đặt trước khi bạn bắt đầu và đo lường token trên mỗi tác vụ hoàn thành thay vì token trên mỗi lần gọi. Nếu bạn cần một quyết định production có thể bảo vệ trước người khác trong quý này, Claude Opus 5 vẫn là câu trả lời — và nó có sẵn trên OrcaRouter ở mức giá niêm yết của Anthropic, với mức phí của nhà cung cấp được chuyển nguyên vẹn không thay đổi.

