
Fugu Ultra v2 so với Claude Opus 5: cùng giá đầu vào, hai canh bạc khác nhau
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anthropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.
Sự trùng hợp định hình nên mọi thứ
Hãy bắt đầu với những điểm mà hai sản phẩm cùng đồng tình, vì chúng còn nhiều hơn cả mức giá được nhấn mạnh.
• Giá đầu vào — Fugu Ultra v2 $5.00 mỗi 1 triệu token so với Claude Opus 5 $5.00 mỗi 1 triệu token
• Giá đầu ra — Fugu Ultra v2 $30.00 mỗi 1 triệu token so với Claude Opus 5 $25.00 mỗi 1 triệu token
• Đầu vào được cache — Fugu Ultra v2 tính 0,50 USD mỗi 1 triệu token cao hơn mức giá cơ sở, so với Claude Opus 5 vốn tính phí cache như một khoản giảm giá lên tới 90% cho đầu vào được cache
• Bối cảnh — Fugu Ultra v2 1M token, với mức giá tăng gấp đôi khi vượt 272K, so với Claude Opus 5 1M token có mức giá cố định
• Ngưỡng đầu ra — Fugu Ultra v2 không được công bố dưới dạng một con số duy nhất so với Claude Opus 5 128K token
• Tính khả dụng — Fugu Ultra v2 không được bán tại EU/EEA, trong khi Claude Opus 5 nhìn chung được cung cấp rộng rãi theo các điều khoản API tiêu chuẩn
• Bằng chứng — Fugu Ultra v2: các benchmark do nhà cung cấp báo cáo, chưa có đánh giá độc lập; so với Claude Opus 5: benchmark do nhà cung cấp cùng với nhiều tháng xếp hạng trên bảng xếp hạng của bên thứ ba
Hàng cuối cùng đó chính là nơi cuộc so tài thực sự đổi chiều. Với cùng một mức giá đầu vào, bạn đang phải chọn giữa một hệ thống mà bạn buộc phải tin suông vào điểm số của nó và một mô hình mà điểm số đã được người khác tái lập. Cú rơi vực 272K càng làm mọi thứ trầm trọng hơn: vượt qua ngưỡng đó, mức giá đầu vào của Fugu Ultra v2 tăng gấp đôi lên 10 đô la và giá đầu ra lên 45 đô la, trong khi mức giá của Claude Opus 5 không hề nhúc nhích. Đối với các lượt chạy agent với ngữ cảnh dài — đúng loại khối lượng công việc mà Fugu Ultra v2 được thiết kế để xử lý — lợi thế giá của mức giá niêm yết rẻ hơn biến mất đúng ngay tại nơi mà hệ thống lẽ ra phải tỏa sáng.

Thực tế mỗi thứ là gì
Claude Opus 5 is Anthropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anthropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.
Fugu Ultra v2 không phải như vậy, và sự khác biệt không chỉ là hình thức. Nó là một bộ điều phối — một mô hình nhỏ đã được huấn luyện, được báo cáo có khoảng 7B tham số, đọc yêu cầu của bạn, tập hợp một nhóm tác nhân, gán các vai trò Thinker, Worker và Verifier từ công trình TRINITY của Sakana, và tổng hợp câu trả lời cuối cùng. Các mô hình nền tảng không được tiết lộ, các quyết định định tuyến không được công khai theo thiết kế, và đối với gói Ultra, nhóm mô hình là cố định: bạn không thể loại một nhà cung cấp ra ngoài. Cách Sakana tự mô tả về phiên bản 2 là mốc cắt dữ liệu huấn luyện đã chuyển sang ngày 28 tháng 8 năm 2026 và thành phần nhóm đã thay đổi — cụ thể là để loại trừ Claude Fable 5, Claude Fable 5.1 và GPT-6 Astra.
Việc loại trừ đó là chi tiết tiết lộ nhiều nhất trong bản công bố. Fugu Ultra v2 đang tuyên bố giành chiến thắng trên các benchmark trước ba mô hình mạnh nhất hiện có, trong khi xác nhận rằng nó không gọi bất kỳ mô hình nào trong số đó. Dù nhóm đó có chứa gì đi nữa, theo cách tính của chính Sakana, nó không phải là đỉnh cao của thị trường. Lời chào hàng là sự phối hợp đánh bại năng lực. Đó là một luận điểm thực sự, và trên các tác vụ có thể kiểm chứng với một công cụ kiểm tra rẻ, đó là luận điểm có bằng chứng hậu thuẫn. Nó không phải là cùng một tuyên bố như "hệ thống này thông minh hơn Claude Opus 5", và bảng điểm được sắp xếp để hai điều đó dễ bị nhầm lẫn với nhau.
Bảng điểm mà Sakana đã chọn
Mọi con số dưới đây đều đến từ đánh giá của chính Sakana về Fugu Ultra v2. Các số liệu của Claude Opus 5 là do Sakana đo lường trong cùng phép so sánh, trừ khi có ghi chú khác. Chưa có bên độc lập nào tái lập được cột Fugu, và tính đến thời điểm viết bài này, không có mục Artificial Analysis nào cho bất kỳ mô hình Fugu nào.
• Chartography — Fugu Ultra v2 48.3 so với Claude Opus 5 27.3 — do nhà cung cấp báo cáo, khoảng cách 21 điểm
• DeepSWE — Fugu Ultra v2 74,3 so với việc không có số liệu Claude Opus 5 nào được công bố trong cùng bảng — do nhà cung cấp báo cáo
• Vị trí xếp hạng benchmark — Fugu Ultra v2 tốt nhất hoặc đồng hạng nhất ở năm trong tám, nằm trong top hai ở bảy trong tám — theo báo cáo của nhà cung cấp
• SWE-bench Verified — không có số liệu Fugu Ultra v2 so với Claude Opus 5 96,0% — theo báo cáo của Anthropic
• SWE-bench Pro — không có số liệu Fugu Ultra v2 so với Claude Opus 5 79,2% — do Anthropic báo cáo
• ARC-AGI 3 — không có số liệu Fugu Ultra v2 so với Claude Opus 5 ~30,2% — theo báo cáo của Anthropic
Hãy hiểu đó như một hình thái chứ không phải một bảng xếp hạng. Sakana đã công bố một bảng gồm tám benchmark, trong đó nó thắng năm, còn những kết quả mạnh nhất được ghi nhận công khai của Claude Opus 5 — các hàng SWE-bench, ARC-AGI 3 — đơn giản là không có trên đó. Đó không phải là lời buộc tội thiếu thiện chí; đó là diện mạo của một bảng điểm nhà cung cấp, kể cả bảng của mọi nhà cung cấp. Nhưng điều đó có nghĩa là bạn không thể kết luận từ bản phát hành rằng Fugu Ultra v2 đánh bại Claude Opus 5 trong lĩnh vực kỹ thuật phần mềm, bởi vì hai hệ thống không được đo trên cùng những hàng đó đủ thường xuyên để có thể khẳng định. Ở hàng duy nhất mà cả hai cùng xuất hiện và cả hai con số đều công khai — Chartography — Fugu Ultra v2 tuyên bố thắng lớn. Ở những hàng suy luận và lập trình rộng nhất, chỉ một bên đã công bố.

Chi phí cho mỗi tác vụ, không phải chi phí cho mỗi token
Hóa đơn token của một orchestrator không phải là mức giá trên mỗi token của nó. Fugu Ultra v2 tạo ra các agent, mỗi agent đóng góp token suy luận và token đầu ra, còn bản thân bộ điều phối tạo ra văn bản tổng hợp. Phần FAQ về giá của Sakana đưa ra một cam kết thực sự hữu ích ở đây — bạn bị tính một mức giá hỗn hợp duy nhất dựa trên mô hình cao cấp nhất liên quan, và việc thêm agent không làm nhân lên hóa đơn — điều này loại bỏ phép nhân fan-out trong trường hợp xấu nhất vốn khiến các thiết lập đa agent ngây thơ trở nên đắt đỏ. Nhưng nó không loại bỏ khối lượng. Số lượng token đầu ra được tính phí vẫn là một hàm của việc có bao nhiêu agent đã chạy và chúng đã viết bao nhiêu, và với mức 30 đô-la mỗi triệu token, khối lượng đó chính là biến số mà bạn không thể dự đoán từ trang giá.
Hình dạng chi phí của Claude Opus 5 thì ngược lại. Một lệnh gọi, một mô hình, một núm điều chỉnh nỗ lực do bạn kiểm soát, và mức giá đầu ra 25 đô la với xử lý theo lô sẵn có ở mức giảm 50% cho công việc không theo thời gian thực. Bạn có thể dự báo được nó. Với một khối lượng công việc bạn chạy mười nghìn lần một ngày, khả năng dự báo đáng giá hơn nhiều so với một chút lợi thế điểm chuẩn trong một tác vụ đọc biểu đồ.
This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anthropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.
Nơi Fugu Ultra v2 thực sự chiến thắng
Hãy dành cho hệ thống sự ghi nhận xứng đáng. Kết quả Chartography, nếu còn đứng vững, là kiểu chiến thắng mà các mô hình đơn lẻ khó làm giả: suy luận thị giác trên các tài liệu có cấu trúc thưởng cho việc thử một cách đọc, đối chiếu nó với tài liệu, rồi thử lại — đó chính xác là việc mà một vai trò Verifier sinh ra để làm. Logic tương tự cũng áp dụng cho Toolathon và DeepSWE, nơi câu trả lời có thể được kiểm chứng thay vì tranh cãi. Các case study đã công bố của Sakana cũng nghiêng theo hướng đó: một lượt chạy AutoResearch với 123 thí nghiệm trong mười bốn giờ trên một H100, một bộ giải khối Rubik thuần Python đã giải xong cả 300 khối bị xáo trộn trong khi hai baseline tiên tiến được ẩn danh sụp đổ hoàn toàn, một iris CAD cơ khí thực sự mở và đóng. Đây là những ví dụ do nhà cung cấp tự chọn lọc với các baseline được ẩn danh, nên chúng chứng minh được ít hơn vẻ bề ngoài. Nhưng mô thức này nhất quán, và nó chỉ vào một phạm trù thực sự: những tác vụ mà tính đúng đắn có thể kiểm chứng được và phần khó nằm ở sự kiên trì.
Cũng có một lập luận mang tính cấu trúc không liên quan gì đến các bài benchmark. Claude Opus 5 là mô hình của một nhà cung cấp, chịu sự chi phối bởi các quyết định về giá, lịch trình ngừng hỗ trợ và chính sách của một nhà cung cấp. Fugu Ultra v2 được thiết kế để tồn tại bất kể bất kỳ yếu tố nào trong số đó thay đổi, và Sakana nói rõ rằng đây chính là mục đích — tình trạng khóa nhà cung cấp, việc thu hồi API, các biện pháp kiểm soát xuất khẩu. Trong một thị trường mà các mô hình đã bị rút khỏi một số khu vực với rất ít thông báo trước, đó không phải là chuyện giả định. Đó là một biện pháp phòng ngừa rủi ro, và phòng ngừa rủi ro thì tốn tiền: cao hơn 5 đô la cho mỗi triệu token đầu ra là mức giá xấp xỉ của biện pháp phòng ngừa này.
Bản án
Claude Opus 5 thắng trong quyết định mà hầu hết các đội đang thực sự đưa ra. Nó được hậu thuẫn bởi nhiều tháng đánh giá độc lập, một cửa sổ 1M token không tăng gấp đôi giá khi bạn đi đến giữa tài liệu, trần đầu ra 128K, mức giá công bố mà bạn có thể dự báo, một núm điều chỉnh nỗ lực cho phép bạn chỉ mua khả năng suy luận khi tác vụ xứng đáng với điều đó, và kết quả từ bên thứ ba trên đúng những benchmark — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — mà các đội agentic và lập trình quan tâm nhất. Fugu Ultra v2 thắng ở một câu hỏi hẹp hơn và thú vị hơn: liệu một bộ điều phối với một nhóm nhỏ hơn có thể vượt qua một flagship trên các tác vụ mà câu trả lời có thể được kiểm tra hay không. Bảng điểm của chính Sakana nói có ở năm trong tám dòng, và việc loại trừ khỏi nhóm cho thấy chiến thắng đến mà không cần ba mô hình tốt nhất thế giới.
If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anthropic's list price with the provider's rate passed through untouched.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
