Thẻ tiêu đề hero cho "Fugu Max vs GLM-5.3" với phụ đề "Mô hình giá trị bị mô hình khối lượng lấn át", ba nhãn dạng viên ghi "$6.00 so với $3.96 cho đầu ra", "7,962.7M token mỗi 7 ngày", "$2.00 so với $1.26 cho đầu vào", dòng chân trang ghi "Sakana AI vs Z.ai - tháng 9 năm 2026", và logo OrcaRouter ở góc dưới bên phải.
Engineering & Research

Fugu Max vs GLM-5.3: mô hình giá trị bị mô hình khối lượng lấn át

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Fugu Max được định giá để thắng về chi phí, nhưng GLM-5.3 lại rẻ hơn trên cả hai trục. Bộ điều phối của Sakana AI ra mắt ngày 11 tháng 9 năm 2026 với mức $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra, được xây dựng để định tuyến từng tác vụ đến mô hình rẻ nhất có thể đảm nhiệm được. GLM-5.3 của Z.ai, được niêm yết từ ngày 18 tháng 8 năm 2026, có mức $1.26 cho đầu vào và $3.96 cho đầu ra mỗi triệu token trên OrcaRouter — thấp hơn Fugu Max từ một phần ba đến hai phần năm ở cả hai chỉ số, đến từ một mô hình chỉ xử lý văn bản duy nhất với cửa sổ ngữ cảnh 1M đã được công bố và giới hạn đầu ra 128K. GLM-5.3 cũng tình cờ là mô hình đông khách nhất trong danh mục của chúng tôi với khoảng cách khá xa. Sự kết hợp đó — rẻ hơn trên mỗi token, và chứng minh rõ ràng rằng đang gánh lưu lượng vận hành thực tế ở quy mô lớn — khiến đây trở thành cặp so sánh mà khoản phụ trội cho việc điều phối khó biện minh nhất.

Rẻ hơn trên cả hai phương diện, với thông số kỹ thuật được công bố

Việc so sánh khiến Fugu Max trở nên khó xử ngay cả trước khi bất kỳ điểm chuẩn nào được tính đến, bởi đây không phải là trường hợp đánh đổi năng lực để lấy giá rẻ. GLM-5.3 tự thân đã là một flagship tiệm cận hàng đầu — Z.ai mô tả nó mang lại mức cải thiện lập trình khoảng 50% so với GLM-5.2 và ngang bằng Mythos 5 ở một số năng lực an ninh mạng được chọn. Đây không phải là một mô hình tiết kiệm được đưa ra như một phương án thay thế rẻ tiền. Đây là một flagship mà lại có giá thấp hơn một bộ điều phối được tối ưu chi phí.

• Giá đầu vào — Fugu Max 2,00 USD cho mỗi 1 triệu token so với GLM-5.3 1,26 USD cho mỗi 1 triệu token

• Giá đầu ra — Fugu Max 6,00 USD mỗi 1 triệu token so với GLM-5.3 3,96 USD mỗi 1 triệu token

• Đầu vào đã cache — Fugu Max $0.25 mỗi 1M token so với cache của GLM-5.3 được định giá như một khoản giảm giá trên mức giá đầu vào cơ bản

• Ngữ cảnh — Fugu Max chưa được công bố so với GLM-5.3 1M token

• Mức trần đầu ra — Fugu Max không được công bố so với GLM-5.3 128K token

• Phương thức — Fugu Max chưa được công bố so với GLM-5.3 chỉ văn bản, được ghi nhận như vậy

• Thẻ năng lực — Fugu Max không có công bố nào, so với GLM-5.3: sử dụng công cụ, chế độ JSON, suy luận

• Các số liệu benchmark — Fugu Max được khẳng định đạt sáu chiến thắng mà không kèm điểm số so với GLM-5.3, DeepSWE do nhà cung cấp báo cáo tăng từ 46,2 lên 66,9 so với thế hệ trước, cùng điểm trí tuệ Artificial Analysis đã được công bố

• Trọng số — Fugu Max đóng, nguồn không được công bố, so với GLM-5.3 đến từ một phòng thí nghiệm có xuất thân trọng số mở

• Lưu lượng quan sát được trên OrcaRouter — Fugu Max không có, không được truyền tải so với GLM-5.3 7.962,7M token trong bảy ngày qua

Hãy để ý xem hai hàng cuối cùng cùng nhau thể hiện điều gì. GLM-5.3 đến từ một dòng mô hình có trọng số mở, đây là dạng mạnh nhất hiện có của lập luận về tính độc lập với nhà cung cấp mà Sakana đang bán như toàn bộ tiền đề của Fugu Max. Và nó có con số lưu lượng quan sát được vượt hơn một bậc độ lớn so với hầu hết các mô hình chúng tôi phục vụ. Nếu câu hỏi là "tôi nên chạy gì cho công việc sản xuất nặng về văn bản với mức giá thấp", thì bằng chứng chỉ về một nơi khác, không phải bộ điều phối.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

Lập luận về khối lượng, và vì sao nó không chỉ là một cuộc thi đọ mức độ phổ biến

Con số lưu lượng không phải là con số chất lượng, và không nên được đọc như thể nó là như vậy. Điều mà 7,96 tỷ token trong bảy ngày chứng minh là GLM-5.3 đã được nhiều nhóm độc lập vận hành ở quy mô sản xuất, trên các khối lượng công việc thực tế, và đã không tạo ra một làn sóng rời bỏ hàng loạt. Đó là một tín hiệu yếu về chất lượng và một tín hiệu mạnh về năng lực vận hành: độ trễ ổn định, thông lượng được duy trì, API vận hành đúng dưới tải, và các chế độ lỗi đã được một cộng đồng đủ lớn biết đến đến mức chúng lộ diện công khai. Một mô hình được phát hành cùng tuần với Fugu Max không có bất kỳ điều nào như vậy làm hậu thuẫn.

Dòng độ trễ càng làm nổi bật luận điểm. GLM-5.3 cho thấy p50 thời gian đến token đầu tiên là 4,33 giây trên lưu lượng mà chúng tôi phục vụ. Với công việc agentic — khối lượng công việc mà cả hai sản phẩm này đều hướng tới — thời gian đến token đầu tiên cộng dồn qua mỗi lượt của mỗi subagent mà bộ điều phối khởi tạo. Một orchestrator rẻ hơn khởi tạo bốn agent thì không hề rẻ hơn nếu mỗi agent phải chờ vài giây trước khi phát ra bất cứ thứ gì, và chi phí đó không bao giờ xuất hiện trên bảng giá.

Lập luận phản bác của Fugu Max là bộ điều phối của nó định tuyến đến mô hình tinh gọn nhất có khả năng đáp ứng cho mỗi yêu cầu, về nguyên tắc nghĩa là nhiều tác vụ hoàn toàn không chạm đến backend đắt đỏ. Việc mở rộng pool của Sakana trong bản phát hành này đã bổ sung các mô hình trọng số mở và chuyên biệt, bao gồm dòng NVIDIA Nemotron thông qua hợp tác với NVIDIA, vì vậy các bậc thang rẻ của chiếc thang đó là có thật. Câu hỏi đặt ra là liệu các bậc thang đó có rẻ hơn $3.96 cho mỗi triệu token đầu ra hay không. Đối với hầu hết các tác vụ văn bản, chúng không rẻ hơn — đó là một mức thấp, và các mô hình trọng số mở chạy ở mức giá thuê thường chỉ vượt qua nó với một biên độ nhỏ.

Những câu hỏi đáng để hỏi trước khi bạn chọn

Một orchestrator có rẻ hơn một mô hình open-weights đơn lẻ không? Không phải theo mặc định, và trực giác lại chạy sai hướng. Điều phối bổ sung thêm token tổng hợp của một bộ điều phối, và trong các lượt chạy đa tác tử, còn cộng thêm đầu ra của mọi agent trong nhóm. Cách tính giá Fugu của Sakana loại bỏ trường hợp xấu nhất bằng cách tính một mức giá pha trộn duy nhất dựa trên mô hình tham gia ở hạng cao nhất thay vì cộng dồn các agent — đây là một nhượng bộ thực sự. Nhưng mức giá cơ sở mà bạn đang pha trộn là $6.00 cho đầu ra, còn mô hình đơn lẻ mà nếu không bạn sẽ gọi chỉ tốn $3.96. Điều phối tiết kiệm chi phí khi nó ngăn được việc phải thử lại, chứ không phải khi nó thêm song song chỉ vì lợi ích của chính việc song song hóa.

Hạn chế chỉ văn bản có quan trọng với một trong hai không? Với GLM-5.3, điều đó đã được ghi rõ trong tài liệu, nên đây là một ràng buộc bạn có thể tính trước — không thị giác, không âm thanh, không video, và danh mục ghi rõ như vậy. Còn với Fugu Max, dạng thức đơn giản là không được công bố. Điều đó còn tệ hơn cả một hạn chế, vì bạn không thể biết liệu một pipeline gửi PDF có hoạt động hay không cho đến khi thử. Một ràng buộc không được nêu ra không đồng nghĩa với một ràng buộc không tồn tại.

Điều gì xảy ra với từng cái khi các mô hình nền tảng thay đổi? GLM-5.3 là một mô hình ở một phiên bản duy nhất, được huấn luyện và phục vụ bởi Z.ai. Nếu Z.ai thay đổi giá, thay đổi đó sẽ đến khóa của bạn ngay trong cùng ngày thông qua OrcaRouter với mức chênh 0%, và bạn có thể nhìn thấy nó và phản ứng lại. Hành vi của Fugu Max là một hàm số của một nhóm mà Sakana không tiết lộ các thành viên, nên việc một phòng thí nghiệm tiên phong ngừng hỗ trợ hay thay đổi giá sẽ âm thầm thay đổi thứ bạn đang mua mà tên sản phẩm không hề đổi. Sakana trình bày điều này như một dạng khả năng chống chịu. Đó là khả năng chống chịu cho nhà cung cấp và sự mờ mịt cho người mua.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Nơi các quyết định định tuyến thực sự được đưa ra

Cả hai đều thực chất là những quyết định định tuyến — Fugu Max đưa ra chúng bên trong một bộ điều phối không minh bạch, còn bạn đưa ra chúng ở tầng API. OrcaRouter thuộc kiểu thứ hai: một API cho hơn 200 mô hình với một DSL định tuyến cho phép bạn diễn đạt chính sách một cách tường minh, tự động chuyển đổi dự phòng khi một tuyến nhà cung cấp bị suy giảm, và hợp nhất mô hình khi bạn muốn kết hợp các đầu ra một cách có chủ đích thay vì tin vào một hộp đen để làm việc đó. GLM-5.3 nằm trong danh mục đó với mức giá niêm yết của Z.ai cùng mức markup 0%, điều này đáng giá hơn mức thông thường đối với một mô hình có lượng lưu lượng lớn đến vậy phía sau: mức giá bạn thấy chính là mức giá mà Z.ai công bố, được truyền đi nguyên vẹn.

Sự khác biệt thực tế nằm ở khả năng kiểm toán. Khi Fugu Max chọn một mô hình cho yêu cầu của bạn, bạn không biết gì về việc đó là mô hình nào hay vì sao. Khi bạn tự viết chính sách định tuyến, quyết định nằm trong kho mã của bạn, có thể được xem xét bởi bất kỳ ai đánh giá mã của bạn, và có thể thay đổi mà không phải chờ nhà cung cấp. Với các nhóm chịu bất kỳ nghĩa vụ tuân thủ hay hạch toán chi phí nào, đó không phải là một khác biệt mang tính triết lý.

Bản án

GLM-5.3 giành chiến thắng trong so sánh này ở những phương diện quan trọng nhất đối với một đội ngũ sản xuất: nó rẻ hơn ở đầu vào và đầu ra, cửa sổ ngữ cảnh và giới hạn đầu ra của nó đều được công bố, các giới hạn về phương thức của nó được nêu rõ, nó có khả năng sử dụng công cụ, chế độ JSON và suy luận như những năng lực đã được ghi nhận, nó xuất thân từ một dòng mô hình trọng số mở, và nó có con số lưu lượng bảy ngày gần đạt tám tỷ token. Không có cách diễn giải nào về bằng chứng công khai mà theo đó Fugu Max là lựa chọn mua có bằng chứng tốt hơn ở mức giá này.

Fugu Max giữ lại một lập luận, và đó là một lập luận thực sự có cơ sở: đối với những tác vụ mà lượt thứ hai của người điều phối bắt được một lỗi mà lượt đầu tiên lẽ ra đã đưa ra, chi phí trên mỗi tác vụ hoàn thành có thể tốt hơn chi phí trên mỗi token. Điều đó đáng để thử nghiệm trong phạm vi xác định nếu công việc của bạn có thể kiểm chứng, có khối lượng lớn và bạn ở ngoài EU/EEA — với mức trần token đầu ra được đặt trước và việc đo lường số token trên mỗi tác vụ đã hoàn thành. Nếu không, mô hình đơn lẻ rẻ hơn một phần ba và đã chạy dưới tải sản xuất trong một tháng chính là câu trả lời, và nó có trên OrcaRouter ở mức giá niêm yết của Z.ai với mức phí của nhà cung cấp được chuyển thẳng.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày