Thẻ tiêu đề cho Sakana Fugu Max, mô hình điều phối được phát hành ngày 11 tháng 9 năm 2026, hiển thị bốn thẻ số liệu: đầu vào $2 mỗi 1 triệu token, đầu ra $6 mỗi 1 triệu token, tốt nhất tổng thể trên 6 điểm chuẩn, và một nhóm gồm các mô hình mở cùng các mô hình chuyên biệt, bao gồm NVIDIA Nemotron, với phần chân trang ghi chú rằng mọi số liệu đều do nhà cung cấp báo cáo.
Guides & Insights

Sakana Fugu Max: Bộ điều phối $2/$6 chọn mô hình rẻ nhất hoạt động được

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hầu hết các mô hình cạnh tranh ở việc chúng có thể làm được bao nhiêu. Sakana Fugu Max lại cạnh tranh ở việc nó có thể làm ít đến mức nào mà vẫn xoay xở được. Sakana AI đã phát hành Sakana Fugu Max vào ngày 11 tháng 9 năm 2026, cùng với Sakana Fugu Ultra v2 — hai bản tinh chỉnh của cùng một kiến trúc điều phối, hướng về hai đầu đối lập của đường cong chi phí-hiệu năng. Fugu Max không tự mình trả lời yêu cầu của bạn. Nó đọc tác vụ, chọn mô hình rẻ nhất trong nhóm mà có khả năng xử lý được, định tuyến đến đó và trả về một câu trả lời. Sakana định giá nó ở mức 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra.

Phần thú vị nằm ở chỗ mức giá đó được đo so với cái gì. Sakana tuyên bố mức giá đầu ra của Fugu Max thấp hơn Claude Sonnet 5, GPT-5.6 TerraKimi K3 từ 40–60%. Tuyên bố đó có thể kiểm chứng được, và hiếm thấy đối với một bài benchmark ngày ra mắt, phép tính này đứng vững: so với giá niêm yết hiện hành của ba mô hình mà Sakana nêu tên, 6 đô la cho mỗi một triệu đầu ra nằm gần như chính xác ở giữa khoảng đã nêu. Điều khó kiểm chứng hơn nhiều là khía cạnh hiệu năng, bởi vì Sakana đã công bố kết quả của Fugu Max dưới dạng biểu đồ phân tán thay vì các con số.

Fugu Max thực sự là gì

Fugu Max không phải là một checkpoint. Không có tệp trọng số, không có số lượng tham số, và không có gì để tải xuống. Sakana mô tả nó là "một kiến trúc, không phải một mô hình đơn lẻ" — cùng một engine điều phối lõi như Fugu Ultra v2, được tinh chỉnh cho một câu hỏi khác. Ultra v2 hỏi đâu là năng lực cao nhất hiện có. Fugu Max hỏi đâu là đầu ra tốt nhất với chi phí thấp nhất.

Sự khác biệt đó có ý nghĩa về mặt vận hành. Bạn không thể tinh chỉnh Fugu Max, tự lưu trữ nó, hay kiểm tra vì sao nó chọn mô hình này thay vì mô hình khác. Bạn cũng không thể thấy toàn bộ danh sách mô hình mà nó định tuyến — Sakana nói rằng nhóm này mở rộng thành “nhóm mô hình mở và chuyên biệt lớn nhất của chúng tôi cho đến nay” và nêu đích danh dòng Nemotron của NVIDIA, được thêm vào thông qua quan hệ đối tác NVIDIA mà Sakana công bố hồi tháng Tám. Phần còn lại của nhóm không được nêu tên, và Sakana không công bố dấu vết định tuyến theo từng yêu cầu.

Điều bạn có thể thấy là hình dạng của sự vật. Sơ đồ của chính nhà cung cấp cho thấy Fugu Max ở đỉnh của một cấu trúc phân nhánh tỏa ra: một bộ điều phối, một hàng các vị trí mô hình có thể hoán đổi cho nhau phía sau nó, và Sakana Namazu cùng chính Fugu Max nằm trong số các mục tiêu. Nhóm này được mô tả là có thể hoán đổi theo thiết kế, và động lực được nêu ra mang tính chính trị không kém gì kinh tế — Sakana coi việc điều phối như một biện pháp bảo vệ chống lại tình trạng khóa nhà cung cấp, việc thu hồi API và các biện pháp kiểm soát xuất khẩu, với lập luận rằng một hệ thống có thể thay thế các nhà cung cấp của mình thì không thể bị bất kỳ nhà cung cấp nào trong số đó cắt đứt.

Bản thân Sakana Fugu không phải là mới. Nó đạt trạng thái phát hành chính thức vào ngày 22 tháng 6 năm 2026, và lộ trình riêng của nhà cung cấp kéo dài qua tháng 4 (bản beta), tháng 6 (GA cùng với Fugu Ultra v1), tháng 7 (Fugu-Cyber và giao diện Claude Code), tháng 8 (Sakana Chat cùng quan hệ đối tác NVIDIA), và giờ là tháng 9. Fugu Max là bước hàng tháng thứ năm, không phải màn ra mắt — và bất kỳ ai đang chạy Fugu đều nâng cấp lên nó bằng một thay đổi tham số một dòng trên cùng endpoint tương thích OpenAI, không cần migration.

Tuyên bố về giá vẫn đứng vững khi đối chiếu với giá niêm yết.

Con số $2 cho đầu vào / $6 cho đầu ra của Sakana được nêu rõ ràng trên trang ra mắt. Các bài đưa tin thứ cấp bổ sung mức giá đầu vào đã lưu đệm là $0,25 mỗi triệu token, điều mà bản thân trang ra mắt không nêu — hãy coi con số đó là thông tin được báo lại chứ không phải đã xác nhận. Để so sánh, Fugu Ultra v2 có giá $5 cho đầu vào, $30 cho đầu ra, với $0,50 cho đầu vào đã lưu đệm.

Giờ đến tuyên bố 40–60%. Ba đối tượng so sánh được nêu tên hiện đang ở mức:

• GPT-5.6 Terra — $2 đầu vào / $12 đầu ra, sau khi đợt cắt giảm ngày 30 tháng 7 của OpenAI đưa giá đầu ra giảm từ $15.

• Claude Sonnet 5 — 10 USD cho output theo mức giá khuyến mãi khi ra mắt, 15 USD theo mức giá tiêu chuẩn. Các nguồn tin không thống nhất về việc liệu đợt tăng giá dự kiến vào tháng 9 đã bị hủy bỏ hay chỉ bị hoãn lại, đó là lý do khiến khoảng giá chênh lệch rộng đến vậy.

• Kimi K3 — $3 cho đầu vào / $15 cho đầu ra, với đầu vào được lưu trong bộ nhớ đệm ở mức $0.30.

So với những mức đó, output $6 thấp hơn Terra 50%, thấp hơn mức khuyến mãi của Sonnet 5 40%, thấp hơn mức giá tiêu chuẩn của Sonnet 5 60%, và thấp hơn Kimi K3 60%. Tuyên bố này chuẩn xác, và nó chuẩn xác khi đối chiếu với giá niêm yết đã công bố thay vì một mô hình chi phí nội bộ — điều mà không phải tỷ lệ phần trăm ngày ra mắt nào cũng có thể nói được.

Một con số trong cùng mục không trụ nổi dưới cùng cách xử lý đó. Sakana cũng nói Fugu Max mang lại “hiệu năng tiệm cận các mô hình hàng đầu với chi phí thấp hơn từ hai đến sáu lần”. So với ba mô hình mà nó nêu tên cho con số 40–60%, khoảng cách giá đầu ra thô gần với mức 1,7× đến 2,5× hơn. Hệ số nhân rộng hơn có lẽ được đo trên toàn bộ đường biên — bao gồm cả những mô hình có chi phí cao hơn nhiều so với $12 — chứ không phải so với ba mô hình trong câu. Đó là một tuyên bố có thể biện hộ được về đường cong Pareto và một tuyên bố không thể biện hộ được về các đối thủ được nêu tên, và trang ra mắt không phân biệt giữa hai điều này.

Đây chính là chỗ một lớp định tuyến chứng minh được giá trị của nó ở khía cạnh giá cả. OrcaRouter chuyển nguyên giá niêm yết của nhà cung cấp mà không đánh thêm phụ phí, nên khi một nhà cung cấp thay đổi giá niêm yết thì con số bạn thấy cũng thay đổi ngay trong ngày — điều này đặc biệt liên quan ở đây vì toàn bộ tiền đề của Fugu Max là có một mô hình rẻ hơn tồn tại đâu đó trong pool và bạn nên tiếp cận nó mà không cần phải suy nghĩ. Chúng tôi không tự vận hành Fugu Max; nó chạy trên API riêng của Sakana. Nhưng nguyên tắc chuyển nguyên giá cũng chính là nguyên tắc khiến mức giá output $6 đáng để đối chiếu với mức $12 của nhà cung cấp hiện hữu, thay vì tin vào bất kỳ con số nào một cách mù quáng.

Những gì Sakana nói nó đánh bại, và những gì nó không cho bạn thấy

Screenshot of the Sakana AI Fugu Max launch page showing ten Pareto frontier scatter charts plotting benchmark score against output price in US dollars per million tokens, covering Terminal Bench 2.1, HLE, DeepSWE, CharXiv Reasoning, Chartography, GDP.pdf, GPQA-D, AutomationBench, AA-LCR and SWEFish, with Fugu Max marked as a red point at the top-left of each plot and no numeric scores printed.

Mục benchmark của nhà cung cấp đưa ra ba khẳng định cụ thể cho Fugu Max: điểm tổng thể cao nhất trên sáu bộ benchmark — Terminal Bench 2.1, GPQA-D, AA-LCR, GDP.pdf, AutomationBench và SWEFish — mở rộng biên Pareto chi phí-hiệu năng trên bảy trong số mười bộ benchmark, và hiệu năng "trong tầm với của các mô hình hàng đầu" với chỉ một phần nhỏ chi phí token.

Có ba điều về bằng chứng đó đáng để ghi nhớ trước khi bạn trích dẫn bất kỳ phần nào của nó.

Điều đầu tiên là Sakana không công bố số liệu nào. Kết quả của Fugu Max xuất hiện dưới dạng mười biểu đồ phân tán — điểm số trên trục tung, giá đầu ra tính bằng đô-la trên mỗi triệu token trên trục hoành — với Fugu Max được vẽ thành một điểm đỏ ở phía tây bắc của vùng xám. Bạn có thể thấy nó nằm ở phía trên và lệch sang trái. Bạn không thể đọc được điểm số từ đó. Terminal Bench 2.1, GPQA-D và AA-LCR đều có bảng xếp hạng công khai, nơi một con số sẽ có thể so sánh trực tiếp, và không có con số nào được đưa ra.

Điều thứ hai là một trong sáu bài benchmark là của chính Sakana. SWEFish được mô tả trên trang ra mắt là “bài benchmark nội bộ của chúng tôi, phản ánh các thách thức và trường hợp sử dụng lập trình của chính Sakana AI.” Đó là một cách hợp lý để đo mức độ phù hợp cho sản phẩm của chính bạn, và không phải là cách để so sánh với đối thủ — điểm số trên một bài benchmark do nhà cung cấp thiết kế, trên các nhiệm vụ do nhà cung cấp chọn, không phải là bằng chứng về mô hình của bất kỳ ai khác.

Điểm thứ ba là những con số mạnh nhất trên trang thuộc về mô hình kia. Fugu Ultra v2 đạt được những chỉ số mà Fugu Max chỉ có biểu đồ: Chartography 48,3 so với Opus 5 ở mức 27,3 và Fable 5 ở mức 29,5, DeepSWE 74,3, tốt nhất hoặc đồng hạng nhất trên năm trong tám bài đánh giá và nằm trong top hai trên bảy trong tám. Ultra v2 cũng có mốc cắt dữ liệu huấn luyện được nêu rõ là 2026-08-28 — chỉ hơn hai tuần trước khi ra mắt — và đáng chú ý là kèm theo một ghi chú rõ ràng rằng Fable 5, Fable 5.1 và GPT-6 Astra không nằm trong nhóm của mình. Sakana đang tuyên bố rằng nó đạt được điều đó mà không cần thuê những mô hình cụ thể ấy, và đó chính là toàn bộ luận điểm về chủ quyền gói gọn trong một chú thích.

Không điều nào trong số này khiến những tuyên bố về Fugu Max trở thành sai. Nó khiến chúng chưa được xác minh, và khiến tiêu đề về sáu điểm chuẩn chỉ còn an toàn để nhắc lại khi đi kèm nhãn. Đánh giá độc lập đối với một điểm cuối điều phối hoàn toàn mới là điều hiếm thấy, và chưa có gì được công bố.

Fugu Max so với Fugu Ultra v2: cái nào bạn thực sự muốn

A two-column scoreboard comparing Sakana Fugu Max and Sakana Fugu Ultra v2 across six shared dimensions: price ($2 in / $6 out versus $5 in / $30 out), cached input ($0.25 reported versus $0.50), objective (lowest cost per task versus highest capability), benchmark evidence (charts with no numbers versus Chartography 48.3 and DeepSWE 74.3), whether Fable 5 or GPT-6 Astra are in the pool (not stated versus explicitly excluded), and best fit (high-volume simple traffic versus agentic long-horizon work).

Đây không phải là những sản phẩm cạnh tranh nhau, và lựa chọn giữa chúng không hề sát sao một khi bạn nhìn thấy các con số đặt cạnh nhau. Fugu Max là bản rẻ: $2 đầu vào, $6 đầu ra, được xây dựng để định tuyến tránh xa các mô hình đắt tiền mỗi khi có một mô hình rẻ hơn có thể đảm nhận công việc. Fugu Ultra v2 là bản mạnh: $5 đầu vào, $30 đầu ra, $0.50 cho phần lưu đệm, được xây dựng để định tuyến hướng tới năng lực cho công việc nhiều bước phức tạp ngay cả khi điều đó tốn kém hơn.

Sự phân chia thực tế là theo hình dạng tác vụ, không phải theo ngân sách. Nếu lưu lượng của bạn chủ yếu là tra cứu, trích xuất, phân loại, tạo nội dung ngắn và các lời gọi công cụ đơn giản, thì toàn bộ thiết kế của Fugu Max là để nhận ra điều đó và chi tiêu ít nhất có thể — và tuyên bố của Sakana rằng nó mở rộng biên giới trên bảy trong số mười benchmark thì ít nhất cũng mang tính định hướng về điều đó. Nếu lưu lượng của bạn bao gồm các lượt chạy agentic dài, tái cấu trúc nhiều tệp hoặc các tác vụ nghiên cứu thất bại tốn kém khi một bước đi sai, thì mức giá đầu ra 30 USD trên Ultra v2 đang mua một thứ có thật: vị trí trong top hai trên bảy trong số tám benchmark là phần của trang ra mắt giống một tuyên bố về năng lực hơn là một tuyên bố về chi phí.

Cả hai đều có sẵn trên cùng một API tương thích OpenAI thông qua bảng điều khiển của Sakana, và lộ trình nâng cấp từ Fugu hiện có chỉ là thay đổi một tham số. Có hai lưu ý về tính khả dụng. Fugu đã được báo cáo là không khả dụng ở EU và EEA trong khi chờ hoàn tất các công việc liên quan đến GDPR; nếu điều này vẫn còn đúng thì nó sẽ giới hạn những nơi có thể triển khai mỗi mô hình. Và cả hai đều là hệ thống đóng: bạn đang mua một endpoint, còn nhà cung cấp chọn những mô hình nào nằm phía sau nó — bao gồm, đối với Fugu Max, một danh sách mà họ không công bố đầy đủ.

Điều đáng nói là: một bộ điều phối vẫn phải đi thuê năng lực tiên phong của chính mình.

Lời chỉ trích sắc bén nhất nhằm vào Fugu chính là lời chỉ trích mà Sakana tự mời gọi khi định vị nó như cơ sở hạ tầng chủ quyền. Một lớp điều phối định tuyến qua các API của bên thứ ba không ngăn được việc那些 API đó bị thu hồi. Nó biến một điểm lỗi duy nhất thành một điểm lỗi đã được đa dạng hóa, một cải thiện thực sự, nhưng các mô hình nền tảng vẫn thuộc về người khác, vẫn có thể bị các biện pháp kiểm soát xuất khẩu tương tự tác động và vẫn phải chịu những đợt cắt dịch vụ đột ngột như vậy. Quan hệ đối tác với NVIDIA hồi tháng 8 và các bổ sung Nemotron là câu trả lời cụ thể nhất cho vấn đề này cho đến nay — các mô hình trọng số mở trong nhóm là những mô hình không ai có thể tắt — nhưng Sakana không nói có bao nhiêu lưu lượng của Fugu Max thực sự đổ vào chúng.

Có một sự đánh đổi thứ hai, âm thầm hơn. Các quyết định định tuyến làm tăng độ trễ và loại bỏ tính xác định. Một yêu cầu hôm nay rơi vào một mô hình nhỏ có thể ngày mai lại rơi vào một mô hình khác nếu pool hoặc trọng số chi phí thay đổi, khiến hành vi khó kiểm thử hồi quy hơn và khó giải thích hơn cho bất kỳ ai kiểm toán hệ thống. Câu trả lời của Sakana là việc điều phối nằm ở bên trong và API hành xử như một mô hình duy nhất. Điều đó đúng ở lớp giao diện nhưng không đúng ở bên dưới, và những nhóm có yêu cầu khắt khe về khả năng tái lập nên kiểm tra điều đó cẩn thận trước khi nó trở thành thành phần chịu lực.

Nếu bạn muốn giành lợi thế về chi phí mà không biến pool thành phụ thuộc duy nhất của mình, cùng một mẫu ấy vẫn có sẵn để bạn tự compose. DSL định tuyến của chúng tôi cho phép bạn định nghĩa một bảng gồm nhiều mô hình phía sau một endpoint và quyết định mô hình nào xử lý lớp yêu cầu nào, còn model fusion chạy nhiều mô hình trên cùng một prompt và dung hòa các câu trả lời ở những chỗ mà sự đồng thuận quan trọng hơn giá. Failover xuyên nhà cung cấp nghĩa là khi một nhà cung cấp suy giảm — hoặc biến mất — lưu lượng sẽ chuyển sang một mô hình bạn đã tin cậy mà không cần thay đổi mã. Đó là phiên bản thận trọng hơn của canh bạc mà Sakana đang yêu cầu bạn đặt cược một cách toàn diện.

Screenshot of the OrcaRouter models catalogue showing 196 models across 15 providers under one API key and one bill, an OpenAI-compatible chat completions endpoint, and per-model token rates including GPT-6 Astra at $10 input and $50 output, Claude Fable 5.1 at $10 and $50, Qwen3.8 Max at $2 and $6, and Gemini 3.8 Flash at $0.750 and $3.75.

Đáng để nói chính xác về những gì chúng tôi cung cấp và không cung cấp ở đây. Sakana Fugu Max không có trong danh mục của chúng tôi — nó không phải là một mô hình có thể định tuyến ở phía chúng tôi, và nó chạy trên API cùng bảng điều khiển riêng của Sakana. Danh mục của chúng tôi là 196 mô hình từ 15 nhà cung cấp trên một khóa và một hóa đơn, với mức giá theo token được in trên từng thẻ và không cộng thêm phí nào lên trên. Điểm trùng lặp đáng chú ý với Fugu Max là ý tưởng, không phải danh mục sản phẩm: cả hai đều là lập luận rằng câu trả lời đúng cho câu hỏi "mô hình nào nên xử lý việc này" thường không phải là mô hình lớn nhất.

Ai nên di chuyển, và ai nên chờ đợi

Fugu Max là một trong những bản phát hành thú vị hơn trong tháng, chính vì nó không phải là một mô hình. Nếu bạn đã dùng Sakana Fugu, việc nâng cấp chỉ là thay đổi một dòng với mức giá thấp hơn và không có lý do gì để đắn đo. Nếu bạn đang chạy lưu lượng khối lượng lớn, độ phức tạp thấp trên một mô hình tầm trung và trả $10–$15 cho mỗi triệu token đầu ra, thì phép tính mà Sakana đưa ra đáng để bạn tự chạy một bài đo hiệu năng của riêng mình — hãy lấy một tuần yêu cầu thực tế, chạy chúng qua Fugu Max, và so sánh chất lượng với mô hình hiện tại của bạn thay vì so với các biểu đồ phân tán.

Nếu bạn cần số liệu benchmark đã được công bố trước khi cam kết, hãy chờ đã. Hiện chưa có gì độc lập về Fugu Max, bằng chứng của chính nhà cung cấp chỉ là một biểu đồ chứ không phải một bảng, và một trong sáu benchmark tiêu đề là của Sakana. Đó không phải là lý do để bác bỏ nó — mà là lý do để thử nghiệm nó trên lưu lượng của chính bạn, vốn là benchmark duy nhất có thể dự đoán kết quả của bạn. Và nếu khối lượng công việc của bạn mang tính tác tử, tầm xa và tốn kém nếu làm sai, thì mô hình cần xem xét trong cặp này là Fugu Ultra v2, không phải Fugu Max: nó là mô hình có số liệu đi kèm.

của chúng tôiRouting DSL cho phép bạn định nghĩa một tập hợp các mô hình phía sau một endpoint duy nhất và quyết định mô hình nào xử lý loại yêu cầu nào, còn model fusion chạy nhiều mô hình trên cùng một prompt và dung hòa các câu trả lời ở những chỗ mà sự đồng thuận quan trọng hơn giá cả.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày