Thẻ hero cho màn đối đầu giữa Fugu Ultra v2 và Grok 4.6, đối chiếu một hệ thống điều phối với một mô hình suy luận đơn lẻ có ngữ cảnh lớn.
Guides & Insights

Fugu Ultra v2 so với Grok 4.6: Giá đầu ra gấp năm lần, một benchmark dùng chung

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Chỉ có đúng một benchmark mà trên đó Fugu Ultra v2Grok 4.6đều công bố một con số, và đó là DeepSWE: Sakana AI báo cáo 74,3 cho Fugu Ultra v2 trong thông báo ngày 11 tháng 9 năm 2026, còn tài liệu ra mắt Grok 4.6 của xAI đưa điểm DeepSWE v1.1 của chính mình là 65,9%. Đó là khoảng cách 8,4 điểm, và đây là phép so sánh sạch duy nhất mà hai công ty đưa ra. Mọi thứ khác mà bạn có thể đặt cạnh nhau — Chartography và SWEFish của Sakana đối chiếu với GPQA Diamond và CursorBench của Grok — đều được đo bằng những công cụ khác nhau bởi những phòng thí nghiệm khác nhau. Vậy nên câu hỏi trung thực không phải là "cái nào thông minh hơn". Mà là liệu lợi thế được cho là của Fugu Ultra v2 có đáng để trả 30 đô la cho mỗi triệu token đầu ra hay không, khi Grok 4.6 chỉ tính 6 đô la.

Hai câu trả lời khác nhau cho cùng một vấn đề

Grok 4.6 là một mô hình duy nhất, và hiện là mẫu chủ lực của dòng Grok — được ghi là "Latest" (Mới nhất) trong chính tài liệu dành cho nhà phát triển của nhà cung cấp, kế nhiệm Grok 4.5 với cùng cửa sổ ngữ cảnh 500.000 token, cùng bề mặt đầu vào văn bản/hình ảnh/tệp và cùng mức giá cơ bản. Mô hình có thời điểm cắt kiến thức là ngày 1 tháng 2 năm 2026 và cho phép điều chỉnh mức độ nỗ lực suy luận gồm low, medium, high và xhigh, với high là mặc định. Một chi tiết khiến nhiều người bất ngờ: không thể tắt chế độ suy luận. Các token suy nghĩ vẫn bị tính phí trong mọi yêu cầu, khiến chi phí đầu ra thực tế của Grok 4.6 phụ thuộc vào việc nó quyết định "suy nghĩ" chăm chừng đến mức nào.

Fugu Ultra v2 không thực sự là một mô hình theo nghĩa thông thường. Nó là tầng năng lực đỉnh cao trong dòng điều phối của Sakana AI — một endpoint duy nhất tương thích với OpenAI, có nhiệm vụ phân rã một tác vụ rồi phân phối nó cho một nhóm các mô hình khác, một số là mô hình trọng số mở, một số chuyên biệt. Cách Sakana định vị là nó đạt được đầu ra ở mức tiên phong "mà không cần dựa dẫm thiết yếu vào chính những mô hình tiên phong mà nó điều phối", và họ nói thẳng rằng Claude Fable 5, Claude Fable 5.1 và GPT-6 Astra bị loại khỏi nhóm đó. Bạn đang trả tiền cho tầng lập lịch, và cho từng token mà các tác nhân phụ đốt cháy.

Sự khác biệt đó không phải là chuyện hình thức. Đó chính là toàn bộ lý do khiến khoảng cách giá tồn tại, và là điều duy nhất khiến khoảng cách ấy có thể biện minh được.

Các bảng giá, bao gồm cả phần lặp lại

Đầu vào — Fugu Ultra v2 $5.00 mỗi 1M so với Grok 4.6 $2.00 mỗi 1M. Fugu đắt gấp 2,5× trước khi bất kỳ lệnh gọi phụ nào diễn ra.

Đầu ra — Fugu Ultra v2 $30,00 mỗi 1M so với Grok 4.6 $6,00 mỗi 1M. Chênh lệch 5×, và là yếu tố quyết định phần lớn hóa đơn.

Đầu vào được lưu đệm — 0,50 USD cho mỗi 1M ở cả hai. Giống hệt nhau. Hai nhà cung cấp vốn chẳng có điểm gì chung lại cùng chốt mức giá đọc bộ nhớ đệm như nhau, khiến những vòng lặp agent nặng về bộ nhớ đệm trở thành khối lượng công việc duy nhất mà hai bên thực sự so sánh được với nhau theo từng dòng.

Định giá lại theo ngữ cảnh dài — Grok 4.6 tăng gấp đôi lên $4.00 / $12.00 khi một lời nhắc vượt qua 200.000 token, và việc định giá lại áp dụng cho toàn bộ yêu cầu, không chỉ phần vượt mức. Mức phân hạng được báo cáo của Fugu Ultra v2 trên khoảng 272.000 token đầu vào chuyển sang khoảng $10.00 / $45.00, cũng áp dụng cho toàn bộ yêu cầu. Cả hai đều phạt các lời nhắc dài; Grok bắt đầu phạt sớm hơn 72K token.

Cửa sổ ngữ cảnh — Grok 4.6 500K token so với Fugu Ultra v2 1M theo như các danh mục liệt kê của bên thứ ba. Trang công bố của Sakana hoàn toàn không nêu con số ngữ cảnh nào, nên hãy coi mức 1M của nó là chưa được nhà cung cấp xác nhận.

Dòng về ngữ cảnh dài có cả mặt lợi lẫn mặt hại, và đáng để làm phép tính. Một prompt 300K token khiến bạn tốn 4,00 đô la cho mỗi triệu token đầu vào trên Grok 4.6 và khoảng 10,00 đô la trên Fugu Ultra v2. Một prompt 150K token tốn 2,00 đô la trên Grok và 5,00 đô la trên Fugu. Mô hình của Sakana đắt hơn ở mọi độ dài prompt — câu hỏi duy nhất là nó cần được gọi thường xuyên đến mức nào.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

Lập luận ủng hộ việc trả gấp 5× cho đầu ra

Lý lẽ biện hộ cho một orchestrator không nằm ở chỗ nó rẻ hơn trên mỗi token. Mà nằm ở chỗ nó cần ít lần thử hơn, và những token nó chi cho việc điều phối rẻ hơn những token bạn sẽ phải chi khi thất bại.

Đó là một lập luận xác đáng, và Sakana đang nói rõ điều đó: Fugu Ultra v2 hướng tới những công việc phức tạp gồm nhiều bước — nghiên cứu tự động, phát triển full-stack — nơi kiểu thất bại của một mô hình đơn lẻ là đi chệch hướng giữa chừng trong một lượt chạy dài. Nếu mức giá đầu ra $30 giúp bạn hoàn thành một tác vụ ngay lần đầu thay vì lần thứ ba, thì phụ phí trên mỗi token không còn quan trọng.

Có bằng chứng hỗ trợ từ chính phía nhà cung cấp, mặc dù nó có lợi cho nhà cung cấp và nên được đọc như vậy. Tài liệu ra mắt của xAI cho Grok 4.6 trích dẫn khoảng 53 lượt và khoảng 0,5 tỷ token đầu vào để giải quyết các tác vụ dài hạn, so với khoảng 103 lượt và 2,0 tỷ token đầu vào cho một mô hình tiên tiến cạnh tranh — một lập luận rằng bản thân Grok tiết kiệm chi phí trên mỗi tác vụ ngay cả ở mức giá thấp trên mỗi token. Cả hai công ty đều đang thực hiện cùng một động thái: đẩy bạn ra khỏi bảng giá và hướng tới chi phí trên mỗi công việc hoàn thành.

Điều đó có nghĩa là con số mang tính quyết định lại là thứ mà không nhà cung cấp nào công bố, và bạn phải tự đo lấy: lượng token tiêu tốn, từ đầu đến cuối, trên một tác vụ giống như của bạn.

Nơi mà mỗi cái đều thực sự yếu kém

Điểm yếu được công bố của Grok 4.6 là công việc terminal. Điểm Terminal-Bench v3.0 của nó ở mức 26%, kém xa nhóm dẫn đầu, dù cùng mô hình đó đạt mức cao hơn nhiều là 88,4% trên Terminal-Bench v2.1 cũ hơn — đây là những bài kiểm tra khác nhau và việc trộn chúng lại là một sai lầm mà bạn sẽ thấy trong nhiều bài đưa tin. Nó cũng giữ điểm GPQA Diamond cao nhất trong nhóm của mình ở mức 94,9%, nhưng GPQA Diamond từ đó đã bị loại khỏi chỉ số Artificial Analysis vì đã bão hòa, nên điểm cao ở đó không còn phân biệt được giữa các mô hình tiên phong như cách nó đã làm cách đây một năm.

Về phía độc lập, Artificial Analysis cho Grok 4.6 điểm 44 trên Chỉ số Trí tuệ v4.3 của mình, xếp hạng #20 trong số 200, với chi phí mỗi tác vụ là 1,86 USD. Con số 61 thường được lan truyền là từ một thang chỉ số đã bị thay thế và không nên được trích dẫn mà không nói rõ phiên bản nào đã tạo ra nó.

Điểm yếu của Fugu Ultra v2 là khâu kiểm chứng. Tính đến thời điểm công bố, chưa có tuyên bố nào của Sakana về nó — năm kết quả tốt nhất hoặc đồng hạng nhất, điểm Chartography 48,3 so với 27,3 của Opus 5 và 29,5 của Fable 5, điểm DeepSWE 74,3 — được tái lập một cách độc lập. Cũng không có số liệu nào về độ trễ hay thông lượng được công bố, điều này quan trọng hơn đối với một bộ điều phối so với một mô hình đơn lẻ, bởi vì thời gian phản hồi của nó phụ thuộc hoàn toàn vào việc nó quyết định gọi cái gì. Với Fugu Ultra phiên bản trước, các kiểm thử viên đã công khai báo cáo những lượt chạy kéo dài tới khoảng 30 phút; đó là mô hình tháng 6-2026, không phải v2, nhưng đó chính là kiểu hỏng hóc cần kiểm tra trước khi bạn đưa vào một luồng sản xuất.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Ghi chú về tên nhà cung cấp

Một điểm đáng lưu ý trước khi bạn tìm Grok 4.6 trong bảng điều khiển dành cho nhà phát triển: mô hình này luôn được gọi là Grok 4.6, nhưng thương hiệu của nhà cung cấp xung quanh nó đang biến động. Tài liệu của chính x​AI hiện mang tên SpaceXAI, một thay đổi mà hầu hết các bài đưa tin về bản ra mắt chưa bắt kịp. Các mã định danh mô hình và bề mặt API không thay đổi — Grok 4.6 là một mô hình Ope​nAI Responses hạng nhất và có thể thả vào các vòng lặp gọi công cụ hiện có mà không cần lớp chuyển dịch — nhưng nếu bạn đang tìm thẻ mô hình và thương hiệu trông sai, thì đó không phải lỗi của bạn.

Việc gọi một trong hai thứ này trong thực tế

Grok 4.6 đã có mặt trên OrcaRouter với đúng mức giá của nhà cung cấp — 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, được chuyển tiếp nguyên vẹn, không cộng thêm bất kỳ khoản nào, nên khi nhà cung cấp thay đổi giá thì ở đây cập nhật ngay trong cùng ngày chứ không phải theo một lịch trình di chuyển nào. Nó tương thích với OpenAI trên cùng URL cơ sở như mọi thứ khác trong danh mục, nghĩa là bạn có thể đặt nó trong một chuỗi dự phòng hoặc một quy tắc định tuyến thay vì mã hóa cứng, và bạn có thể chạy A/B nó với một mô hình khác mà không cần hợp đồng thứ hai hay thay đổi mã nguồn.

Fugu Ultra v2 không được chúng tôi định tuyến. Nó có sẵn từ API tương thích OpenAI của chính Sakana AI, và công ty cho biết một tích hợp Fugu hiện có sẽ chuyển sang nó chỉ với một thay đổi tham số. Nếu bạn muốn so sánh hai phương án này trên khối lượng công việc của mình, cách sắp xếp rẻ nhất là giữ Grok 4.6 trên gateway của bạn và gọi trực tiếp Fugu Ultra v2 từ Sakana phía sau một feature flag — cả hai đều dùng cùng định dạng yêu cầu, nên cùng một test harness sẽ hoạt động trên cả hai.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

Bản án

Grok 4.6 là lựa chọn mặc định hợp lý cho hầu hết các đội nhóm, và về giá thì không có đối thủ nào tiệm cận. Với mức $2,00 / $6,00 cùng chi phí đọc cache $0,50 và cửa sổ 500K, nó xử lý suy luận trên tài liệu dài, agent lập trình và công việc với tệp đa phương thức với chi phí chỉ bằng một phần năm giá đầu ra của Fugu Ultra v2, đồng thời được chấm điểm và kiểm định hiệu năng một cách độc lập. Điểm rủi ro của nó là độ dài prompt — ngưỡng 200K làm toàn bộ yêu cầu tăng gấp đôi chi phí — và các vòng lặp agent nặng về terminal, nơi các điểm số được công bố của nó không có tính cạnh tranh.

Fugu Ultra v2 chỉ đáng với mức giá cao cấp của nó nếu bạn có một loại khối lượng công việc cụ thể: những tác vụ dài, gồm nhiều bước, đòi hỏi tính tự chủ cao, nơi một mô hình đơn lẻ thường đi chệch hướng, và nơi bạn cũng muốn có thuộc tính kiến trúc mà Sakana đang bán — một tầng năng lực không phụ thuộc vào việc bất kỳ nhà cung cấp tiên phong nào còn duy trì được sự sẵn có hay còn giữ được mức giá rẻ. Đó là một điều thật sự đáng mong muốn. Nhưng đó là một tuyên bố, chưa phải là một phép đo, và khoảng cách DeepSWE khiến nó trông có vẻ đáng tin chỉ là một benchmark duy nhất từ một nhà cung cấp duy nhất vào ngày phát hành.

Nếu bạn không thể nói nhiệm vụ nào của mình hiện đang thất bại ở lần thử thứ hai hoặc thứ ba, thì bạn vẫn chưa có con số đủ để biện minh cho mức chênh lệch giá. Hãy đo điều đó trước. Các bảng giá đã cho bạn biết mọi thứ còn lại rồi.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày