Thẻ tiêu đề hero với dòng chữ 'Fugu Max vs Grok 4.6' cùng phụ đề 'Bảng giá giống hệt nhau, một điểm số được công bố', ba huy hiệu dạng viên ghi '$2.00 vs $2.00 đầu vào', '$6.00 vs $6.00 đầu ra' và 'Sáu chiến thắng, không số liệu', một dòng chân trang ghi 'Sakana AI, tháng 9 năm 2026 vs SpaceXAI, tháng 8 năm 2026', và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Fugu Max vs Grok 4.6: Bảng giá giống hệt nhau, chỉ một điểm số được công bố

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Fugu Max và Grok 4.6 có giá hoàn toàn giống nhau. Sakana AI ra mắt Fugu Max vào ngày 11 tháng 9 năm 2026, với mức giá 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra — và đó chính xác từng dòng là bảng giá mà SpaceXAI đã áp dụng cho Grok 4.6 kể từ khi nó ra mắt vào ngày 12 tháng 8. Sự trùng hợp này là dữ kiện hữu ích nhất trong cuộc so tài này, bởi nó xóa bỏ yếu tố giá khỏi cuộc tranh luận. Khi hai sản phẩm tính phí giống hệt nhau, câu hỏi duy nhất còn lại là bạn nhận được gì với số tiền đó, và ở điểm này hai bên rẽ hướng hoàn toàn. Grok 4.6 là một mô hình duy nhất mà bạn có thể ghim theo phiên bản, tra bảng điểm chuẩn, và đối chiếu với một chỉ số độc lập. Fugu Max là một bộ điều phối đã được huấn luyện, có nhiệm vụ phân phối từng tác vụ đến mô hình rẻ nhất trong nhóm của nó, và thông báo của Sakana tuyên bố nó đạt điểm tổng thể tốt nhất trên sáu bộ điểm chuẩn mà không công bố một con số nào từ bất kỳ bộ nào trong đó. Một trong hai thương vụ này có thể đo lường được trước khi bạn mua. Cái còn lại thì không.

Hai sản phẩm, một bảng giá

• Đầu vào — Fugu Max $2.00 mỗi 1 triệu token so với Grok 4.6 $2.00 mỗi 1 triệu token

• Đầu ra — Fugu Max $6.00 cho mỗi 1 triệu token so với Grok 4.6 $6.00 cho mỗi 1 triệu token

• Đầu vào đã cache — Fugu Max $0,25 mỗi 1 triệu token so với Grok 4.6 $0,50 mỗi 1 triệu token, dòng duy nhất mà hai mức giá khác nhau dù chỉ một chút

• Cửa sổ ngữ cảnh — Fugu Max không được nhà cung cấp công bố, so với Grok 4.6 là 500.000 token, không thay đổi so với Grok 4.5

• Định giá lại cho lời nhắc dài — Fugu Max không nêu bậc giá nào trong bản phát hành so với Grok 4.6 tăng gấp đôi lên $4.00 / $12.00 khi một yêu cầu đơn lẻ vượt quá 200,000 token, áp dụng cho toàn bộ yêu cầu thay vì chỉ phần vượt mức

• Kiểm soát suy luận — Fugu Max không được hiển thị, so với Grok 4.6 có bốn mức nỗ lực, từ low đến xhigh, mặc định là high và không thể tắt

• Kiến trúc — Fugu Max là một bộ điều phối được huấn luyện trên một nhóm không được tiết lộ, bao gồm các mô hình trọng số mở và mô hình chuyên biệt, được mở rộng cho Max với dòng NVIDIA Nemotron thông qua hợp tác với NVIDIA, so với Grok 4.6 chỉ một mô hình ở một phiên bản

• Đánh giá độc lập — Fugu Max không có công bố nào, và không tồn tại trang Artificial Analysis nào cho bất kỳ mô hình Fugu nào so với Grok 4.6, một Chỉ số Thông minh Artificial Analysis trực tiếp là 44, xếp hạng #20 trong số 200

Cột rẻ là cột không thể dự báo được

Hãy nhìn vào chỗ Fugu Max thực sự thắng về giá: mức đọc cache, chỉ bằng một nửa so với Grok 4.6. Đó là một lợi thế thực sự, và nó lại đúng vào chỗ sai để xây dựng một mô hình chi phí, bởi vì giá cache chỉ mang lại lợi ích tương ứng với tỷ lệ cache hit của bạn — mà Sakana không công bố tỷ lệ đó cho Fugu Max. Bản phát hành cũng không nêu cửa sổ ngữ cảnh, cũng không nêu hạng ngữ cảnh dài, cũng không nêu mức trần đầu ra. Vậy nên cột duy nhất mà Fugu Max rẻ hơn Grok 4.6 là một khoản giảm giá có độ lớn chưa biết, được áp dụng cho một phần chưa biết trong số token của bạn.

Điểm yếu của Grok 4.6 ít nhất là có thể nhìn thấy được. Ngưỡng 200.000 token của nó khá gắt — nó định giá lại toàn bộ yêu cầu, nên một prompt 250.000 token bị tính theo mức giá gấp đôi ngay từ token đầu tiên, chứ không phải từ token thứ 200.001. Nhưng bạn có thể thấy được vách ngưỡng đó, đo prompt của mình so với nó, và quyết định xem có nên chia nhỏ hay không. Đây chính là sự khác biệt về bản chất: một hệ thống công bố biểu giá có hình dạng mà bạn có thể lên kế hoạch xoay quanh, còn hệ thống kia công bố một mức giá chủ đạo mà không kèm biểu giá nào.

Sáu chiến thắng và không một điểm nào.

Các benchmark mà Sakana nêu tên là Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench và SWEFish. Năm trong số đó là những đánh giá công khai đã được công nhận. Cái thứ sáu, SWEFish, là benchmark lập trình của chính Sakana, nghĩa là một trong sáu chiến thắng được tuyên bố được chấm điểm bằng một bài kiểm tra do nhà cung cấp tự viết ra và chưa phát hành. Với năm cái còn lại, thông cáo phát hành nói rằng Fugu Max đạt điểm tổng thể tốt nhất và dừng lại ở đó — không có điểm số, không có mức chênh lệch, không có con số của đối thủ nào để đặt bên cạnh.

Đối chiếu điều đó với bảng mà SpaceXAI công bố cho Grok 4.6, bảng này hoàn toàn do nhà cung cấp báo cáo nhưng ít nhất cũng là một bảng: GDPVal-AA v2 đạt 1.753, AA-Briefcase đạt 1.577, DeepSWE v1.1 đạt 65,9%, CursorBench v3.2 đạt 69,9% và GPQA Diamond đạt 94,9%. Tài liệu ra mắt cũng báo cáo khoảng 53 lượt và khoảng nửa tỷ token đầu vào để giải quyết các tác vụ tầm xa trên AA-Briefcase, so với khoảng 103 lượt và hai tỷ token đối với một mô hình tiên tiến cạnh tranh — một lập luận, một lần nữa do nhà cung cấp báo cáo, rằng Grok rẻ trên mỗi công việc hoàn thành ngay cả ở mức giá khiêm tốn trên mỗi token.

Hai trong số những con số về Grok đó cần được xử lý trước khi bạn trích dẫn chúng. Thứ nhất là điểm GPQA Diamond nổi bật 94,9% của nó đến từ một bộ đánh giá mà Artificial Analysis đã ngừng sử dụng vì bị bão hòa, nên nó không còn phân tách được các mô hình tiên tiến như trước nữa. Thứ hai là con số bạn sẽ thấy trong các bài viết cũ: chỉ số Artificial Analysis Intelligence Index là 61 đối với Grok 4.6. Đó là thang đo trước khi được điều chỉnh lại. Artificial Analysis đã hiệu chỉnh lại chỉ số này vào tháng 9 năm 2026, và con số hiện hành là 44, xếp thứ 20 trên 200, với chi phí 1,86 đô la cho mỗi tác vụ Intelligence Index. Bất kỳ ai xếp hạng Grok 4.6 so với Claude Fable 5 hay GPT-5.6 Sol dựa trên con số 61 đều đang so sánh kết quả đo từ hai loại công cụ khác nhau.

A two-column scoreboard titled 'Fugu Max vs Grok 4.6 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Grok 4.6: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.50 per 1M, context 500K with a 200K repricing cliff, benchmarks GDPVal 1,753 and DeepSWE 65.9%, evidence Artificial Analysis Index 44 ranked #20 of 200. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Grok 4.6 rows SpaceXAI-reported and per Artificial Analysis. No independent Fugu Max evaluation exists.' OrcaRouter logo bottom-right.

Những gì giá token của một orchestrator không bao gồm

Bài viết của chính Sakana về bản phát hành này thừa nhận vấn đề mang tính cấu trúc. Vì Fugu Max chuyển đổi giữa các mô hình trong một tác vụ duy nhất, nó “có thể làm giảm việc tái sử dụng bộ nhớ đệm ngữ cảnh và cũng tạo thêm token điều phối” — và công ty không tiết lộ tỷ lệ trúng bộ nhớ đệm ngữ cảnh hay tổng chi phí token cho mỗi tác vụ. Mọi tác nhân mà bộ điều phối khởi tạo đều ghi văn bản suy luận và đầu ra, và tất cả đều được tính phí ở mức 6,00 đô la mỗi triệu. Mức giá này giống hệt với Grok 4.6. Nhưng khối lượng thì không, và khối lượng chính là biến số mà một trang giá không thể cho bạn thấy.

Cả hai nhà cung cấp đều đang thúc bạn đi theo cùng một hướng điều chỉnh — ngừng so sánh mức giá, bắt đầu so sánh chi phí cho mỗi công việc đã hoàn thành — nhưng chỉ một trong số họ đưa cho bạn một con số để bắt đầu. Grok 4.6 xuất hiện với một hồ sơ số lượt và token được công bố. Fugu Max xuất hiện với một chỉ dẫn rằng hãy tự đo lấy.

Có một cách diễn giải công bằng cho sự im lặng của Fugu Max và điều đó đáng được nói rõ. Max là bậc tối ưu hóa chi phí trong dòng Fugu, ra mắt cùng ngày với Fugu Ultra v2, vốn là bước đẩy mạnh về năng lực với mức $5.00 cho đầu vào và $30.00 cho đầu ra. Lập luận trực quan của Sakana dành cho Max là một biểu đồ Pareto — năng lực so với chi phí — và trên biểu đồ Pareto, điểm benchmark thô không phải là vấn đề; điểm trên mỗi đô-la mới là toàn bộ tuyên bố. Nếu đó là lập luận, thì việc in sáu điểm chiến thắng mà không kèm chi phí của chúng mới là biểu đồ gây nhầm lẫn, chứ không phải biểu đồ còn thiếu. Điều mà bản phát hành vẫn còn nợ người mua là một mẫu số, và nó không cung cấp mẫu số đó.

Nơi Grok 4.6 thực sự bị phơi bày

Khả năng làm việc với terminal là mảng được công bố yếu nhất của Grok 4.6. Điểm Terminal-Bench v3.0 của nó chỉ ở mức 26%, kém xa nhóm dẫn đầu. Hãy cẩn thận với con số bên cạnh: cùng mô hình đó đạt 88.4% trên Terminal-Bench v2.1, và đây là những bài kiểm tra khác nhau. Bạn sẽ thấy hai con số này bị hòa trộn trong các bài đưa tin, và sự hòa trộn đó tô hồng Grok đáng kể.

Rủi ro thứ hai là không thể tắt suy luận. Token suy nghĩ vẫn bị tính phí ở mọi yêu cầu, nên chi phí đầu ra thực tế của Grok 4.6 phụ thuộc vào mức độ model quyết định suy nghĩ về prompt của bạn. Núm điều chỉnh effort cho phép bạn kiểm soát ở mức thấp nhất, nhưng không có tùy chọn bằng 0.

Đối lập với điều đó, Grok 4.6 có thứ mà Fugu Max hiện không thể cung cấp ở bất kỳ mức giá nào: một con số. Mọi dòng ở trên đều có thể được bên thứ ba kiểm chứng, và mục Artificial Analysis nghĩa là đã có một bên kiểm chứng rồi. Sáu chiến thắng của Fugu Max được công bố cùng ngày với mô hình, bởi chính công ty đã tạo ra nó, và tính đến thời điểm này chưa ai ngoài Sakana chạy thử nó.

Gọi một cái, điều khiển cái kia

Grok 4.6 có mặt trên OrcaRouter với mức giá niêm yết của SpaceXAI — 2,00 USD mỗi triệu token đầu vào, 0,50 USD khi trúng bộ đệm, 6,00 USD mỗi triệu token đầu ra — được chuyển nguyên với mức phụ phí 0%, nên khi nhà cung cấp thay đổi giá, gateway của chúng tôi nhận được ngay trong cùng ngày thay vì theo một lịch trình di chuyển. Nó tương thích với OpenAI trên cùng URL cơ sở như phần còn lại của danh mục, nghĩa là bạn có thể đưa nó vào một chuỗi dự phòng hoặc đặt sau một quy tắc định tuyến có điều kiện thay vì mã hóa cứng một nhà cung cấp vào đường dẫn production, và bạn có thể A/B nó với một mô hình khác mà không cần hợp đồng thứ hai. Nó đã chuyển 46,6 triệu token qua gateway trong bảy ngày qua.

Fugu Max không có trong danh mục của chúng tôi. Nó đến với bạn thông qua API tương thích OpenAI của chính Sakana và một số nền tảng bên thứ ba, và công ty nói rằng một tích hợp Fugu hiện có sẽ nâng cấp lên nó chỉ với một thay đổi tham số. Vì cả hai dùng cùng định dạng yêu cầu, một đánh giá đặt chúng sau cùng một cờ chỉ là hoán đổi URL cơ sở chứ không phải viết lại — đó là cách đúng để giải quyết tranh luận cụ thể này, vì tranh luận xoay quanh token cho mỗi tác vụ hoàn thành và chỉ khối lượng công việc của chính bạn mới tạo ra được con số đó.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the introductory argument that a system deploying a multi-trillion-parameter model for a simple lookup is wasteful, and a cost-versus-performance chart placing Fugu Max on a frontier formed by Fugu models above the frontier formed by single models.

Nên mua cái nào

Grok 4.6 là lựa chọn mặc định có thể bảo vệ. Với bảng giá giống hệt của Fugu Max, nó mang đến cho bạn cửa sổ ngữ cảnh 500K mà bạn có thể lập kế hoạch dựa trên, một phiên bản bạn có thể ghim, bốn mức độ kiểm soát suy luận, một vị trí chỉ số độc lập ở mức 44 với con số chi phí trên mỗi tác vụ bên cạnh, và nhiều tháng đo lường của bên thứ ba. Chi phí của nó rất cụ thể và đã biết: vách đá tái định giá 200K, suy luận luôn bị tính phí, và một hồ sơ công việc terminal còn kém xa so với các đối thủ.

Fugu Max là canh bạc thú vị hơn và, dựa trên bằng chứng hiện có, cũng là canh bạc khó kiểm chứng hơn. Luận cứ thiết kế là vững chắc — nếu một bộ điều phối chọn một cách đáng tin cậy mô hình rẻ nhất có thể hoàn thành nhiệm vụ của bạn, chi phí trung vị của bạn cho mỗi công việc hoàn thành sẽ giảm ngay cả khi bảng giá của bạn không giảm. Nhưng ở mức $2.00 / $6.00, tỷ lệ token không phải là nơi lợi thế của Fugu Max nằm; mức đó chính xác là của Grok 4.6. Lợi thế phải đến từ việc dùng ít token hơn, và Sakana vẫn chưa công bố phép đo lường có thể cho thấy nó làm được như vậy.

Vậy hãy chạy so sánh theo cách cả hai nhà cung cấp đang yêu cầu bạn. Đặt Grok 4.6 lên gateway của bạn, gọi Fugu Max sau một cờ tính năng, và đếm token đầu ra trên mỗi tác vụ hoàn thành trong công việc giống như của bạn. Nếu Fugu Max hoàn thành với ít token hơn so với một mô hình đơn lẻ ở cùng mức giá, thì khoản giảm giá nhờ bộ nhớ đệm và khả năng phối hợp thực sự là tiền thật, và việc chuyển đổi là hợp lý. Nếu không, bạn đang trả mức giá y hệt cho một hệ thống mà thành phần của nó có thể thay đổi ngay dưới bạn mà số phiên bản không hề nhúc nhích.

Đối với mọi thứ bạn có thể quyết định trong quý này mà không cần phép đo đó, hãy bắt đầu với mô hình có bảng điểm.

A screenshot of the OrcaRouter model page for Grok 4.6 (English UI, captured September 11, 2026), showing the NEW and Featured badges, the identifier grok/grok-4.6, by SpaceXAI dated 2026-08-12, vision, tools, JSON and reasoning capability tags, a 500K-token context window with text, image and file input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, traffic of 46.6 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày