Một thẻ tiêu đề hero ghi 'Fugu Max vs Kimi K3' với phụ đề 'Sakana đã chọn thước đo này', ba huy hiệu hình viên thuốc ghi '$6.00 so với $15.00 đầu ra', 'thấp hơn 60%, tính trên đầu ra' và '1M cố định so với cửa sổ chưa công bố', một dòng chân trang ghi 'Sakana AI, tháng 9 năm 2026 so với Moonshot AI, tháng 7 năm 2026', và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Fugu Max vs Kimi K3: Sakana đã chọn thước đo này, vậy hãy cùng đọc nó

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bản công bố của Sakana AI cho Fugu Max nêu đích danh đúng ba mô hình để biện minh cho mức giá của mình, và Kimi K3 của Moonshot AI là một trong số đó. Tuyên bố đưa ra là giá đầu ra của Fugu Max thấp hơn 40 đến 60 phần trăm so với ba mô hình kia, khiến Kimi K3 — chứ không phải Grok 4.6, cũng không phải Qwen3.8-Max — trở thành chuẩn so sánh mà chính Sakana chọn để định giá trị. Đó là một việc làm hào phóng một cách bất thường đối với một nhà cung cấp: họ đưa bạn một cây thước đo và chỉ cho bạn biết phải cầm nó ở đâu. Vậy nên trang này làm điều hiển nhiên và cầm nó đúng chỗ. Fugu Max ra mắt ngày 11 tháng 9 năm 2026 với mức giá 2,00 đô la cho mỗi triệu token đầu vào và 6,00 đô la cho mỗi triệu token đầu ra. Kimi K3 niêm yết ở mức 3,00 đô la và 15,00 đô la. Tuyên bố 60 phần trăm về giá đầu ra là đúng về mặt số học. Điều mà câu văn đó không nhắc tới là mô hình mà nó đang hạ giá công bố đầy đủ hồ sơ các kết quả được đo lường độc lập, còn mô hình đang hạ giá kia thì không công bố gì cả.

Câu 40 đến 60 phần trăm, được xem xét

• Đầu vào — Fugu Max $2.00 mỗi 1M token so với Kimi K3 $3.00 mỗi 1M token, mức tiết kiệm 33 phần trăm thay vì 40 đến 60 phần trăm mà bản phát hành nhấn mạnh

• Đầu ra — Fugu Max 6,00 USD mỗi 1 triệu token so với Kimi K3 15,00 USD mỗi 1 triệu token, tức thấp hơn 60 phần trăm, mức cao nhất trong phạm vi đã nêu của Sakana

• Đầu vào đã cache — Fugu Max $0.25 mỗi 1 triệu token so với Kimi K3 $0.30 mỗi 1 triệu token, mức chênh lệch đủ nhỏ để các vòng lặp nặng về cache sẽ không nhận ra.

• Cửa sổ ngữ cảnh — Fugu Max không công bố số liệu trong bản phát hành, so với Kimi K3 1,048,576 token

• Định giá lại cho prompt dài — Fugu Max không công bố bậc giá nào, so với Kimi K3 giữ mức cố định trong toàn bộ khoảng thời gian, không phụ thu thêm ở bất kỳ độ dài nào

• Triển khai — chỉ API nhà cung cấp Fugu Max, tư cách thành viên pool không được tiết lộ so với trọng số có thể tải xuống của Kimi K3 theo Giấy phép Kimi K3

• Đánh giá độc lập — Fugu Max không có, và không tồn tại trang Artificial Analysis nào cho bất kỳ mô hình Fugu nào, so với Kimi K3 với Chỉ số Trí tuệ Artificial Analysis là 44 và mức 93,40% chuẩn hóa trên SWE-bench Verified từ Vals AI

Hãy để ý hình dạng của hàng đầu tiên đó. Dải số đáng chú ý, 40 đến 60 phần trăm, là khoảng trải rộng trên ba đối thủ cạnh tranh được nêu tên, và Kimi K3 là cái tạo ra con số 60. Nếu chỉ xét đầu vào, so sánh là 33 phần trăm, vẫn là một khoản tiết kiệm thực sự nhưng là một câu khác. Đó không phải là lời chỉ trích về mức giá — $2.00 và $6.00 thực sự là những con số thấp đối với một hệ thống tự nhận có kết quả tiệm cận hàng đầu. Đây là một ghi chú về việc con số nào trong bản công bố đang làm nhiệm vụ thuyết phục, và về cách đoạn văn được sắp xếp xoay quanh nó.

Kimi K3 có trong danh mục của chúng tôi theo đúng mức giá của Moonshot — $3.00 mỗi triệu token đầu vào, $0.30 khi cache hit, $15.00 mỗi triệu token đầu ra — được chuyển thẳng với 0% phụ phí, nên nếu Moonshot thay đổi giá thì mức giá mới sẽ có hiệu lực trên cùng một key ngay trong ngày thay vì theo một chu kỳ di trú. Điều đó ở đây quan trọng hơn mức thông thường, bởi việc giảm giá từ phía thượng nguồn chính là yếu tố bào mòn hoặc mở rộng khoảng cách 60 phần trăm mà toàn bộ cuộc so tài này dựa vào.

Những gì thước đo công bố

Thành tích của Kimi K3 hoàn toàn ngược lại với sự thưa thớt. Model card của chính Moonshot báo cáo Terminal-Bench 2.1 đạt 88,3, GPQA Diamond đạt 93,5, HLE-Full đạt 43,5 tăng lên 56,0 khi dùng công cụ, SWE-Marathon đạt 42,0, OSWorld-Verified đạt 84,8, MCPMark-Verified đạt 94,5 và DeepSWE đạt 67,5. Tất cả đều do nhà cung cấp báo cáo, và có rất nhiều.

Lớp độc lập cũng tồn tại, và đây chính là phần quan trọng cho so sánh này. Artificial Analysis cho Kimi K3 44 điểm trên Chỉ số Trí tuệ v4.3 — đứng thứ hai trong số các mô hình trọng số mở, sau GLM-5.3 với 45 điểm — với thông lượng ghi nhận là 37,9 token đầu ra mỗi giây và thời gian đến token đầu tiên là 3,80 giây. Bộ khung tác tử chuẩn hóa của Vals AI đặt nó ở mức 93,40% trên SWE-bench Verified, sau Claude Opus 5DeepSeek V4 Pro nhưng rất sát. Nó cũng dẫn đầu Frontend Code Arena với 1679 Elo, trên Claude Fable 5 ở 1631 và GPT-5.6 Sol ở 1618. Một lưu ý: nếu bạn từng thấy Kimi K3 được ghi là 57 hoặc 60 trên Chỉ số Trí tuệ, thì đó là những con số trước khi điều chỉnh lại, từ thời điểm trước khi Artificial Analysis hiệu chỉnh lại thang đo vào tháng 9 năm 2026, và không nên được nhắc lại cùng với các con số hiện tại.

Cũng có một tín hiệu về mức sử dụng, và nó đến từ cổng vào của chính chúng tôi chứ không phải từ chiến dịch tiếp thị của bất kỳ ai: Kimi K3 đã chuyển khoảng 3,27 tỷ token qua OrcaRouter trong bảy ngày qua, mức lưu lượng lớn nhất so với bất kỳ mô hình nào trong so sánh này. Đó không phải là phép đo chất lượng. Đó là một mẫu lớn về thứ mà các nhà phát triển tìm đến khi chi phí duy nhất của việc lựa chọn là giá token, và nó cho thấy cửa sổ 1M cố định cùng trọng số mở đã giành được một phần đáng kể trong công việc tầm xa thực tế.

A two-column scoreboard titled 'Fugu Max vs Kimi K3 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Kimi K3: output price $15.00 per 1M, input price $3.00 per 1M, cached input $0.30 per 1M, context 1M flat with no surcharge, benchmarks Terminal-Bench 2.1 at 88.3, evidence Artificial Analysis Index 44 and SWE-bench Verified 93.40%. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Kimi K3 rows Moonshot-reported and per Artificial Analysis and Vals AI.' OrcaRouter logo bottom-right.

Bảng điểm không có con số nào trên đó

Sakana báo cáo rằng Fugu Max đạt điểm tổng thể tốt nhất trên sáu benchmark: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench và SWEFish. Nó cũng nói rằng Max mở rộng biên Pareto về chi phí-hiệu năng trên bảy trong số mười benchmark. Cả hai đều là những tuyên bố về thứ hạng trên một biểu đồ. Cả hai đều không đi kèm với một giá trị, một mức chênh lệch, hay một con số của đối thủ cạnh tranh.

Hai danh sách hầu như không giao nhau, và đó chính là vấn đề thực tế. Kimi K3 báo cáo Terminal-Bench 2.1 đạt 88.3; Sakana nói Fugu Max đứng đầu tổng thể trên Terminal Bench 2.1 và không công bố gì để đối chiếu với nó. Riêng dòng đó là minh họa rõ ràng nhất cho toàn bộ cuộc đối đầu: cả hai nhà cung cấp đều nêu cùng một bài kiểm tra, một bên công bố một con số, còn bên kia chỉ công bố chữ “best”. Cho đến khi Sakana công bố con số đó, không có bằng chứng nào được công bố trả lời liệu Fugu Max có đánh bại Kimi K3 trên benchmark mà Sakana chọn để dẫn đầu hay không.

Có một cách đọc công bằng về bản phát hành này đáng để nêu ra. Fugu Max là phân khúc chi phí — ra mắt cùng ngày với Fugu Ultra v2, vốn là bước đẩy về năng lực ở mức 5,00 đô-la cho đầu vào và 30,00 đô-la cho đầu ra — và lập luận của nó được vẽ trên một đồ thị Pareto, nơi điểm trên mỗi đô-la, chứ không phải điểm, mới là điều được khẳng định. Theo cách đóng khung đó, một con số benchmark trần trụi sẽ là thống kê kém trung thực hơn. Vấn đề là bản phát hành cũng bỏ sót mẫu số: chính thông tin do Sakana công bố thừa nhận rằng việc chuyển đổi mô hình giữa chừng có thể làm giảm tái sử dụng bộ nhớ đệm ngữ cảnh và tạo thêm token điều phối, đồng thời xác nhận công ty không tiết lộ tỷ lệ trúng bộ nhớ đệm của Max hay tổng chi phí token cho mỗi tác vụ. Vậy nên phép đo duy nhất có thể phân xử một lập luận về phân khúc chi phí lại chính là phép đo không được cung cấp.

Tạ tay bạn có thể cầm, hay một bể tiền bạn không thể thấy

Đây là lúc hai sản phẩm hoàn toàn không còn có thể so sánh với nhau nữa.

Kimi K3 phát hành trọng số có thể tải xuống, đây là một lối thoát thực sự: nếu giá cả hoặc điều khoản thay đổi, mô hình có thể được phục vụ từ hạ tầng của chính bạn. Giấy phép này hẹp hơn so với hàm ý thường thấy của "trọng số mở". Đây là Giấy phép Kimi K3 chứ không phải một giấy phép được OSI phê duyệt, và cách mô tả thường xuyên được lặp lại rằng nó là MIT sửa đổi đang gây tranh cãi. Các điều khoản yêu cầu một thỏa thuận riêng với Moonshot đối với các doanh nghiệp model-as-a-service có doanh thu trên 20 triệu USD trong bất kỳ mười hai tháng liên tiếp nào, cộng thêm việc ghi công cho các sản phẩm trên 100 triệu người dùng hàng tháng hoặc doanh thu 20 triệu USD mỗi tháng, với trường hợp sử dụng nội bộ được miễn trừ. Và quy mô thực tế là có thật: checkpoint có dung lượng khoảng 1,5 terabyte và Moonshot khuyến nghị 64 bộ tăng tốc trở lên, vì vậy việc tự triển khai là một quyết định về cụm suy luận chứ không phải quyết định về máy tính xách tay.

Fugu Max không cung cấp bất kỳ điều nào trong số đó — không trọng số, không pool có thể kiểm tra, không tùy chọn tự lưu trữ — và đổi lại, nó không áp đặt điều kiện giấy phép nào, vì chẳng có gì để cấp phép. Lợi ích mà Sakana nêu ra chính là mặt trái của khả năng kiểm soát: một pool trải rộng trên các mô hình trọng số mở và mô hình chuyên dụng, được mở rộng cho Max với dòng NVIDIA Nemotron, nghĩa là không nhà cung cấp thượng nguồn đơn lẻ nào có thể khiến sản phẩm của bạn sụp đổ bằng việc ngừng hỗ trợ hay tăng giá. Đó là một biện pháp phòng ngừa thực sự. Nó cũng không thể kiểm chứng từ bên ngoài, vì tư cách thành viên cố ý không được công bố, và điều đó có nghĩa là một kết quả từ Fugu Max mang theo ngày hết hạn mà một kết quả từ Kimi K3 không có.

Trọng số mở và một bể chứa không được tiết lộ là hai câu trả lời khác nhau cho cùng một nỗi sợ. Một bên nói rằng bạn có thể rời đi. Bên kia nói rằng chẳng có gì để rời bỏ cả.

Nơi cửa sổ phẳng quyết định điều đó

Ngữ cảnh 1.048.576 token của Kimi K3 không phân tầng — không có hạng ngữ cảnh dài, không phụ phí ở bất kỳ độ dài nào. Thông báo phát hành của Fugu Max không đề cập cửa sổ nào cả, nên không có gì để so sánh và không có gì để dựa vào mà lập kế hoạch. Đối với kiểu lập trình agentic dài hạn mà cả hai sản phẩm đều hướng tới, nơi các phiên làm việc dành phần lớn vòng đời của mình ở sâu trong ngữ cảnh, sự bất đối xứng đó quan trọng hơn cả bảng giá.

Tốc độ là hình ảnh phản chiếu của cùng một vấn đề. {{1}}Kimi K3{{/1}} đạt 37,9 token mỗi giây với thời gian đến token đầu tiên là 3,80 giây đã được đo, và nó chậm — thực sự là một hạn chế đối với một mô hình được xây dựng xoay quanh các vòng lặp dài, và {{2}}Artificial Analysis{{/2}} đánh dấu nó là đặc biệt dài dòng. {{3}}Sakana{{/3}} không công bố số liệu về độ trễ hay thông lượng cho {{4}}Fugu Max{{/4}}, điều mà đối với một trình điều phối có thể được coi là trung thực hơn là né tránh: thời gian phản hồi phụ thuộc vào việc nó chọn những mô hình nào và thực hiện bao nhiêu lượt. Nhưng điều đó có nghĩa là bạn không thể mô hình hóa chi phí thời gian thực của việc chuyển đổi mà không tự đo lường. Đối với {{5}}Fugu Ultra{{/5}} trước đó, người dùng đã công khai báo cáo các lần chạy kéo dài tới 30 phút. Đó là mô hình {{6}}tháng 6 năm 2026{{/6}} và không phải bằng chứng về {{7}}Max{{/7}}, nhưng đó là con số cần đánh bại khi bạn đo hiệu năng.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the opening argument about the two-dimensional frontier of capability against cost and the statement that Fugu Max expands the Pareto efficiency frontier by orchestrating Sakana's largest pool of open and specialized models to date.

Phán quyết, theo cách diễn đạt của chính Sakana

Sakana đã chọn Kimi K3 làm một trong ba mô hình mà Fugu Max có giá thấp hơn, và xét theo mức giá đầu ra thì tuyên bố này đứng vững: 6,00 đô la so với 15,00 đô la là thấp hơn 60 phần trăm, đúng bằng mức cao nhất của khoảng đã nêu. Cứ tin vào lời công bố, thì Fugu Max là sản phẩm rẻ hơn.

Giờ hãy áp dụng thước đo mà bản phát hành đã né tránh. Kimi K3 đắt hơn 33 phần trăm ở đầu vào và đắt hơn 150 phần trăm ở đầu ra — và với số tiền đó, nó cho bạn cửa sổ 1M token không có ngưỡng tái định giá đột ngột, một checkpoint có thể tải xuống theo giấy phép có điều kiện doanh thu, vị trí 44 trên Intelligence Index độc lập, điểm SWE-bench Verified chuẩn hóa là 93,40%, vị trí thứ nhất trên Frontend Code Arena, và lưu lượng thực tế lớn nhất trong số mọi mô hình được so sánh ở đây. Fugu Max cho bạn mức giá thấp hơn ở cả hai phía của token, sáu chiến thắng benchmark chưa được định lượng, tỷ lệ cache bằng một nửa của K3 mà không công bố tỷ lệ trúng, và một pool mà bạn không thể kiểm tra.

Kết luận trung thực là Sakana đã chọn một thước đo tôn nó lên về giá và không cho bạn thứ gì để kiểm chứng về năng lực. Nếu khối lượng công việc của bạn lớn và các tác vụ của bạn thuộc loại mà một điều phối viên có thể phân rã một cách đáng tin cậy, thì chênh lệch mức phí là tiền thật và Fugu Max xứng đáng có một thí điểm giới hạn phạm vi với việc hạch toán token được bật ngay từ yêu cầu đầu tiên. Nếu bạn cần một quyết định production mà bạn có thể bảo vệ trong quý này — một cửa sổ bạn có thể hoạch định dựa vào, một điểm số bạn có thể viện dẫn, và một mô hình bạn vẫn có thể chạy nếu nhà cung cấp biến mất — thì Kimi K3 là câu trả lời, và nó có trên OrcaRouter ở mức giá niêm yết của Moonshot với mức phí của nhà cung cấp được chuyển tiếp nguyên vẹn.

A screenshot of the OrcaRouter model page for Kimi K3 (English UI, captured September 11, 2026), showing the Featured badge, the identifier kimi/kimi-k3, by MoonshotAI dated 2026-07-15, vision, tools, JSON and reasoning capability tags, a 2.8-trillion-parameter Mixture-of-Experts description, a 1M-token context window with text and image input, list pricing of $3.00 per 1M input tokens and $15.00 per 1M output tokens, traffic of 3,274.3 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.