
Fugu Ultra v2 vs Kimi K3: Hai bộ định tuyến, hai tầm cao
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Cả hai hệ thống này đều là router, và đó là điều đầu tiên mà hầu hết các bài viết bỏ sót. Kimi K3 là một mô hình Mixture-of-Experts với 2,8 nghìn tỷ tham số, chỉ kích hoạt khoảng 104 tỷ tham số mỗi token — nghĩa là với mỗi token nó sinh ra, nó đưa ra một quyết định định tuyến, chọn 16 trong số 896 chuyên gia của mình để đảm nhận công việc. Fugu Ultra v2, được Sakana AI công bố vào ngày 11 tháng 9 năm 2026, là một router ở một tầm cao hoàn toàn khác: nó nhận một tác vụ đầu vào, chia nhỏ tác vụ đó ra, rồi phân phối các phần việc cho một nhóm các mô hình riêng biệt. Một bên định tuyến bên trong một lượt lan truyền xuôi; bên kia định tuyến xuyên suốt cả một đội mô hình. Hiểu rằng chúng chỉ là cùng một ý tưởng ở hai quy mô là cách nhanh nhất để thấy vì sao mức giá của chúng chênh nhau 2× ở đầu vào và 5× ở đầu ra.
Hai bộ định tuyến, nằm cạnh nhau
• Kimi K3 — mô hình chủ lực của Moonshot AI, ra mắt giữa tháng 7 năm 2026 với trọng số mở được công bố vào ngày 27 tháng 7 năm 2026. Kiến trúc của nó khác thường ngay cả theo tiêu chuẩn năm 2026: 69 lớp Kimi Delta Attention xen kẽ với 24 lớp Gated MLA, Attention Residuals, thiết kế "Stable LatentMoE" và bộ mã hóa thị giác MoonViT-V2 với 401 triệu tham số. Trọng số được phát hành ở định dạng MXFP4 với kích hoạt MXFP8 theo phương pháp huấn luyện nhận biết lượng tử hóa. API lưu trữ của nó cho phép điều chỉnh mức độ suy luận với đúng một giá trị được hỗ trợ — max.
• Fugu Ultra v2 — tầng điều phối có năng lực đỉnh cao của Sakana AI, và không phải là một mô hình nền tảng theo nghĩa thông thường. Đây là một endpoint đơn tương thích với OpenAI, có nhiệm vụ phân rã các tác vụ và điều phối chúng trên một nhóm gồm các mô hình trọng số mở và các mô hình chuyên biệt. Sakana tuyên bố rằng Claude Fable 5, Claude Fable 5.1 và GPT-6 Astra bị loại khỏi nhóm đó, đồng thời công bố mốc cắt dữ liệu huấn luyện là 20260828. Không có số lượng tham số nào được công bố, bởi vì không có tham số nào để đếm theo cách bạn vẫn làm với K3 — năng lực nằm ở chính sách lập lịch.
Hệ quả là K3 là một thành phần, còn Fugu Ultra v2 là một tổ hợp lắp ráp. Điều đó khiến so sánh này trở nên khác thường: hai hệ thống này không chỉ là đối thủ, mà còn là những nguyên liệu tiềm năng. Một mô hình như K3 đúng là kiểu hệ thống trọng số mở, ngữ cảnh dài, gọi công cụ mà một bộ điều phối có khả năng sẽ thuê. Sakana không công bố thành viên của pool, nên liệu K3 có nằm trong Fugu Ultra v2 hay không vẫn chưa rõ — nhưng nếu có, thì một phần thứ bạn trả theo mức giá của Fugu chính là token của K3 kèm một khoản markup.
Chênh lệch giá thực sự là gì
• Đầu vào — Fugu Ultra v2 ở mức được báo cáo là 5,00 USD/1M (theo niêm yết của bên thứ ba; trang thông báo của Sakana không công bố mức giá riêng của họ) so với Kimi K3 ở mức 3,00 USD/1M, với các lượt trúng bộ nhớ đệm ở mức 0,30 USD.
• Đầu ra — Fugu Ultra v2 với mức giá được báo cáo là $30.00 cho mỗi 1M, so với Kimi K3 là $15.00 cho mỗi 1M. Giá chỉ bằng một nửa, cho một mô hình mà bạn còn có thể tải về.
• Đầu vào được cache — Fugu Ultra v2 $0.50 mỗi 1M so với Kimi K3 $0.30 mỗi 1M khi cache trúng. Trong một vòng lặp agent dài với system prompt ổn định, khoảng chênh lệch đó sẽ cộng dồn qua mỗi lượt.
• Phân tầng ngữ cảnh — Kimi K3 giữ mức giá không đổi trên toàn bộ cửa sổ 1,048,576 token mà không có phụ phí ngữ cảnh dài. Mức phân tầng được báo cáo của Fugu Ultra v2 khi vượt khoảng 272,000 token đầu vào sẽ đẩy toàn bộ yêu cầu lên khoảng $10.00 / $45.00.
Dòng cuối cùng đó chính là dòng quyết định hóa đơn thực tế. Một phiên chạy agent tầm xa dành phần lớn vòng đời của nó ở mốc vượt qua 272K token, đúng chỗ mà mức giá cố định của K3 vẫn giữ nguyên còn của Fugu Ultra v2 thì tăng gấp đôi. Nếu khối lượng công việc của bạn giống như vậy, khoảng cách thực tế ở phía đầu vào gần với 3,3× hơn là 1,7×.

Con số duy nhất mà họ chia sẻ
Cả hai nhà cung cấp đều báo cáo DeepSWE, và kết quả so sánh này không mấy thiện chí với Fugu như cách định vị khi ra mắt của nó gợi ý. Sakana ghi Fugu Ultra v2 đạt 74,3. Moonshot ghi Kimi K3 đạt 67,5 — do nhà cung cấp báo cáo, lấy từ model card. Đó là khoảng cách 6,8 điểm trên một benchmark tác tử lập trình, con số này là thật, nhưng đây chỉ là một bài kiểm tra trong một bộ công bố lớn hơn nhiều, và cũng chính bài kiểm tra mà Sakana dẫn trước GPT-5.6 Sol 1,6 điểm. Một benchmark mà ba nhà cung cấp khác nhau đều nằm trong khoảng bảy điểm thì đang đo lường một điều gì đó có thật, nhưng không phân tách họ một cách dứt khoát.
Ngoài điều đó ra, hai bên công bố trên những kệ hoàn toàn khác nhau. Các con số K3 của Moonshot gồm Terminal-Bench 2.1 đạt 88.3, GPQA Diamond đạt 93.5, HLE-Full đạt 43.5 (56.0 khi dùng công cụ), SWE-Marathon đạt 42.0, OSWorld-Verified đạt 84.8 và MCPMark-Verified đạt 94.5 — tất cả đều do nhà cung cấp báo cáo, tất cả đều nằm trên model card. Tám chỉ số của Sakana dành cho Fugu Ultra v2 bao gồm hai benchmark nội bộ, SWEFish và Toolathon, mà không ai ngoài Sakana có thể tái lập.
Một cách độc lập, chỉ một trong số chúng từng được đo lường. Kimi K3 đạt 44 trên Artificial Analysis Intelligence Index v4.3 — thứ hai trong số các mô hình trọng số mở, sau GLM-5.3 với 45 — và 93,40% trên SWE-bench Verified dưới khung đánh giá tác nhân chuẩn hóa của Vals AI, xếp sau Claude Opus 5 và DeepSeek V4 Pro nhưng khá sát. Nó cũng dẫn đầu Frontend Code Arena với 1679 Elo, trên Fable 5 ở 1631 và GPT-5.6 Sol ở 1618. Nếu bạn từng thấy K3 được ghi là 57 hoặc 60, đó là thang chỉ số đã bị thay thế và không nên lặp lại.
Fugu Ultra v2 không có bất kỳ điểm số độc lập nào. Nó được công bố vào ngày 11 tháng 9 năm 2026 và chưa có ai ngoài Sakana chạy nó.
Tốc độ: một được đo, một không
Kimi K3 chậm, và điều này được đo lường chứ không phải chỉ là lời tuyên bố: Artificial Analysis ghi nhận 37,9 token mỗi giây với thời gian đến token đầu tiên là 3,80 giây, và đánh dấu nó là đặc biệt dài dòng. Đối với một mô hình được xây dựng xoay quanh lập trình tác tử tầm xa, thông lượng là một hạn chế thực sự — một mô hình chậm trong một vòng lặp dài tiêu tốn thời gian thực, chứ không chỉ tiền bạc.
Sakana hoàn toàn không công bố số liệu nào về độ trễ hay thông lượng cho Fugu Ultra v2. Đối với một bộ điều phối, điều đó có thể nói là trung thực chứ không phải né tránh, vì thời gian phản hồi phụ thuộc hoàn toàn vào việc nó quyết định gọi những mô hình nào và nó thực hiện bao nhiêu lượt. Nhưng điều đó cũng có nghĩa là bạn không thể mô hình hóa chi phí thời gian thực của việc chuyển sang nó mà không tự mình đo đạc. Với Fugu Ultra trước đó, những người kiểm thử đã công khai báo cáo các lần chạy kéo dài tới gần 30 phút; đó là mô hình tháng 6 năm 2026 và không phải bằng chứng về v2, nhưng đó là con số cần đánh bại khi bạn đo chuẩn.

Trọng số mở, kèm một điều kiện đáng đọc
Trọng số của Kimi K3 có thể tải xuống, đây là một khác biệt thực sự so với mô hình chỉ chạy trên máy chủ của Fugu Ultra v2 — nhưng giấy phép lại hẹp hơn so với điều mà cụm từ "trọng số mở" thường hàm ý. K3 được phát hành theo Giấy phép Kimi K3, không phải một giấy phép MIT hay Apache được OSI phê duyệt, và tuyên bố được lặp lại rộng rãi rằng nó là "MIT sửa đổi" đang gây tranh cãi. Các điều khoản yêu cầu một thỏa thuận riêng với Moonshot đối với doanh nghiệp cung cấp mô hình dưới dạng dịch vụ có doanh thu trên 20 triệu USD trong bất kỳ mười hai tháng liên tiếp nào, cộng với việc ghi công đối với sản phẩm có trên 100 triệu người dùng hàng tháng hoặc doanh thu hàng tháng trên 20 triệu USD. Sử dụng nội bộ được miễn trừ.
Vậy cách diễn đạt trung thực là: K3 cho bạn những trọng số mà bạn có thể nắm giữ, kiểm tra, tinh chỉnh và tự vận hành, tùy thuộc vào một điều kiện thương mại gắn với ngưỡng doanh thu. Fugu Ultra v2 không cho bạn bất kỳ điều nào trong số đó — không có trọng số, không có tập hợp nào có thể kiểm tra, không thể tự vận hành — nhưng cũng không áp đặt điều kiện doanh thu nào, vì không có gì để cấp phép. Cái nào trong số đó thoáng hơn hoàn toàn phụ thuộc vào việc bạn có phải là kiểu công ty mà giấy phép K3 hướng tới hay không.
Một lưu ý thực tế nếu định tự vận hành: checkpoint của K3 nặng khoảng 1,5 terabyte và nhà cung cấp khuyến nghị dùng từ 64 accelerator trở lên. "Open weights" ở đây đồng nghĩa với một quyết định về cụm suy luận, chứ không phải chuyện chạy trên laptop. Với hầu hết các đội nhóm, dù theo hướng nào thì API vẫn là lựa chọn hợp lý — đó là lý do vì sao việc hỗ trợ vLLM và SGLang ngay từ ngày đầu lại quan trọng hơn cả việc tải về.
Lưu lượng truy cập của chính chúng tôi nói lên điều gì
Một điểm dữ liệu mà cả hai nhà cung cấp đều không công bố, và có giá trị hơn vẻ ngoài của nó: trên khắp cổng OrcaRouter, Kimi K3 là mô hình được sử dụng nhiều nhất trong số bất kỳ mô hình nào được thảo luận trong bài viết này, với khoảng cách rất lớn, luân chuyển khoảng 3,27 tỷ token trong bảy ngày qua.
Đó không phải là một bài kiểm chuẩn và nó không kết luận được điều gì về chất lượng. Nhưng đó là một mẫu lớn về những gì các nhà phát triển thực sự chọn khi quyết định đó không tốn kém gì ngoài giá token, và nó cho thấy sự kết hợp của K3 bao gồm cửa sổ 1M tính giá cố định, trọng số mở và thứ hạng cao trên đấu trường lập trình đã giành được một phần đáng kể trong công việc tác tử ngữ cảnh dài thực tế. Fugu Ultra v2 không có tín hiệu có thể so sánh được, vì nó mới ra mắt hôm nay.

Đi đến từng nơi trong số đó
Kimi K3 đã có mặt trên OrcaRouter với đúng mức giá của Moonshot — $3.00 cho mỗi triệu token đầu vào, $0.30 khi trúng cache, $15.00 cho mỗi triệu token đầu ra — được chuyển tiếp nguyên vẹn, không cộng thêm markup, nên khi nhà cung cấp thay đổi giá thì ở đây cập nhật ngay trong cùng ngày chứ không theo một lịch di trú nào. Mô hình này tương thích với OpenAI trên cùng base URL như phần còn lại của danh mục, và vì nó nằm sau cùng một gateway với mọi thứ khác, bạn có thể đưa nó vào một chuỗi dự phòng hoặc định tuyến có điều kiện tới nó, thay vì gắn cứng một nhà cung cấp duy nhất vào đường chạy production. Điều này ở đây còn quan trọng hơn mức thông thường: một mô hình 2.8T tham số được phục vụ ở tốc độ 37.9 token mỗi giây đúng là kiểu phụ thuộc đáng để có một phương án dự phòng phía sau.
Fugu Ultra v2 không do chúng tôi định tuyến. Nó có sẵn từ API tương thích OpenAI của chính Sakana AI, và công ty cho biết các tích hợp Fugu hiện có chỉ cần thay đổi một tham số là chuyển sang dùng nó. Cả hai mô hình dùng chung một định dạng yêu cầu, nên một đánh giá đặt chúng sau cùng một cờ chỉ là đổi base-URL chứ không phải viết lại.
Nên chọn cái nào
Kimi K3 là lựa chọn mua hợp lý hơn cho gần như mọi khối lượng công việc. Nó có giá bằng một nửa Fugu Ultra v2 ở cả đầu vào và đầu ra, ổn định xuyên suốt cửa sổ 1M mà không có vách đá ngữ cảnh dài, được chấm độc lập 44 điểm trên chỉ số Artificial Analysis hiện tại, có thể tự triển khai theo giấy phép giới hạn theo doanh thu, và đã là mô hình có lưu lượng truy cập cao nhất trong so sánh này với khoảng cách lớn. Điểm đánh đổi của nó là tốc độ và độ dài dòng: 37,9 token mỗi giây thực sự chậm đối với các vòng lặp agent, và giấy phép có sức ràng buộc nếu bạn là một doanh nghiệp cung cấp mô hình dưới dạng dịch vụ quy mô lớn.
Fugu Ultra v2 là lựa chọn đáng mua nếu bạn muốn thuộc tính cụ thể mà Sakana đang bán — một tầng năng lực phân rã công việc nhiều bước khó khăn qua một nhóm mà về mặt cấu trúc loại trừ các nhà cung cấp tiên phong, để không một mô hình thượng nguồn đơn lẻ nào có thể bị thu hồi, định giá lại hoặc cắt đứt bên dưới bạn. Lợi thế DeepSWE của nó so với K3 là có thật và được nhà cung cấp báo cáo; vị trí trong top hai trên bảy trong tám chuẩn đánh giá cũng được nhà cung cấp báo cáo, và trên các bài kiểm tra mà một phần không tồn tại ở bất kỳ nơi nào khác.
Điều đáng chú ý là cả hai đều là những quyết định định tuyến, và bạn đang được yêu cầu chọn một tầm mức. K3 định tuyến token đến các chuyên gia bên trong một mô hình mà bạn có thể tải về và kiểm soát. Fugu Ultra v2 định tuyến tác vụ đến những mô hình mà bạn không thể nhìn thấy. Điều thứ hai là một ý tưởng lớn hơn, mạnh mẽ hơn. Nó cũng là thứ mà bạn chỉ có thể chấp nhận bằng niềm tin — và để đặt niềm tin đó, bạn phải trả chi phí gấp năm lần cho mỗi token.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
