Thẻ tiêu đề hero tự tạo cho 'Claude Fable 5.1 vs Kimi K3' với phụ đề 'Trần suy luận so với trần bạn có thể sở hữu'. Hai bảng: 'Claude Fable 5.1' (Anthropic, API đóng, $10.00 / $50.00 mỗi 1M token, AA Intelligence Index 53, #1 trong 201, đầu ra tối đa 128K) và 'Kimi K3' (Moonshot AI, trọng số mở, $3.00 / $15.00 mỗi 1M token, AA Intelligence Index 44, #2 trọng số mở, đầu ra tối đa lên tới 1M token). Chân trang ghi: 'Claude Fable 5.1 ra mắt ngày 1 tháng 9 năm 2026 · Kimi K3: API ngày 16 tháng 7, trọng số ngày 27 tháng 7 năm 2026 · Số liệu độc lập, chỉ số Artificial Analysis hiện tại, ghi nhận ngày 10 tháng 9 năm 2026'; logo OrcaRouter nằm ở góc dưới bên phải.
Guides & Insights

Claude Fable 5.1 vs Kimi K3: Trần suy luận so với trần bạn có thể sở hữu

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Fable 5.1Kimi K3 nhắm đến cùng một nhóm người mua — các đội ngũ vận hành các tác nhân sử dụng công cụ trong thời gian dài trên các kho mã nguồn và bộ tài liệu lớn — và chúng đến từ hai đầu đối lập của thị trường. Claude Fable 5.1 là sản phẩm chủ lực mã nguồn đóng của Anthropic, phát hành ngày 1 tháng 9 năm 2026, với giá $10,00 cho mỗi triệu token đầu vào và $50,00 cho mỗi triệu token đầu ra, và được Artificial Analysis đo ở mức 53 trên Chỉ số Trí tuệ (Intelligence Index) hiện tại: đứng đầu trong số 201 mô hình mà chỉ số này theo dõi. Kimi K3, mô hình hỗn hợp chuyên gia (mixture-of-experts) có 2,8 nghìn tỷ tham số của Moonshot AI, đã mở trọng số vào ngày 27 tháng 7 và đạt 44 trên cùng chỉ số đó — đứng thứ hai trong số 112 mô hình mã nguồn mở cùng phân khúc. Cách đọc hiển nhiên là khoảng cách trí tuệ 9 điểm so với khoảng cách giá gấp khoảng ba lần. Cách đọc hữu ích hơn là hai mô hình có các mức trần khác nhau, và chỉ một trong những mức trần đó có thể được nâng lên bởi người sử dụng nó.

Về nguồn dữ liệu: Artificial Analysis đã điều chỉnh lại Chỉ số Thông minh (Intelligence Index) vào tháng 9, vì vậy các điểm số, thứ hạng, tốc độ và chi phí mỗi tác vụ ở đây đến từ phiên bản hiện tại, được ghi nhận vào ngày 10 tháng 9 năm 2026, và không thể so sánh với những con số được công bố khi ra mắt của từng mô hình. Kết quả benchmark của chính Moonshot và của Anthropic đều được ghi chú rõ nơi chúng xuất hiện, và không bên nào tái tạo kết quả của bên kia. Claude Fable 5.1 mới ra mắt được chín ngày, nên các tuyên bố của hãng gần như chưa được kiểm chứng bên ngoài; Kimi K3 thì đã có sáu tuần kiểm chứng.

Cùng một cửa sổ, các mức tối đa khác nhau

Cả hai mô hình đều có cửa sổ ngữ cảnh 1.048.576 token và không mô hình nào tính phí thêm cho việc lấp đầy cửa sổ đó — Moonshot định giá Kimi K3 cố định ở mức $3,00 / $0,30 cached / $15,00 mỗi triệu token, còn Claude Fable 5.1 định giá cửa sổ của mình cố định ở mức $10,00 / $0,25 cached / $50,00. Chính cửa sổ dùng chung này là lý do hai mô hình này được đem ra so sánh: chúng được xây dựng cho cùng một dạng công việc, nơi một tác vụ duy nhất tích lũy cả một kho mã nguồn, một phòng dữ liệu hoặc một tuần đầu ra của công cụ.

Sự khác biệt nằm ở đầu kia của đường ống. Kimi K3 có thể phát ra tối đa 1.048.576 token trong một lần phản hồi — các nhà cung cấp thường đặt mặc định là 131.072, nhưng trần tối đa là một triệu token đầy đủ, được Moonshot tiếp thị là "một lần gọi có thể phát ra toàn bộ mã nguồn." Claude Fable 5.1 giới hạn một phản hồi ở 128K token đầu ra. Đối với một lượt trò chuyện, giới hạn đó không quan trọng. Đối với việc tạo toàn bộ kho mã nguồn, di trú hàng loạt hoặc một bộ tài liệu dài, đó là sự khác biệt giữa một lần gọi và một vòng lặp agent mà bạn phải tự xây dựng, giám sát và trả phí theo từng lượt.

Các con số, từng chiều một

• Giá cho mỗi 1 triệu token — Claude Fable 5.1 $10.00 đầu vào / $50.00 đầu ra so với Kimi K3 $3.00 đầu vào / $15.00 đầu ra.

• Đầu vào được cache — Claude Fable 5.1 $0.25 mỗi 1M so với Kimi K3 $0.30, mà Artificial Analysis quy đổi thành mức chiết khấu cache hiệu quả là 98% so với 90%.

• Điểm số độc lập, tốc độ và chi phí — Claude Fable 5.1 đạt 53 trên Chỉ số Trí tuệ hiện tại (#1 trong 201) với tốc độ 67,2 token đầu ra mỗi giây và chi phí 7,63 đô la mỗi tác vụ chỉ số; Kimi K3 đạt 44 (#2 trong 112 mô hình trọng số mở) với tốc độ 35,5 token mỗi giây và chi phí 2,00 đô la mỗi tác vụ, và chỉ số này ghi nhận nó chậm đáng kể và hơi dài dòng — 160M token đầu ra cho mỗi lần chạy chỉ số so với 190M của mô hình Claude.

• Giới hạn tối đa của ngữ cảnh và đầu ra — 1M token đầu vào và tối đa 128K đầu ra so với 1M token đầu vào và tối đa 1M đầu ra.

• Trọng số — đóng, chỉ dùng qua API so với mở và tự lưu trữ, được Moonshot phát hành theo giấy phép Kimi K3, một biến thể MIT đã sửa đổi kèm điều khoản thương mại cho các nhà phân phối lại quy mô rất lớn, với trọng số trên Hugging Face.

• Thị giác — Claude Fable 5.1 chấp nhận đầu vào văn bản, hình ảnh và tệp tin qua API; Kimi K3 chấp nhận văn bản và hình ảnh qua API, nhưng thị giác gốc là một tính năng thuộc tầng phục vụ và không nằm trong phần trọng số đã phát hành.

• Khả năng hiển thị suy luận — Kimi K3 truyền trực tiếp các dấu vết suy luận của mình qua API; Claude Fable 5.1 trả về các khối suy nghĩ mà bạn chọn cách hiển thị, tóm tắt hoặc bỏ qua, với chuỗi suy luận thô không bao giờ bị phơi bày.

• Kiến trúc — Số tham số của Claude Fable 5.1 không được tiết lộ; Kimi K3 là một mô hình hỗn hợp chuyên gia thưa (sparse mixture of experts) với tổng cộng 2,8T tham số và khoảng 104B tham số hoạt động.

• Đã phát hành — Claude Fable 5.1 vào ngày 1 tháng 9 năm 2026; API của Kimi K3 vào ngày 16 tháng 7 năm 2026, với trọng số mở vào ngày 27 tháng 7.

A self-built two-column scoreboard titled 'Claude Fable 5.1 vs Kimi K3 — the scoreboard'. Left column 'Claude Fable 5.1 (Anthropic)': 'AA Intelligence Index 53 (#1 of 201)', 'Price in / out $10.00 / $50.00 per 1M tokens', 'Cost per index task $7.63', 'Context / max output 1M / 128K', 'Weights closed, API only', 'Released Sep 1, 2026'. Right column 'Kimi K3 (Moonshot AI)': 'AA Intelligence Index 44 (#2 of 112 open-weights)', 'Price in / out $3.00 / $15.00 per 1M tokens', 'Cost per index task $2.00', 'Context / max output 1M / up to 1M', 'Weights open, self-hostable', 'Released API Jul 16, weights Jul 27, 2026'. Footer: 'AA figures per Artificial Analysis, current index version, captured Sep 10 2026.'

Khoảng cách chín điểm là gì, và không phải là gì

Trên chỉ số hiện tại, Claude Fable 5.1 dẫn đầu với 53 điểm, còn Kimi K3 đứng thứ hai với 44 điểm, dẫn trước phần còn lại của nhóm mô hình trọng số mở. Chín điểm là một khoảng cách thật sự, không phải nhiễu thống kê, nhưng chỉ số này là một chỉ số tổng hợp — gồm tác vụ tác nhân, lập trình, suy luận khoa học và năng lực tổng quát, được tính theo trọng số — và một con số duy nhất che khuất những lĩnh vực mà mô hình mở thực sự mạnh. Trong các phép đo độc lập hồi đầu tháng 9, Kimi K3 đứng đầu hoặc gần đầu nhóm mô hình mở về các tác vụ tác nhân dài hạn: đứng nhất trên AutomationBench, thứ nhì trên bộ thử nghiệm Briefcase tác nhân của Artificial Analysis và thứ ba trên GDPval-AA v2 trong số các mô hình được thử nghiệm. Dữ liệu đấu trường độc lập xếp kỹ năng phát triển web của nó vào khoảng 1.679 Elo trên bảng Web Dev của Code Arena, gần đỉnh bảng xếp hạng này tính đến đầu tháng 9. Đó là những tác vụ mà ở đó mô hình mở không hề thua kém 9 điểm.

Điểm mà Claude Fable 5.1 vượt trội là trần suy luận khó. Anthropic báo cáo 52,6% trên Terminal-Bench-Science 0.1, hơn gấp đôi mức 24,7% của thế hệ Claude trước, cùng với 55,8% trên Terminal-Bench 4.0 — cả hai đều do hãng tự công bố và chưa được tái lập độc lập. Đó là những con số đằng sau tuyên bố rằng bản phát hành tháng 9 đã nâng mức tiêu chuẩn cho công việc khoa học và dài hạn. Tóm tắt trung thực là Kimi K3 cạnh tranh về bề rộng tác nhân và phát triển web, còn mô hình đóng dẫn trước ở nơi suy luận đạt độ sâu nhất; một khoảng cách chỉ số chín điểm nén cả hai sự thật thành một dòng.

Một điểm dữ liệu đáng được nhắc đến riêng vì nó bất thường: con số Terminal-Bench 2.1 của chính Moonshot cho Kimi K3 là 88.3%, so với kết quả đo độc lập là 85.0%. Những con số từ nhà cung cấp vượt qua phép đo trung lập gần như nguyên vẹn là hiếm có, và một khoảng cách nhỏ như vậy, nghiêng về phía nhà cung cấp, nói lên nhiều điều về mô hình hơn bất kỳ điểm chỉ số đơn lẻ nào.

Screenshot of the Artificial Analysis model page for Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), captured September 10, 2026, showing Intelligence Index 53 ranked #1 of 201, output speed 67.2 tokens per second, a $7.63 cost per Intelligence Index task, a 98% cache discount against $10.00 input and $50.00 output pricing, 190M output tokens of verbosity, and a 1M-token context window.

Ngã rẽ quyền sở hữu, được tính toán chi phí một cách trung thực

Trọng số mở là lý do để ưu tiên Kimi K3, và cũng là lý do để đọc kỹ điều khoản in nhỏ. Kimi K3 là một mô hình hỗn hợp chuyên gia thưa với 2,8 nghìn tỷ tham số; tự chạy nó là một tuyên bố về cụm GPU đa nút, không phải một buổi chiều trên máy trạm, và giấy phép Kimi K3 có rào cản thương mại nhắm vào các nhà phân phối rất lớn. Những gì bạn mua được với hạ tầng đó là có thật: không giới hạn tốc độ, không tính phí theo token, tinh chỉnh trên dữ liệu của riêng bạn, khả năng kiểm toán đầy đủ, và các prompt không bao giờ rời khỏi mạng của bạn — những yêu cầu khiến API đóng không khả thi trong các công việc được quản lý chặt chẽ và liên quan đến quốc phòng.

{{1}}Hai lưu ý cần được đặt bên cạnh điều đó.{{/1}} Tự lưu trữ sẽ làm mất tính năng thị giác gốc của API, vì đầu vào hình ảnh là một tính năng của tầng phục vụ chứ không phải thứ gì đó trong các trọng số được phát hành; và mô hình này chậm, đo được 35,5 token đầu ra mỗi giây trên chỉ số hiện tại — hệ quả tự nhiên của một mô hình hỗn hợp chuyên gia 2,8T tham số với suy luận luôn bật. Với một lần hoàn thành 20.000 token, đó là vài phút sinh văn bản, và trên cụm máy của bạn, đó là vài phút GPU của chính bạn.

Các phiên bản thuê thực tế gần nhau hơn nhiều so với câu hỏi về quyền sở hữu ngụ ý. Kimi K3 trên API của Moonshot có giá $3.00 / $15.00 với $0.30 cho đầu vào được lưu trong bộ nhớ đệm, khoảng một phần ba mức giá token của Claude Fable 5.1, trong khi phía Claude đã cắt giá đọc bộ nhớ đệm 75% vào tháng 9 — xuống còn $0.25 mỗi triệu token, thấp hơn mức của Kimi — điều này rất quan trọng cho chính các phiên tác tử dài mà cả hai mô hình đều nhắm tới, nơi cùng một đầu ra công cụ được đọc lại hàng chục lần. Trên thước đo độc lập về chi phí mỗi tác vụ, khoảng cách nằm ở mức $2.00 cho Kimi K3 so với $7.63 cho Claude Fable 5.1: {{1}}chênh lệch gần gấp bốn, không phải gấp ba như mức giá token gợi ý, bởi vì {{2}}mô hình Anthropic viết khoảng 190 triệu token so với 160 triệu của Kimi cho cùng một công việc lập chỉ mục{{/2}}.{{/1}}

Suy luận bạn có thể xem

Có một khác biệt về trải nghiệm nhà phát triển không xuất hiện trong bất kỳ bảng điểm chuẩn nào. Kimi K3 truyền trực tiếp các dấu vết lập luận qua API, biến một bước tác tử thất bại thành thứ bạn có thể đọc thay vì phải suy đoán. Claude Fable 5.1 theo hướng ngược lại: tư duy luôn bật, chuỗi suy nghĩ thô không bao giờ được trả về, và cài đặt hiển thị chỉ quyết định bạn nhận được bản tóm tắt dễ đọc hay không nhận được gì cả. Bản tóm tắt đủ cho hầu hết việc ghi log trong sản xuất; dấu vết tốt hơn để gỡ lỗi một tác tử cứ liên tục đi vào nhánh sai. Nếu bạn đang xây dựng hạ tầng tác tử thay vì chỉ tiêu thụ nó, khác biệt đó sẽ bộc lộ trong vài giờ.

Ghi chú mua sắm

Đối với các doanh nghiệp Mỹ, một biến số phi kỹ thuật gắn liền với cuộc so sánh này. Moonshot AI là một phòng thí nghiệm có trụ sở tại Bắc Kinh từng bị chính phủ Mỹ giám sát chặt chẽ: Bộ trưởng Tài chính Mỹ đã công khai đe dọa đưa công ty này vào danh sách đen thương mại, các quan chức Mỹ cáo buộc công ty này đã chưng cất năng lực từ các mô hình của Mỹ — cáo buộc mà Moonshot phủ nhận — và báo chí đưa tin về các cuộc đàm phán giai đoạn đầu với Microsoft, Amazon và Google để lưu trữ Kimi K3 theo các điều khoản chia sẻ doanh thu, cùng với hồ sơ IPO bí mật tại Hồng Kông vào đầu tháng 9. Không điều nào trong số đó làm thay đổi so sánh về mặt kỹ thuật, và việc triển khai open-weights được lưu trữ tại Mỹ bên trong cơ sở hạ tầng của bạn khác biệt về bản chất so với việc định tuyến các prompt đến một API ở nước ngoài. Điều đó có nghĩa là quyết định mua sắm về Kimi K3 là một quyết định có khía cạnh chính sách, và nên được đưa ra bởi những người hiểu rõ điều đó.

Thực hiện so sánh thay vì tranh luận về nó

Cả hai mô hình đều có thể truy cập trên OrcaRouter với giá niêm yết của nhà cung cấp, không cộng thêm phụ phí, nhờ đó bạn có thể tự kết luận cuộc so sánh này bằng dữ liệu của chính mình thay vì dựa vào bảng benchmark: Kimi K3 với giá $3.00 / $15.00 của Moonshot, Claude Fable 5.1 với giá $10.00 / $50.00 của Anthropic, trên một khóa và một hóa đơn duy nhất, không cần ký hợp đồng thứ hai và không cần thay đổi mã nguồn để chuyển đổi. Hãy chạy cùng một bộ kiểm thử trên cả hai, đo chi phí cho mỗi tác vụ hoàn thành trên khối lượng công việc thực tế của bạn, và để cơ chế tự động chuyển đổi dự phòng duy trì luồng sản xuất trong khi mô hình ứng viên vẫn đang được đánh giá. Nếu khối lượng công việc là suy luận sâu hoặc nằm trong Claude Code, mô hình chủ lực đóng thường thắng; còn nếu là tạo nội dung khối lượng lớn, nơi đầu ra một triệu token hoặc triển khai tự lưu trữ thay đổi cơ cấu chi phí, thì Kimi K3 là mô hình duy nhất trong hai mô hình mà bạn có thể sở hữu, và lớp định tuyến chính là nơi bạn để ngỏ cả hai lựa chọn.

Screenshot of the OrcaRouter model page for Kimi K3 (model id kimi/kimi-k3) showing $3.00 input and $15.00 output per 1M tokens, the MoonshotAI provider listed as of 2026-07-15, a 1M-token context window with text and image input, Vision, Tools, JSON and Reasoning capability badges, a description of it as a 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding and end-to-end knowledge work, the /v1/chat/completions and /v1/responses endpoints, and seven-day traffic of 2,343.0M tokens.

Điều cần theo dõi tiếp theo mang tính đối xứng. Anthropic đã phát hành sản phẩm theo nhịp gần như hàng tháng và hiện đã cho thấy họ sẽ cắt giảm giá cache mà không động đến mức giá niêm yết, vì vậy chi phí trong cuộc so kè này có thể thay đổi mà không cần một mô hình mới. Tương lai của Moonshot hiện gắn liền với việc niêm yết và các cuộc đàm phán điện toán đám mây tại Mỹ, mỗi điều đều có thể thay đổi cách — và nơi — Kimi K3 được phục vụ. Không điều nào là lý do để chờ đợi: cả hai mô hình hiện tại đều làm đúng những gì các con số nói trên cho thấy, và quyết định đứng vững theo thời gian nhất là quyết định giữ ID mô hình như một giá trị cấu hình thay vì một lần viết lại.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày