Thẻ hero có tiêu đề Claude Sonnet 5.5 vs Kimi K3, phụ đề là cả hai mô hình đều không nhận cài đặt temperature của bạn, với các pill ghi $2 / $10 đóng so với $3 / $15 trọng số mở, Chỉ số 56 so với 44, và cả hai đều không chấp nhận temperature, cùng phần chân trang trích dẫn Artificial Analysis v4.3.2 và giá của nhà cung cấp.
Guides & Insights

Claude Sonnet 5.5 so với Kimi K3: Không mô hình nào sẽ nhận cài đặt nhiệt độ của bạn

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là một so sánh mà hai mô hình đều đồng ý về một điều sẽ làm hỏng mã của bạn dù theo cách nào. Claude Sonnet 5.5, phát hành ngày 28 tháng 9 năm 2026, từ chối mọi yêu cầu đặt temperature, top_p hoặc top_k thành giá trị không mặc định với lỗi 400. Kimi K3, được Moonshot AI cung cấp rộng rãi từ giữa tháng 7 năm 2026, không chấp nhận bất kỳ tham số lấy mẫu nào — không temperature, không top_p, không seed — và chỉ thể hiện độ sâu suy luận thông qua một reasoning_effort. Hai phòng thí nghiệm khác nhau, hai kiến trúc khác nhau, một kết luận chung: các núm lấy mẫu mà hầu hết tích hợp vẫn đặt theo thói quen đều không còn trên cả hai.

Đó không phải là phép so sánh mà người ta viết về. Phép so sánh mà mọi người viết về là giá: Kimi K3 ở mức $3 mỗi triệu token đầu vào và $15 đầu ra, so với Claude Sonnet 5.5 ở mức $2 và $10, rõ ràng là một thắng lợi cho Anthropic trên bảng giá. Nhưng Kimi K3 là một mô hình mixture-of-experts trọng số mở 2,8 nghìn tỷ tham số mà bạn có thể tải xuống và chạy trong ranh giới của riêng mình, còn Claude Sonnet 5.5 là một mô hình đóng có sẵn trên bốn đám mây. Giữa một mô hình đóng rẻ hơn và một mô hình có thể tải xuống đắt hơn, quyết định hoàn toàn không được đưa ra dựa trên giá mỗi token.

Mỗi thứ là gì, mỗi thứ một đoạn văn.

Claude Sonnet 5.5 là mô hình thứ hai trong thế hệ 5.5 của Anthropic, nối tiếp Claude Opus 5.5 lên Claude API chỉ năm ngày sau khi mô hình đó ra mắt. Nó được phát hành dưới mã claude-sonnet-5-5 trên Claude API, Amazon Bedrock, Google Cloud và Microsoft Foundry, giữ nguyên cửa sổ ngữ cảnh 1 triệu token cùng giới hạn đầu ra đồng bộ 128K, và giữ đúng mức giá của Claude Sonnet 5: 2 USD cho đầu vào, 10 USD cho đầu ra, 0,20 USD mỗi triệu token cho lượt đọc từ bộ nhớ đệm. Suy luận thích ứng được bật mặc định ở mức nỗ lực high. Mô hình khả dụng với chế độ không lưu giữ dữ liệu, và Artificial Analysis cho nó Chỉ số Trí tuệ 56 trên bản sửa đổi v4.3.2 — xếp thứ ba trong số 216 mô hình mà tổ chức này đánh giá.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3 là mẫu flagship của Moonshot AI: một mô hình mixture-of-experts 2,8 nghìn tỷ tham số, kích hoạt khoảng 104 tỷ tham số mỗi token, với cửa sổ ngữ cảnh 1M token và khả năng hiểu hình ảnh gốc. Nó được xây dựng cho lập trình tầm xa và công việc tri thức nhiều bước, và Moonshot định vị nó dành cho các harness tác nhân lập trình đích danh. Nó dùng định dạng OpenAI API, phơi bày reasoning_effort như công cụ điều khiển suy luận duy nhất, và là open-weight theo Kimi K3 License — điều này không đồng nghĩa với open-source, và sự khác biệt đó chính là phần bạn cần đọc trước khi xây dựng dựa trên nó.

Bảng giá cước, và con số ở bên dưới nó

Hãy so sánh hai bên dựa trên những khía cạnh quyết định một dự luật chứ không phải một dòng tít:

• Giá đầu vào — Claude Sonnet 5.5 $2 mỗi triệu so với Kimi K3 $3 mỗi triệu

• Giá đầu ra — Claude Sonnet 5.5 $10 mỗi triệu so với Kimi K3 $15 mỗi triệu

• Đọc bộ nhớ đệm — $0.20 mỗi triệu so với $0.30 mỗi triệu

• Cửa sổ ngữ cảnh — 1.000.000 token so với 1.048.576 token

• Trọng số — độc quyền, bốn nền tảng lưu trữ so với trọng số mở theo Giấy phép Kimi K3

• Chỉ số Trí tuệ — Claude Sonnet 5.5 56 so với Kimi K3 44 trên cùng bản sửa đổi v4.3.2

• Chi phí cho mỗi tác vụ Intelligence Index — Claude Sonnet 5.5 $7,60 so với Kimi K3 $2,00

• Độ dài dòng trên Chỉ số — Claude Sonnet 5.5 410M token đầu ra so với Kimi K3 160M

Cặp cuối cùng đó là một sự đảo ngược đáng để ngẫm nghĩ. Mô hình của Anthropic rẻ hơn 50% ở đầu vào và rẻ hơn một phần ba ở đầu ra, vậy mà vẫn tốn chi phí gấp 3,8 lần để hoàn thành cùng một phép đánh giá, vì nó dùng gấp 2,6 lần token để đi đến đó. Trên chỉ số tổng hợp, nó đạt điểm cao hơn mười hai điểm, nên đây không phải là trường hợp một mô hình lãng phí mà chẳng thu được gì. Đây là trường hợp hai mô hình có hành vi chi phí không thể so sánh chỉ bằng cách đọc hai bảng giá, và đó là lý do con số về tác vụ chỉ mục tồn tại.

Không số lượng token nào trong hai số lượng đó sẽ là số lượng token của bạn. Tài liệu của chính Moonshot lưu ý rằng độ sâu suy luận của K3 được thiết lập bởi reasoning_effort chứ không phải bằng cách lấy mẫu, và điều tương tự cũng đúng trên thực tế đối với tham số effort của Claude Sonnet 5.5 — vì vậy trên cả hai mô hình, đòn bẩy đơn lẻ lớn nhất đối với hóa đơn của bạn là một cài đặt effort, chứ không phải một cuộc thương lượng giá.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

Chi tiết về các lỗi 400

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

Việc cùng từ chối các tham số lấy mẫu là điểm trùng lặp thiết thực nhất ở đây, vì đó là lỗi xuất hiện vào sáng hôm sau sau khi hoán đổi mô hình.

Trên Claude Sonnet 5.5, các quy tắc rất rõ ràng và không khoan nhượng. Một giá trị không mặc định của temperature, top_p hoặc top_k sẽ trả về 400. Việc gửi thinking: {"type": "disabled"} sẽ trả về 400 trỏ đến between_tools, thiết lập thinking thấp nhất mới, được chấp nhận ở mức low, medium và high effort nhưng bị từ chối ở xhigh hoặc max. Ép buộc sử dụng công cụ — tool_choice được đặt thành "any" hoặc thành một công cụ có tên — sẽ trả về 400 với thông báo "tool_choice: type \"tool\" and \"any\" are not supported for this model", và cách khắc phục là auto cùng với việc sử dụng công cụ nghiêm ngặt hoặc đầu ra có cấu trúc. Còn nữa: các khối thinking giờ đây bị ràng buộc với model và tài khoản đã tạo ra chúng, nên một cuộc hội thoại có thể được chuyển từ Claude Sonnet 5 sang Sonnet 5.5 mà vẫn giữ nguyên phần lập luận, nhưng không thể mang phần lập luận đó sang một họ model khác, và một tiền tố đã chỉnh sửa có thể biến một lần phát lại thành 400.

Trên Kimi K3, bề mặt nhỏ hơn nhưng hậu quả thì tương tự. Không có tham số lấy mẫu nào để gửi, nên bất kỳ client nào hard-code một tham số như vậy thì đều đang gửi một tham số mà model không đọc. Độ sâu suy luận là một trường reasoning_effort ở cấp cao nhất thay vào đó.

Cả hai thay đổi đều chỉ về cùng một hướng: cách tiếp cận núm vặn tất định để kiểm soát prompt đang được thay thế bằng một núm điều chỉnh effort ở phía mô hình. Bất kỳ pipeline nào tự tinh chỉnh với temperature 0.2 và một seed cố định đều phải được tinh chỉnh lại theo mức effort trên cả hai mô hình này, và việc tinh chỉnh lại chính là quá trình migration.

Trọng số mở thực sự mang lại cho bạn điều gì ở đây

Lý do để cân nhắc Kimi K3 so với một mô hình đóng rẻ hơn và đạt điểm cao hơn không phải là năng lực và cũng không phải là giá. Đó chính là ranh giới.

Vận hành K3 trong hạ tầng của chính bạn nghĩa là prompt, tài liệu và đầu ra không bao giờ rời khỏi một mạng do bạn kiểm soát, đây là một câu chuyện tuân thủ khác với thỏa thuận không lưu giữ dữ liệu với một nhà cung cấp. Điều đó cũng có nghĩa là mô hình không thể bị ngừng hỗ trợ ngay dưới chân bạn — Claude Sonnet 5.5 đi kèm cam kết ngừng hỗ trợ của Anthropic không sớm hơn ngày 28 tháng 9 năm 2027, còn một checkpoint đã tải xuống thì không có ngày như vậy. Và điều đó có nghĩa là đường cong chi phí cận biên trở nên phẳng hơn: sau phần cứng, token là miễn phí, đây là cấu trúc duy nhất mà trong đó một mô hình 2,8 nghìn tỷ tham số mới trở thành lựa chọn rẻ.

Giấy phép mới là thứ bạn thực sự đang ký. Kimi K3 là mở trọng số, không phải mã nguồn mở, và Moonshot không dùng thuật ngữ thứ hai. Giấy phép Kimi K3 rộng rãi cho hầu hết các mục đích sử dụng, nhưng một doanh nghiệp mô hình dưới dạng dịch vụ vượt ngưỡng doanh thu cuốn chiếu cần một thỏa thuận thương mại riêng, và các sản phẩm vượt ngưỡng lớn về người dùng hoặc doanh thu phải hiển thị ghi công "Kimi K3". Gọi nó là được cấp phép MIT là một sai sót thời K2 vẫn còn lan truyền. Nếu bạn định xây dựng trên các trọng số thay vì gọi API, đây là việc rà soát pháp lý chứ không phải một chú thích nhỏ.

Và các trọng số đủ lớn đến mức việc tự vận hành là một quyết định về vốn. Một MoE 2,8 nghìn tỷ tham số với khoảng 104 tỷ tham số hoạt động không phải là triển khai trên một máy chủ đơn lẻ, và công sức cần để dựng nó lên mới là chi phí thực sự của phương án — thứ lấn át mức chênh lệch 5 USD/triệu trong đơn giá đầu ra.

OrcaRouter phù hợp ở đâu

Hầu hết các đội đánh giá hai phương án này đều không muốn chọn giữa một API được quản lý và việc mua sắm phần cứng. Họ muốn định tuyến.

OrcaRouter là một endpoint tương thích OpenAI trên hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên và không có phụ phí, nên khi nhà cung cấp thay đổi mức giá ở một trong hai bên, thay đổi sẽ được áp dụng ngay trong cùng ngày thay vì vào chu kỳ hóa đơn tiếp theo. Kimi K3 đã có trong danh mục từ tháng Bảy với mức $3 / $15 của chính Moonshot, với thời gian token đầu tiên p50 đo được khoảng tám giây và khoảng 371,9 triệu token chạy qua nó trong tuần qua. Claude Sonnet 5 — mô hình mà phần lớn lưu lượng API Claude vẫn đang chạy qua, với tốc độ đo được 150 token đầu ra mỗi giây — đã có thể định tuyến kể từ ngày 30 tháng Sáu với mức $2 / $10 của Anthropic.

Claude Sonnet 5.5 vẫn chưa có trong danh mục của chúng tôi. Ở những nơi điều đó đúng, hãy nói rõ và đi vòng qua nó: API của chính nhà cung cấp là con đường đến với nó, và cách để thử nó mà không cam kết là một tỷ lệ phần trăm lưu lượng nằm sau failover tự động, với Claude Sonnet 5 hoặc Kimi K3 làm phương án dự phòng. Nếu lý do bạn cân nhắc K3 là ranh giới chứ không phải tốc độ, thì trọng số có thể tải xuống ngay hôm nay và API chỉ là giải pháp tạm thời — đó là quyết định về hạ tầng của bạn, không phải về việc so sánh mô hình.

Kết luận, chia theo những gì bạn thực sự đang mua.

Chọn Claude Sonnet 5.5 khi công việc có ngữ cảnh dài và nặng về đầu ra, khi thứ được mua là mười hai điểm chỉ số tổng hợp, và khi một API được quản lý với việc không lưu giữ dữ liệu vượt qua được đánh giá của bạn. Hãy dự trù cho thói quen dùng token — 410M token trên Index so với 160M của K3 là một hệ số nhân thực sự — và dự trù một ngày cho những thay đổi về tool-use và thinking-block.

Chọn Kimi K3 khi ranh giới là yêu cầu bắt buộc, khi bạn muốn một checkpoint mà không nhà cung cấp nào có thể khai tử, hoặc khi khối lượng công việc của bạn là lập trình tác tử ở quy mô lớn, nơi $2.00 cho mỗi tác vụ lập chỉ mục so với $7.60 tạo ra lợi thế cộng dồn. Hãy chấp nhận rằng đây là mô hình 2.8T tham số cần tự vận hành, rằng giấy phép của nó có các điều khoản ghi công và doanh thu, và rằng nó đạt điểm dưới phân hạng Anthropic trên chỉ số tổng hợp.

Điều mà cả hai lựa chọn đều không thoát khỏi chính là đoạn đầu tiên: các tham số lấy mẫu đều không còn ở cả hai, và nút điều chỉnh effort chính là control đã thay thế chúng. Dù bạn chọn cái nào trong hai, đó chính là thay đổi mà code của bạn cần.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày