Qwen 3.8 vs Kimi K3: Hai Gã Khổng Lồ Khối Lượng Mở Của Trung Quốc, So Kè Trực Diện
Guides & Insights

Qwen 3.8 vs Kimi K3: Hai Gã Khổng Lồ Khối Lượng Mở Của Trung Quốc, So Kè Trực Diện

Tác giả

jinhao song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trong số tất cả các mô hình mà Qwen 3.8 Max được so sánh với, Kimi K3 từ Moonshot là đối thủ tự nhiên nhất: cả hai đều là mô hình Mixture-of-Experts khổng lồ của Trung Quốc, cả hai đều thuộc lớp trọng số mở, cả hai đều nổi tiếng về sự dài dòng, kỹ lưỡng và chậm chạp. Trên thực tế, chúng là hai gã khổng lồ lớn nhất trong thế giới trọng số mở của Trung Quốc — và thật bất thường, chúng ta không cần phải đoán xem chúng so sánh thế nào, bởi vì ai đó đã chạy thử chúng với nhau trên cùng một nhiệm vụ. Điều này làm cho so sánh này trở nên phong phú nhất trong loạt bài: không phải tuyên bố của nhà cung cấp đối chiếu với số liệu kiểm tra, mà là một cuộc đối đầu thực sự.

Trước khi đi vào chi tiết, một lưu ý cho các builder — cách thành thật để giải quyết một cuộc cạnh tranh sát sao như thế này là tự chạy cả hai trên khối lượng công việc của riêng bạn và quan sát sự đánh đổi giữa tính kỹ lưỡng và tốc độ. OrcaRouter cung cấp hơn 200 mô hình đằng sau một endpoint tương thích OpenAI, vì vậy bạn có thể đối đầu Qwen 3.8 với Kimi K3 trên cùng một prompt mà không cần cài đặt hai SDK.

Tóm tắt kết luận.Trong một cuộc đối đầu trực tiếp duy nhất mà chúng tôi có (Trilogy AI, một tác vụ hiểu kiến trúc), Kimi K3 đạt 83/100 và Qwen 3.8 Max đạt 80/100 — một lợi thế nhỏ 3 điểm nghiêng về Kimi. Nhưng Qwen là kẻ *kỹ lưỡng* hơn: 354 trích dẫn repo so với 274, 22 yêu cầu gateway so với 53, và không có lệnh gọi tool nào bị lỗi so với hai, với cái giá là độ trễ cao hơn và nhiều token hơn. Cả hai đều đạt tỷ lệ cache hit 90% và đi đến cùng một quyết định kiến trúc cốt lõi. Hiện tại, Kimi K3 là lựa chọn an toàn hơn với trọng số mở — nó có điểm số được kiểm định (57.1, #3 trên Artificial Analysis), vương miện Arena frontend, và các trọng số về cơ bản đã có sẵn. Qwen 3.8 là cái tên đáng chú ý: tham vọng lớn hơn, khám phá toàn diện hơn, nhưng chưa có điểm số trên các bảng xếp hạng công khai với trọng số chỉ "sắp có."

Những điểm chính rút ra

• Qwen 3.8 Max là một MoE 2,4 nghìn tỷ tham số bản xem trước; Kimi K3 là một MoE 2,8 nghìn tỷ tham số với ngữ cảnh 1M và tầm nhìn tự nhiên — nghĩa là Qwen khoảng nhỏ hơn 400 tỷ tham số, một lời nhắc nhở rằng số lượng tham số lớn hơn không đồng nghĩa với tốt hơn.

• Trong bài kiểm tra trực tiếp duy nhất (Trilogy AI), Kimi K3 đã vượt qua Qwen 80 đến 83 tổng thể — nhưng Qwen đã có nhiều repo citations hơn (354 vs 274), ít gateway requests hơn (22 vs 53), và đã không có lỗi gọi tool nào (so với hai).

•  Kimi K3 có một AA Intelligence Index đã được kiểm toán là 57.1 (#3) — đứng sau Fable 5 và GPT-5.6 Sol, vượt trội hơn tất cả. Qwen 3.8 không có bất kỳ điểm chuẩn độc lập nào.

•  Kimi K3 cũng giữ LMArena frontend-code #1 spot (1679); Qwen 3.8 chưa được xếp hạng trên các bảng xếp hạng công khai.

• Mức độ cởi mở gần như tương đương nhưng thời điểm khác nhau: trọng số của Kimi K3 đã được công bố/cam kết và về cơ bản đã sẵn sàng; trọng số của Qwen 3.8 thì "sắp ra mắt" nhưng chưa có ngày, giấy phép hay kho lưu trữ nào.

Các số liệu của Qwen 3.8 là tuyên bố từ nhà cung cấp hoặc ấn tượng thực tế sớm, chưa được kiểm soát — không được kiểm toán độc lập. Các chỉ số và giá của Kimi K3 được gán cho Artificial Analysis và có thể khác với báo cáo của Moonshot. So sánh đối đầu Trilogy AI là một tác vụ đơn lẻ, không phải một bộ benchmark hoàn chỉnh. Giá xem trước của Qwen 3.8 là một chiết khấu tạm thời; hãy xác minh mức giá trước khi lập ngân sách.

Thông số kỹ thuật và giá, đặt cạnh nhau

Đây là dữ liệu cứng, mỗi con số của đối thủ cạnh tranh đều được ghi rõ nguồn gốc.

•  Nhà sản xuất / trạng thái — Qwen 3.8 Max: Alibaba; bản xem trước (19 tháng 7, 2026); Kimi K3: Moonshot; phát hành trọng số mở

•  Kiến trúc — Qwen 3.8 Max: ~2.4T tổng, MoE thưa (thông số hoạt động không được tiết lộ); Kimi K3: 2.8T MoE, tầm nhìn gốc (nguồn: Artificial Analysis)

• Cửa sổ ngữ cảnh — Qwen 3.8 Max: Báo cáo ~1M token (chưa được xác nhận chính thức); Kimi K3: 1M token (nguồn: Artificial Analysis)

•  Chỉ số AA Intelligence — Qwen 3.8 Max: Chưa có — chưa được chấm điểm; Kimi K3: 57.1 — #3 (Artificial Analysis)

•  Đấu trường / bảng xếp hạng — Qwen 3.8 Max: Chưa được xếp hạng công khai; Kimi K3: Frontend-code #1, 1679 (LMArena)

•  Định giá (đầu vào / đầu ra) — Qwen 3.8 Max: Chỉ xem trước (giảm ~90%; API trên mỗi token chưa được công bố); Kimi K3:$3 / $15 trên 1 triệu (AA blended ~$2.31)

• Trọng số mở — Qwen 3.8 Max: Đã hứa "sớm" (chưa phát hành); Kimi K3: Trọng số mở; trọng số đã sẵn sàng/gần

•  Tốc độ — Qwen 3.8 Max: Mô hình chậm nhất được thử nghiệm (thực tế); Kimi K3: Dài dòng và chậm (~34s TTFT, per AA)

Có hai điều định hình toàn bộ so sánh. Thứ nhất, ô trống "AA Intelligence Index" cho Qwen 3.8 chính là câu chuyện: 57.1 của Kimi K3 là phán quyết trung lập của trọng tài, đưa nó lên vị trí #3 thế giới, chỉ sau Fable 5 và GPT-5.6 Sol; vị thế của Qwen 3.8 dựa vào cách trình bày của nhà cung cấp và một vài lần chạy thử thực tế. Thứ hai, hãy để ý sự đảo ngược kích thước — Qwen 3.8 (2.4T) thực tế khoảng400B tham số nhỏ hơn so với Kimi K3 (2.8T). Mô hình của Alibaba là mô hình mà mọi người mô tả là "tham vọng lớn hơn", nhưng xét về tổng số tham số thô, Kimi là gã khổng lồ lớn hơn, và nó có điểm số đã được kiểm toán để chứng minh. Cả hai đều nổi tiếng là dài dòng và chậm, vì vậy độ trễ tương đương nhau; yếu tố thực sự tách biệt là bằng chứng và sự sẵn có trọng số, và ngày nay cả hai đều nghiêng về Kimi.

Một cuộc đối đầu trực tiếp thực sự duy nhất mà chúng ta có

Đây là một trận đấu hiếm hoi mà chúng ta không cần phải suy luận. Trilogy AI đã chạy cả hai mô hình trên một nhiệm vụ duy nhất về hiểu kiến trúc — đọc và suy luận về một mã nguồn thực tế — và công bố kết quả so sánh song song. Kimi K3 thắng về điểm số chính, nhưng hành vi bên dưới lại kể một câu chuyện thú vị hơn.

•  Điểm tổng thể — Qwen 3.8 Max: 80 / 100; Kimi K3: 83 / 100

•  Trích dẫn repo — Qwen 3.8 Max: 354; Kimi K3: 274

• Yêu cầu cổng — Qwen 3.8 Max: 22; Kimi K3: 53

•  Lời gọi công cụ thất bại — Qwen 3.8 Max: 0; Kimi K3: 2

•  Đánh giá khả năng sử dụng công cụ — Qwen 3.8 Max: 9 / 10; Kimi K3: 8 / 10

• Tỷ lệ hit cache — Qwen 3.8 Max: >90%; Kimi K3: >90%

Đọc các cột, không chỉ hàng trên cùng. Kimi K3 đã giành chiến thắng 3 điểm, nhưng Qwen 3.8 là người làm việc tỉ mỉ hơn: nó đã trích dẫn thêm 80 vị trí trong repo (354 so với 274), đã đạt kết luận trong ít yêu cầu gateway hơn nhiều (22 so với 53), đã thực hiện không có lời gọi công cụ thất bại nào so với hai của Kimi, và vượt qua Kimi về rating sử dụng công cụ (9 so với 8). Sự đánh đổi chính xác là điều bạn mong đợi từ tính cách của Qwen ở những nơi khác — nó khám phá một cách toàn diện, điều này dẫn đến độ trễ cao hơn và nhiều token hơn. Quan trọng là, cả hai mô hình đều đạt đến cùng một quyết định kiến trúc cốt lõi, vì vậy đây không phải là một đúng và một sai; đó là Kimi đạt được câu trả lời được đánh giá cao hơn một chút nhanh hơn, và Qwen đạt được điều đó với nhiều bằng chứng và kỷ luật công cụ sạch hơn. Nếu công việc của bạn khen thưởng sự khám phá toàn diện, được trích dẫn tốt, hồ sơ của Qwen rất hấp dẫn; nếu bạn muốn tùy chọn đã được chứng minh, nhanh hơn để có câu trả lời, Kimi đã thắng vòng này.

Câu hỏi thường gặp

Qwen 3.8 có tốt hơn Kimi K3 không?

Không dựa trên bằng chứng hiện có. Trong cuộc đối đầu trực tiếp duy nhất (Trilogy AI), Kimi K3 đạt 83/100 so với 80/100 của Qwen, và Kimi có chỉ số Artificial Analysis Index đã được kiểm toán là 57.1 (#3) cùng với vương miện frontend-code của Arena, trong khi Qwen 3.8 hoàn toàn không có điểm số độc lập. Lợi thế của Qwen là sự kỹ lưỡng — nhiều trích dẫn repo hơn (354 so với 274), ít yêu cầu gateway hơn, và không có cuộc gọi công cụ nào thất bại — nhưng đó là lợi thế về phong cách, không phải là dẫn trước về năng lực đã được chứng minh.

Qwen 3.8 lớn hơn — liệu điều đó có khiến nó tốt hơn không?

Không, và thực tế lại ngược lại về kích thước: Qwen 3.8 có khoảng 2,4 nghìn tỷ tham số so với Kimi K3 có khoảng 2,8 nghìn tỷ, vì vậy Kimi lớn hơn trong hai mô hình này khoảng 400 tỷ. Số lượng tham số lớn hơn không đồng nghĩa với tốt hơn — Kimi vừa lớn hơn vừa có điểm số cao hơn, đây là lời nhắc nhở rõ ràng rằng kiến trúc, quá trình huấn luyện và tinh chỉnh quan trọng hơn tổng số tham số thô.

Giá cả so sánh như thế nào?

Kimi K3 là một sản phẩm đã được công bố, bền bỉ $3 / $15 cho mỗi 1 triệu token (Artificial Analysis pha trộn nó thành khoảng $2.31). Bản xem trước của Qwen 3.8 được giảm giá mạnh (~90%) nhưng không có giá API trên mỗi token được công bố và mức giảm giá chỉ là tạm thời, do đó chưa thể so sánh giá ổn định. Để lập ngân sách hôm nay, Kimi là cái có con số thực tế.

Lựa chọn open-weight nào tốt hơn?

Cả hai đều thuộc dạng open-weight-class, nhưng thời điểm khác nhau. Trọng số của Kimi K3 được công bố mở và về cơ bản đã sẵn sàng; trọng số của Qwen 3.8 được hứa hẹn "sắp ra mắt" mà không có ngày cụ thể, giấy phép hay kho lưu trữ nào được công bố. Nếu trọng số mở là lý do bạn chọn một trong hai, thì Kimi là lựa chọn bạn có thể hành động ngay bây giờ.

Tôi nên dùng cái nào hôm nay?

Kimi K3 là lựa chọn mặc định an toàn hơn — nó được xếp hạng (#3), trọng số đã sẵn sàng và nó đã thắng đối đầu. Hãy sử dụng Qwen 3.8 khi bạn coi trọng việc khám phá đầy đủ, trích dẫn tốt và sử dụng công cụ sạch sẽ hơn là tốc độ, và coi nó như một ứng cử viên đáng chú ý khi trọng số của nó được công bố và có điểm độc lập.

Kết luận

Qwen 3.8 đấu với Kimi K3 là cuộc đối đầu công bằng nhất trong series này: hai gã khổng lồ trọng số mở Trung Quốc, cả hai đều dài dòng, kỹ lưỡng và chậm chạp. Kimi K3 thắng vòng này vì nó thắng những yếu tố quyết định sự chấp nhận — thứ hạng #3 đã được kiểm toán, vương miện giao diện Arena, giá công bố, và trọng số đã sẵn sàng — và nó đã vượt Qwen 80-83 trong cuộc đối đầu thực tế duy nhất. Nhưng cuộc đối đầu đó cũng cho thấy tại sao Qwen 3.8 đáng để theo dõi: nó là mô hình tỉ mỉ hơn, trích dẫn nhiều mã nguồn hơn, sử dụng ít yêu cầu hơn, và không có lời gọi công cụ thất bại nào. Nếu công việc của bạn đòi hỏi sự khám phá toàn diện, và nếu Alibaba phát hành trọng số và một điểm số độc lập nằm gần đỉnh, thì sự cạnh tranh này có thể đảo ngược. Cho đến lúc đó, Kimi K3 là lựa chọn trọng số mở an toàn hơn, và Qwen 3.8 là kẻ thách thức để bạn tự kiểm tra với các prompt của mình.


© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube