
Qwen 3.8 vs Kimi K3: Hai gã khổng lồ Trung Quốc, và giờ một trong số đó rẻ hơn
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 177 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Đây là hai mô hình tiên phong có tầm ảnh hưởng nhất của Trung Quốc trong năm 2026, và chúng có họ hàng gần gũi: cả hai đều là hệ thống Mixture-of-Experts thưa thớt khổng lồ, cả hai đều có ngữ cảnh 1 triệu token, cả hai đều đa phương thức, cả hai đều hứa hẹn trọng số mở. Kimi K3 từ Moonshot thực sự là lớn hơn trong hai mô hình này, với tổng tham số 2,8T so với 2,4T của Qwen — một lời nhắc nhở hữu ích rằng số lượng tham số không phải là thứ hạng.
Cho đến ngày 3 tháng 8 năm 2026, sự so sánh này nghiêng hẳn về một phía theo một cách cụ thể: Kimi K3 có Artificial Analysis Intelligence Index đã kiểm toán đạt 57.1, xếp hạng frontend-code #1 trên LMArena, mức giá được công bố, và trọng số đã phát hành, trong khi Qwen3.8-Max chỉ có tiêu đề 2.4T và không có gì khác. GA đã thay đổi cục diện kinh tế một cách dứt khoát. Qwen hiện công bố $2 / $6 cho mỗi triệu token so với mức $3 / $15 của Kimi — điều này khiến mô hình lớn hơn, đã được chứng minh tốt hơn trở thành mô hình đắt hơn một cách đáng kể.
Một lưu ý cho các nhà phát triển — cách nhanh nhất để phân định điều này là chạy cả hai trên prompt của riêng bạn. OrcaRouter cho phép truy cập 200+ mô hình qua một endpoint tương thích OpenAI, vì vậy bạn có thể cho Qwen 3.8 Max so tài với Kimi K3 trên cùng một tác vụ mà không cần tích hợp hai SDK.
TL;DR: kết luận. Kimi K3 vẫn thắng về bằng chứng: một kết quả đã được kiểm toán, AA Intelligence Index đạt 57.1 (#3), vị trí số 1 về frontend-code trên LMArena với 1679, và trọng số mở thực sự sẵn sàng. Qwen3.8-Max vẫn chưa được chấm điểm bởi bất kỳ nhà đánh giá độc lập nào. Nhưng GA đã trao cho Qwen hai lợi thế thực sự. Về giá, hiện tại nó rẻ hơn đáng kể — $2 / $6 so với $3 / $15, nghĩa là chi phí đầu ra thấp hơn 2,5 lần. Và trong bài kiểm tra đối đầu của bên thứ ba duy nhất hiện có, Qwen thua điểm chính 80 so với 83 trong khi là tác nhân có hành vi tốt hơn rõ rệt: 354 trích dẫn repo so với 274, 22 yêu cầu gateway so với 53, và không có cuộc gọi công cụ nào thất bại so với hai. Kimi dành cho chất lượng đã kiểm toán; Qwen dành cho thực thi tác nhân rẻ hơn, sạch hơn.
Những điểm chính cần ghi nhớ
• Kimi K3 là mô hình lớn hơn — 2.8T MoE so với 2.4T của Qwen, nhiều hơn khoảng 400B — đây là một lập luận tốt chống lại việc coi số lượng tham số là thước đo cho năng lực.
• Qwen3.8-Max đã GA từ ngày 3 tháng 8 năm 2026 với giá $2 / $6 mỗi 1M đồng giá, so với Kimi K3 $3 / $15 (AA blended ~$2.31). Qwen hiện nay rẻ hơn 2,5 lần về output.
• Kimi K3 giữ thứ hạng đã được kiểm toán: AA Intelligence Index 57.1 (#3), chỉ đứng sau Fable 5 và GPT-5.6 Sol, cùng với LMArena frontend-code #1 (1679). Qwen3.8-Max vẫn chưa được chấm điểm.
• Trong bài kiểm tra trực tiếp duy nhất (Trilogy AI), Kimi đã nhỉnh hơn Qwen 83 so với 80 về tổng thể — nhưng Qwen đã tạo ra nhiều lượt trích dẫn repo hơn (354 so với 274), ít yêu cầu gateway hơn (22 so với 53), và đã có không một lệnh gọi công cụ nào thất bại (so với hai), với đánh giá sử dụng công cụ 9/10 so với 8/10 của Kimi.
• Qwen hiện báo cáo các chỉ số về tác tử và lập trình: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (từ mức 40.7 của phiên bản trước) — tất cả đều do Alibaba báo cáo.
• Về thời điểm công khai, Kimi vẫn có lợi thế: các trọng số của nó về cơ bản đã sẵn sàng; còn của Qwen được hứa hẹn trong tuần này, nhưng vẫn chưa có giấy phép hay kho lưu trữ nào.
Lưu ý về độ chính xác: tất cả các số liệu chất lượng của Qwen3.8-Max do Alibaba công bố và chưa được bên thứ ba xác minh. Số liệu của Kimi K3 đến từ Artificial Analysis và LMArena. So sánh trực tiếp là một bài kiểm tra duy nhất của Trilogy AI và nên được xem như một điểm dữ liệu, không phải là bảng xếp hạng chung. Giá của Qwen là biểu giá GA và thay thế mức chiết khấu xem trước của tháng Bảy.
Thông số kỹ thuật và giá, cạnh nhau
Đây là dữ liệu cứng, mỗi con số đều được ghi rõ nguồn gốc.
• Nhà phát triển / trạng thái — Qwen3.8-Max: Alibaba; GA (3 tháng 8, 2026); Kimi K3: Moonshot; phát hành open-weight
• Kiến trúc — Qwen3.8-Max: tổng ~2.4T, MoE thưa (số tham số hoạt động vẫn chưa được tiết lộ); Kimi K3: 2.8T MoE, thị giác gốc (Artificial Analysis)
• Cửa sổ ngữ cảnh — Qwen3.8-Max: 1M token (983,616 có suy luận; đầu ra tối đa 131,072); Kimi K3: 1M token (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: Vẫn chưa được chấm điểm; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / bảng xếp hạng — Qwen3.8-Max: Chưa được chấm điểm công khai; Kimi K3: Frontend-code #1, 1679 (LMArena)
• Điểm số do nhà cung cấp công bố — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (do Alibaba công bố); Kimi K3: thứ hạng do bên thứ ba đo lường
• Giá (vào / ra) — Qwen3.8-Max: $2.00 / $6.00 trên 1M, cố định; đầu vào cache $0.25; Kimi K3: $3 / $15 trên 1M (AA blended ~$2.31), cache hit $0.30
• Mở trọng số — Qwen3.8-Max: Hứa hẹn trong tuần này (chưa có giấy phép); Kimi K3: Mở trọng số; trọng số đã sẵn sàng
• Tốc độ — Qwen3.8-Max: p50 TTFT 1.64s (telemetry 7 ngày của OrcaRouter); Kimi K3: dài dòng và chậm (~34s TTFT, theo AA)
Hai điều làm nền tảng cho sự so sánh này, và một trong số đó đã hoàn toàn đảo ngược vào ngày 3 tháng 8.
Đầu tiên, mối quan hệ giá cả đã đảo ngược. Trong suốt tháng Bảy, Kimi K3 là mẫu có giá thực và Qwen là mẫu có phiếu giảm giá. Giờ đây cả hai đều công bố mức giá, và mẫu lớn hơn, đã được kiểm chứng tốt hơn là mẫu đắt hơn: $3 / $15 so với $2 / $6. Về đầu ra — nơi mà suy luận và tạo mã ngốn chi phí — Kimi đắt hơn 2.5×. Qwen cũng tính phí cố định cho toàn bộ ngữ cảnh 1M token, và đầu vào được lưu cache của họ ở mức $0.25 rẻ hơn một chút so với mức $0.30 cho lượt truy cập cache của Kimi. Đối với bất kỳ khối lượng công việc lớn nào, chi phí của Qwen hiện rõ ràng là tốt hơn.
Thứ hai, khoảng cách bằng chứng không đổi, và đó là lý do Kimi vẫn thắng. Chỉ số Thông minh 57,1 của Kimi K3 xếp nó ở vị trí thứ ba tổng thể, chỉ sau Fable 5 và GPT-5.6 Sol — đó là phán quyết của một nhà đánh giá trung lập. Thứ hạng #1 frontend-code trên LMArena với 1679 là kết quả bình chọn từ cộng đồng qua nhiều so sánh mù. Terminal-Bench 86,6 và GPQA Diamond 92,6 của Qwen là những con số thực nhưng do chính Alibaba đưa ra, trên một giàn thử nghiệm mà chưa ai khác chạy. Một mốc tham chiếu hữu ích: phiên bản tiền nhiệm Qwen3.7-Max đạt 46 trên chỉ số AA so với 57,1 của Kimi, vì vậy Qwen cần một bước nhảy thế hệ lớn chỉ để bắt kịp.
Cũng có một điểm đáng chú ý về độ trễ, vì nó đi ngược lại câu chuyện thông thường. Artificial Analysis đo Kimi K3 ở khoảng 34 giây thời gian đến token đầu tiên — thực sự chậm. Telemetry GA của OrcaRouter cho thấy Qwen3.8-Max có TTFT p50 là 1,64 giây. Các phép đo này đến từ các nguồn khác nhau và không phải là so sánh có kiểm soát, nhưng chúng làm phức tạp giả định trong giai đoạn preview rằng Qwen là mô hình chậm hơn trong cặp.

Thử thách đối đầu duy nhất, hãy đọc kỹ
Đây là trận so tài duy nhất trong loạt bài mà một bên thứ ba đã cho cả hai mô hình chạy đối đầu nhau trên cùng một nhiệm vụ, điều này khiến nó đáng để đọc kỹ thay vì tóm tắt để chọn ra người thắng cuộc.
Trilogy AI đã chạy một tác vụ hiểu kiến trúc — hiểu một kho mã nguồn thực tế và đưa ra kết luận kiến trúc chính xác — và chấm điểm kết quả:
• Điểm tổng thể — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• Trích dẫn repo — Qwen3.8-Max: 354; Kimi K3: 274
• Yêu cầu Gateway — Qwen3.8-Max: 22; Kimi K3: 53
• Lời gọi công cụ không thành công — Qwen3.8-Max: 0; Kimi K3: 2
• Đánh giá sử dụng công cụ — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
• Tỷ lệ cache hit — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi dẫn đầu tiêu đề với ba điểm. Nhưng hãy nhìn vào các cột quy trình, vì đối với kỹ thuật agentic, chúng quan trọng hơn điểm số. Qwen đã đạt được cùng một kết luận kiến trúc cốt lõi bằng cách sử dụng chưa đến một nửa số yêu cầu gateway đồng thời tạo ra nhiều hơn 29% trích dẫn căn cứ và — chi tiết mà bất kỳ ai xây dựng agent đều nên quan tâm — không có lệnh gọi công cụ nào thất bại so với hai lần của Kimi.
Các lệnh gọi công cụ thất bại chính là thứ thực sự phá vỡ các tác nhân sản xuất. Chúng có hiệu ứng dây chuyền: một lệnh gọi sai định dạng tạo ra lỗi mà mô hình phải diễn giải, điều này tiêu tốn lượt xử lý và có nguy cơ gây ra thêm lỗi. Một mô hình thực hiện 22 yêu cầu thành công trong khi mô hình khác thực hiện 53 yêu cầu với hai lần thất bại sẽ rẻ hơn và dễ dự đoán hơn khi vận hành, ngay cả khi nó đạt điểm thấp hơn ba điểm ở câu trả lời. Kết hợp với tỷ lệ đầu ra rẻ hơn 2,5 lần của Qwen, hiệu quả kinh tế vận hành của lần chạy đó nghiêng hẳn về phía Qwen.
Điểm cần thận trọng là đâymột tác vụ, một bộ đánh giá, một lần chạy. Nó không phải là một bộ benchmark và không thể khái quát hóa. Chỉ số 57.1 của Kimi và thứ hạng frontend #1 dựa trên nhiều bằng chứng hơn nhiều so với bài kiểm tra đơn lẻ này. Kết luận đúng đắn là hẹp: trong ít nhất một tác vụ agentic thực tế, Qwen là người sử dụng công cụ kỷ luật hơn trong khi chất lượng đầu ra kém hơn một chút.

Chi phí trong thực tế: agentic chạy ở quy mô lớn
Hãy xem một tác nhân phân tích kho lưu trữ: 250.000 token ngữ cảnh mã cho mỗi lần chạy, 12.000 token đầu ra.
• Qwen3.8-Max: 0.25M × $2 = $0.50, cộng với 0.012M × $6 = $0.072. ≈ $0.57 mỗi lần chạy.
• Kimi K3: 0.25M × $3 = $0.75, cộng 0.012M × $15 = $0.18. ≈ $0.93 mỗi lần chạy.
• Với 1.500 lượt chạy/ngày: Qwen ≈ $858/ngày; Kimi ≈ $1.395/ngày — chênh lệch khoảng $16.000/tháng.
• Với caching trên một repo ổn định: đầu vào được lưu cache của Qwen ở mức $0.25/1M đưa chi phí chạy lên đến ≈ $0.14; tỷ lệ cache-hit $0.30 của Kimi đưa chi phí lên đến ≈ $0.26.
Chênh lệch là có thật ở cả hai đầu, và kết quả của Trilogy càng làm trầm trọng thêm điều đó: nếu Qwen thực sự dùng ít hơn một nửa số yêu cầu gateway để hoàn thành công việc tương đương, thì khác biệt chi phí thực tế trên các tác vụ agentic còn rộng hơn những gì biểu giá đơn thuần cho thấy.
Cả hai mô hình đều tính phí token suy luận như token đầu ra, vì vậy các cấu hình nặng về lý luận sẽ tốn kém hơn ước tính ban đầu ở cả hai phía — nhưng mức giá 6 đô la của Qwen khiến mức phạt này nhỏ hơn 2,5 lần.
Cởi mở: gần tương đương, thời điểm khác nhau
Đây là trục mà hai bên giống nhau nhất và sự khác biệt hoàn toàn chỉ là về mức độ sẵn sàng. Trọng số của Kimi K3 được mở và về cơ bản đã sẵn sàng. Của Qwen3.8-Max được hứa hẹn trong tuần này, nhưng chưa có văn bản giấy phép, thẻ mô hình, hay kho lưu trữ nào — và giấy phép là thứ quyết định liệu bạn có thể sử dụng mô hình cho mục đích thương mại hay không.
Thực tế, cả hai mô hình hàng đầu đều không thể tự lưu trữ bởi một đội ngũ bình thường. {{1}}Qwen ở mức 2,4T gần như cần khoảng 1,2TB ở định dạng 4-bit so với khoảng 141GB mỗi chip H200; Kimi ở mức 2,8T thậm chí còn lớn hơn.{{/1}} {{2}}Cả hai đều cần tám hoặc nhiều hơn các bộ tăng tốc cao cấp nhất, và việc Alibaba không tiết lộ số lượng tham số hoạt động có nghĩa là bạn thậm chí không thể mô hình hóa thông lượng của Qwen.{{/2}}
Chính vì thế, mẫu vừa được công bố đồng thời Qwen3.8-27B lại quan trọng ở đây. Cũng có trọng số mở và được báo cáo là chạy trong khoảng 17GB VRAM, nó mang lại cho gia đình Qwen một câu chuyện on-premise thực sự mà cả flagship 2.4T lẫn 2.8T đều không có. Nếu open-weights là lý do thực sự để bạn chọn giữa hai mẫu này, thì 27B thay đổi cục diện nhiều hơn cả hai gã khổng lồ kia.
FAQ
Qwen 3.8 có tốt hơn Kimi K3 không?
Không dựa trên bằng chứng đã kiểm toán. Kimi K3 sở hữu chỉ số AA Intelligence Index độc lập ở mức 57.1 (#3) và giữ vị trí #1 frontend-code của LMArena, trong khi Qwen3.8-Max vẫn chưa được bất kỳ nhà đánh giá bên thứ ba nào chấm điểm. Trong bài kiểm tra trực tiếp duy nhất hiện có, Kimi đã thắng 83–80. Lợi thế của Qwen là giá cả (đầu ra rẻ hơn 2,5 lần) và, trong cùng bài kiểm tra đó, khả năng sử dụng công cụ gọn gàng hơn.
Mô hình nào lớn hơn?
Kimi K3, với tổng 2,8T tham số so với 2,4T của Qwen3.8-Max — nhiều hơn khoảng 400B. Tuy nhiên, cả hai đều không công bố đủ thông tin để con số đó có ý nghĩa: Alibaba chưa bao giờ công bố số lượng tham số hoạt động của Qwen, vốn là con số thực sự quyết định chi phí phục vụ trong mô hình Mixture-of-Experts.
Cái nào rẻ hơn?
Qwen3.8-Max, rõ ràng, kể từ GA. Nó có giá $2 / $6 mỗi 1M so với $3 / $15 của Kimi K3 — rẻ hơn 33% cho input và rẻ hơn 2.5× cho output. Giá của Qwen là cố định trên toàn bộ context 1M, và input được cache của nó ở $0.25 thấp hơn một chút so với mức cache-hit $0.30 của Kimi.
Thử nghiệm đối đầu thực sự cho thấy điều gì?
Nhiệm vụ hiểu kiến trúc của Trilogy AI chấm Kimi 83 điểm và Qwen 80 điểm. Nhưng Qwen tạo ra 354 trích dẫn repo so với 274 của Kimi, chỉ dùng 22 yêu cầu gateway so với 53, ghi nhận không có lời gọi công cụ thất bại nào so với hai lần, và đạt 9/10 về sử dụng công cụ so với 8/10 của Kimi. Kimi đưa ra câu trả lời tốt hơn; Qwen là tác nhân có kỷ luật hơn. Đây chỉ là một nhiệm vụ, vì vậy hãy coi nó như một điểm dữ liệu thay vì một bảng xếp hạng.
Qwen 3.8 Max đã rời khỏi bản xem trước chưa?
Có, vào ngày 3 tháng 8 năm 2026, với bảng giá được công bố và endpoint tương thích với OpenAI và DashScope. Chiến dịch tín dụng Qoder tháng Bảy không còn mô tả cách dịch vụ được bán.
Cái nào nhanh hơn?
Có thể giờ là Qwen, điều này đảo ngược giả định từ thời kỳ xem trước. Artificial Analysis đo Kimi K3 có thời gian đến token đầu tiên khoảng 34 giây; dữ liệu telemetry GA 7 ngày của OrcaRouter cho thấy Qwen3.8-Max có TTFT p50 là 1,64 giây. Các nguồn khác nhau và không phải so sánh có kiểm soát, nhưng cả hai mô hình đều nổi tiếng về độ dài dòng, và TTFT đo được của Kimi thực sự chậm.
Tôi có thể tự lưu trữ một trong hai không?
Không thực tế ở quy mô flagship — các mô hình 2.4T và 2.8T cần tám GPU loại H200 trở lên. Trọng số của Kimi đã sẵn sàng ngay hôm nay; còn của Qwen được hứa hẹn trong tuần này nhưng chưa có giấy phép. Đối với một lựa chọn on-premise thực sự, Qwen3.8-27B được công bố cùng thời điểm (được cho là dùng ~17GB VRAM) là lựa chọn khả thi trong gia đình Qwen.
Điểm mấu chốt
Qwen 3.8 so với Kimi K3 là cuộc đối đầu sát sao nhất trong loạt bài này, và bản phát hành công khai đã chia rõ ràng cuộc đối đầu này theo hai trục. Kimi K3 giữ ngôi vương chất lượng nhờ những gì trọng tài đo được: 57.1 trên Intelligence Index, xếp thứ ba tổng thể, và vị trí dẫn đầu hạng mục frontend-code của LMArena. Đó không phải là những lời tuyên bố — đó là kết quả, và Qwen không có gì tương đương.
Điều Qwen giành được vào ngày 3 tháng 8 là khía cạnh kinh tế, và đã giành một cách thuyết phục: $2/$6 so với $3/$15, đồng giá trên một triệu token, với chi phí cache rẻ hơn một chút. Thêm phát hiện của Trilogy rằng Qwen hoàn thành một tác vụ agentic tương đương với chỉ một nửa số yêu cầu gateway và không một lần gọi công cụ nào thất bại, Qwen trông giống mô hình vận hành hiệu quả hơn ngay cả khi nó kém chính xác hơn. Hãy theo dõi hai sự kiện: điểm Intelligence Index độc lập đầu tiên cho Qwen3.8-Max, và bộ trọng số được phát hành kèm giấy phép. Nếu Qwen đạt điểm gần mức 57.1 của Kimi, khoảng cách giá khiến việc chọn Kimi cho công việc khối lượng lớn trở nên rất khó biện minh. Cho đến lúc đó, Kimi là mô hình bạn tin cậy còn Qwen là mô hình bạn có đủ khả năng vận hành — và cách trung thực để lựa chọn là dựa trên chính kho lưu trữ của bạn.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
