
Qwen 4 Max vs Kimi K3: lời hứa về trọng số mở gặp gỡ bản phát hành trọng số mở
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Moonshot AI đã phát hành Kimi K3 vào ngày 16 tháng 7 năm 2026 và sau đó làm điều mà hầu hết các phòng thí nghiệm chỉ nói đến: công bố trọng số. Checkpoint 2,8 nghìn tỷ tham số đã xuất hiện vào ngày 27 tháng 7 năm 2026 theo giấy phép Modified MIT, mười một ngày sau khi ra mắt. Trong khi đó, hội nghị Yunqi vào ngày 22 tháng 9 năm 2026 được dùng để công bố Qwen 4 Max là mẫu chủ lực của gia đình Qwen 4 gồm bốn tầng, bao gồm Qwen 4 27B trọng số mở — một tầng được hứa hẹn, chứ chưa được phát hành. Hai dữ kiện đó chính là phép so sánh. Mọi thứ khác về Qwen 4 Max hiện vẫn chưa được biết, và khoảng cách giữa một tầng mở được hứa hẹn với một tầng đã được giao là nơi màn so tài này thực sự có điều đáng nói.
Kimi K3 đã đưa ra điều gì vào tháng Bảy
Kimi K3 là một mô hình hỗn hợp chuyên gia (mixture-of-experts) với 2,8 nghìn tỷ tham số, kích hoạt 16 trong số 896 chuyên gia trên mỗi token, qua đó đưa khoảng 104 tỷ tham số vào hoạt động ở mỗi bước xử lý. Mô hình có cửa sổ ngữ cảnh 1.048.576 token ở cả phía đầu vào lẫn đầu ra, và chấp nhận đầu vào văn bản, hình ảnh và video với đầu ra văn bản. API chính hãng của mô hình có giá niêm yết là 3,00 USD cho mỗi triệu token đầu vào, 15,00 USD cho mỗi triệu token đầu ra và 0,30 USD cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm, còn mức giá của bên thứ ba thấp hơn mức đó.
Kiến trúc là phần mà bản xem trước của chính Alibaba cũng nhắc tới. Kimi K3 được xây dựng trên Kimi Delta Attention và Attention Residuals, mà Moonshot tuyên bố đem lại hiệu suất mở rộng tốt hơn khoảng 2,5 lần so với Kimi K2 và tốc độ giải mã nhanh hơn tới 6,3 lần ở ngữ cảnh hàng triệu token. Đó cũng chính là bài toán mà QSA của Qwen nhắm tới — làm cho attention trở nên khả thi về chi phí ở độ dài cực lớn — nghĩa là hai dòng mô hình này cạnh tranh không phải ở quy mô, mà ở chỗ thiết kế attention thưa của bên nào ít lỗi thời hơn.
Các điểm số mà Moonshot công bố khi ra mắt, do nhà cung cấp báo cáo và chưa được tái lập vào thời điểm đó:
• Chỉ số Trí tuệ Artificial Analysis — 57, vào thời điểm đó đứng thứ ba sau Claude Fable 5 và GPT-5.6 Sol. Con số đó được ghi nhận theo một bản sửa đổi chỉ số trước đó; chỉ số này đã được xây dựng lại hai lần kể từ đó, nên đây là một kết quả đo lường mang tính lịch sử chứ không phải kết quả hiện hành.
• Frontend Code Arena — vị trí thứ nhất với 1.679 Elo, xếp trên cả hai mô hình đã đạt điểm cao hơn nó trên chỉ số tổng quát
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42, dẫn trước Opus 4.8 và GPT-5.6 Sol
• DeepSearchQA — 0.95, đứng thứ nhất, và MATH-Vision 0.98, cũng đứng đầu
• GPQA-Diamond — 0.94
Tài liệu ra mắt của chính Moonshot thừa nhận rằng K3 vẫn xếp sau Claude Fable 5 và GPT-5.6 Sol về năng lực tổng thể, và đó là một câu hữu ích hơn bất kỳ tuyên bố vị trí thứ nhất nào ở phía trên. Điểm thú vị trong hình dạng của các con số là một mô hình đứng thứ ba trên chỉ số tổng quát lại đứng nhất về mã frontend và nhất về tìm kiếm tầm xa — một hồ sơ cho thấy chỉ số tổng hợp đang che giấu một công cụ chuyên biệt thay vì mô tả một công cụ tổng quát.

Alibaba đã hứa những gì, và một lời hứa đáng giá bao nhiêu
Thông báo về Qwen 4 đã nêu tên bốn hạng. Qwen 4 Max là flagship, Qwen 4 Flash dành cho thông lượng, Qwen 4 Plus là lựa chọn trung dung cân bằng, và Qwen 4 27B là hạng cục bộ trọng số mở. Trưởng nhóm Qwen LLM Liu Da Yiheng mô tả dòng mô hình này đang được huấn luyện trên kiến trúc thế hệ mới và cho biết nó sẽ sớm ra mắt. Không có ngày phát hành, không có model card, không có mã định danh API, không có niêm yết trên đám mây, không có giá và không có điểm số được công bố cho bất kỳ mô hình nào trong số bốn mô hình.
Hai điều cụ thể về thông báo đó thường bị đưa tin sai, và cả hai đều quan trọng đối với bất kỳ ai đang cố gắng lập kế hoạch dựa trên nó:
• Con số 5 nghìn tỷ đến 10 nghìn tỷ tham số gắn với các bài đưa tin về Qwen 4 không phải là thông số kỹ thuật của Qwen 4. Nó thuộc lộ trình của Qwen 4.5 và Qwen 5. Chưa có bất kỳ con số tham số nào, dù thuộc loại nào, được công bố cho Qwen 4 Max
• Việc tiếp tục dùng tên các bậc không đồng nghĩa với việc giữ nguyên các thông số kỹ thuật. Cửa sổ ngữ cảnh, giá và giấy phép của Qwen 4 Max vẫn chưa rõ; các con số của Qwen3.8-Max bản phát hành chính thức — 1.000.000 token với giá $2,00 và $6,00 mỗi triệu — mô tả một mô hình khác.
Lý do khiến phân khúc 27B là phân khúc thú vị không liên quan gì đến các bài đánh giá hiệu năng. Đây là phân khúc duy nhất trong dòng Qwen 4 từng được phát hành dưới dạng trọng số mở, và thế hệ Qwen 3.8 đã cho thấy điều đó mở ra những gì: trong vòng vài ngày sau khi trọng số 27B xuất hiện, cộng đồng đã tạo ra các bản chuyển đổi MLX, các bản lượng tử hóa NVFP4 và đủ loại bản tinh chỉnh. Một mô hình 27B được công bố là một cam kết đối với hệ sinh thái hạ nguồn, và đó là hạng mục có thể dự đoán được nhất trong lộ trình.
Nhưng khả năng dự đoán thì không được đáp ứng. Trọng số của Kimi K3 là một tệp bạn có thể tải xuống ngay hôm nay. Trọng số của Qwen 4 27B chỉ là một dòng trong một bài nói chuyện tại hội nghị.
Trọng số mở và trọng số có thể chạy được là những tuyên bố khác nhau
Có một cái bẫy khi coi Kimi K3 là câu trả lời về trọng số mở, và điều đó đáng được nói thẳng vì đây là tuyên bố quá mức phổ biến nhất trong các bài viết về những mô hình tiên phong Trung Quốc. Một mixture-of-experts 2,8 nghìn tỷ tham số là một sản phẩm ở quy mô trung tâm dữ liệu. Trọng số được công bố nghĩa là bạn được phép chạy nó, có thể kiểm tra nó, có thể tinh chỉnh nó và có thể lượng tử hóa nó. Chúng không có nghĩa là bạn có thể chạy nó trên một máy trạm. Việc phục vụ hiệu quả một checkpoint cỡ đó cần hàng chục bộ tăng tốc, và công việc lượng tử hóa diễn ra sau một bản phát hành mở — những biến thể kiểu NVFP4 và REAP lưu hành trong vòng vài tuần — vừa nhằm làm cho mô hình nhỏ hơn vừa nhằm làm cho nó có thể phục vụ được.
Vậy nên cách đọc trung thực về giấy phép của Kimi K3 thì hẹp hơn, song vẫn đáng kể: đó là một mô hình tiên tiến có thể kiểm toán, sửa đổi và tự vận hành, theo giấy phép MIT sửa đổi, dành cho những tổ chức có phần cứng để chạy nó. Đó là một tài sản chiến lược thực sự, và là lựa chọn không phù hợp với bất kỳ ai đọc "trọng số mở" thành "chạy trên laptop của tôi".
Lưu ý tương tự cũng sẽ áp dụng cho Qwen 4 27B nếu và khi nó được phát hành — và nó áp dụng ít gay gắt hơn, bởi vì một phân khúc trọng số mở 27B thực sự ở quy mô cục bộ theo cách mà một mẫu flagship 2,8T không có được. Đó chính xác là lý do tại sao phân khúc Qwen 4 27B đáng được chú ý nhiều hơn phân khúc Max trong so sánh này, mặc dù phân khúc Max mới là thứ mà thông báo đã mở đầu bằng.

Câu hỏi thương mại nằm bên dưới câu hỏi về giấy phép
Mức giá chính thức của Kimi K3 là 3,00 USD cho đầu vào và 15,00 USD cho đầu ra trên mỗi triệu token, một vị thế cao cấp, và Moonshot đã nói rõ rằng mức giá này được cố ý định cao hơn phân khúc rẻ của thị trường Trung Quốc. So với Qwen3.8-Max ở mức 2,00 USD và 6,00 USD, con số đó gấp rưỡi giá đầu vào và gấp hai lần rưỡi giá đầu ra — một khoảng cách đủ lớn để một khối lượng công việc phải thực sự cần đến những điểm mạnh cụ thể của Kimi K3, trong đó có mã frontend và tìm kiếm tầm xa, thì mức giá cao mới đáng trả.
OrcaRouter định tuyến kimi/kimi-k3 cùng với dòng Qwen 3.8 trên một endpoint tương thích OpenAI duy nhất với mức markup 0%, nghĩa là bạn được tính đúng theo mức giá niêm yết của nhà cung cấp thay vì một mức giá tương đương đã bị đội lên. Trong một so sánh mà chênh lệch giá lên tới hệ số 2,5 ở đầu ra, việc không có biên lợi nhuận nền tảng không phải là một chi tiết làm tròn — một lớp mười phần trăm trên mức giá đầu ra $15.00 là $1.50 mỗi triệu token, tức là nhiều hơn toàn bộ chi phí đầu vào của mô hình rẻ hơn trong cặp so sánh này. Cùng endpoint đó còn có chuyển đổi dự phòng tự động và một DSL định tuyến để diễn đạt chính sách một cách tường minh, đó là cách bạn thử một mô hình có đặc điểm của Kimi K3 trên một phần lưu lượng sản xuất mà không đặt cược cả một đường dẫn vào một nhà cung cấp bạn chưa từng vận hành trước đây.
Điều mà OrcaRouter không cung cấp là Qwen 4 Max hoặc bất kỳ phân hạng Qwen 4 nào, vì chưa có cái nào trong số chúng tồn tại dưới dạng sản phẩm cả.

Những gì cần chú ý và những gì cần bỏ qua
Ba tín hiệu sẽ làm thay đổi sự so sánh này, và chúng đủ cụ thể để có thể theo dõi:
• Trọng số Qwen 4 27B. Không phải bảng benchmark của hạng Max — mà là checkpoint 27B, giấy phép và kích thước của nó. Đó chính là bản phát hành sẽ cho bạn biết liệu cam kết về trọng số mở của Alibaba trong thế hệ này có thực chất như lần trước hay không
• Giấy phép của Qwen 4 Max, nếu có. Nếu Alibaba công bố trọng số cho mô hình chủ lực của mình theo cách đã làm với Qwen3.8-Max, thì lập luận về trọng số mở trong cuộc so tài này sẽ không còn là lợi thế của Kimi nữa mà trở thành thế hòa.
• Một đánh giá độc lập mới về Kimi K3. Điểm số khi ra mắt của Moonshot là do chính họ tự báo cáo và chỉ số Artificial Analysis đã được xây dựng lại hai lần kể từ đó, nên cả điểm 57 và Frontend Code Arena Elo đều cần được đặt lại cơ sở trước khi so sánh với bất kỳ thứ gì hiện tại
Điều cần bỏ qua là bất kỳ bảng thông số kỹ thuật Qwen 4 Max nào xuất hiện trước khi Alibaba công bố thẻ mô hình, và bất kỳ tuyên bố nào rằng trọng số mở của Kimi K3 khiến nó có thể chạy cục bộ. Cả hai sai lầm này đều đã lan truyền. Trong lúc đó, so sánh mà bạn có thể dựa vào để hành động là giữa hai mô hình đang tồn tại: Kimi K3 với mức giá cao cấp, trọng số đã được phát hành và hồ sơ lập trình thực sự khác biệt, và Qwen3.8-Max với mức giá đầu ra chưa bằng một nửa, cửa sổ một triệu token cố định và trọng số của riêng mình. Đó là một lựa chọn thực sự, được định giá ở cả hai phía, và không đòi hỏi phải chờ một slide hội nghị trở thành sản phẩm.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
