
GPT-6.1 Sol vs Kimi K3: Bản tải xuống đã tồn tại, và nó vẫn không phải là lựa chọn rẻ.
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Kimi K3 là ví dụ phản chứng thường khép lại những tranh luận kiểu này. Moonshot AI đã phát hành mô hình 2,8 nghìn tỷ tham số vào tháng 7 năm 2026 và công bố trọng số — moonshotai/Kimi-K3 có trên Hugging Face, không bị hạn chế, với hơn một triệu lượt tải xuống và lần sửa đổi gần nhất vào tháng 9. Vậy nên ở đây không có dấu hoa thị kiểu "mở trên nguyên tắc, nhưng bị giữ lại để tăng cường an toàn", không có độ trễ hai tuần để chờ đợi. GPT-6.1 Sol, mô hình mà OpenAI phát hành ngày 29 tháng 9 năm 2026, thì đóng và chỉ dùng qua API, và sẽ luôn như vậy. Và trên bảng độc lập, mô hình có thể tải xuống đạt 43,6 điểm so với 51,8 của mô hình đóng, trong khi tốn 2,00 đô la cho mỗi tác vụ chỉ mục hoàn thành so với 0,72 đô la. Trọng số mở đáng lẽ phải là lối thoát rẻ tiền; trong cặp so sánh này, chúng lại là phía đắt đỏ của cuộc trao đổi, và lý do không phải là giấy phép.
Mỗi mô hình là gì
Kimi K3 là một mô hình hỗn hợp chuyên gia thưa với tổng cộng 2.800 tỷ tham số và khoảng 104 tỷ — tức khoảng 3,7% — được kích hoạt trên mỗi token. Mô hình có cửa sổ ngữ cảnh 1.048.576 token, nhận văn bản và hình ảnh làm đầu vào, và trả về văn bản. Checkpoint được công bố là một tệp FP8 và đây thực sự là một bản tải xuống lớn; triển khai production trên phần cứng của riêng bạn là quyết định ở cấp cụm chứ không phải cấp máy trạm. Tuyên bố về kiến trúc của Moonshoot là một sơ đồ attention tuyến tính lai mà họ nói nhanh hơn đáng kể khi giải mã ngữ cảnh dài, cùng với công việc về residual và định tuyến giúp một mô hình 2,8 nghìn tỷ tham số có thể phục vụ được.
GPT-6.1 Sol là bản làm mới tầm trung của OpenAI — dưới GPT-6 Astra, trên GPT-6 Luna — với cửa sổ 1.050.000 token, giới hạn đầu ra 128.000 token, đầu vào dạng văn bản, hình ảnh và tệp, cùng mốc kiến thức ngày 30 tháng 4 năm 2026. Suy luận chạy low đến max với medium là mặc định; bậc none mà GPT-6 Sol trước đây chấp nhận bị từ chối thẳng thừng, và ghi chú di trú của chính OpenAI hướng nhà phát triển sang low thay thế. Giá của nó là $2.00 và $10.00 mỗi triệu token, với đầu vào được lưu đệm ở mức $0.10.
Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:
• Đầu vào — GPT-6.1 Sol 2,00 USD mỗi 1 triệu so với Kimi K3 3,00 USD mỗi 1 triệu
• Đầu ra — GPT-6.1 Sol 10,00 USD mỗi 1 triệu so với Kimi K3 15,00 USD mỗi 1 triệu
• Đầu vào được lưu đệm — GPT-6.1 Sol 0,10 USD mỗi 1 triệu so với Kimi K3 0,30 USD mỗi 1 triệu
• Cửa sổ ngữ cảnh — 1.050.000 token so với 1.048.576 token; khác biệt 0,1%, không đáng kể
• Đầu ra tối đa — 128.000 token ở cả hai
• Tổng số tham số và tham số hoạt động — không được công bố so với tổng 2.800 tỷ, 104 tỷ hoạt động mỗi token
• Phương thức — nhận văn bản, hình ảnh và tệp vào, xuất văn bản ra so với nhận văn bản và hình ảnh vào, xuất văn bản ra
• Trọng số — đóng, chỉ API so với mở, không hạn chế, hơn 1 triệu lượt tải xuống
• Điều khoản ngữ cảnh dài — định giá lại toàn bộ yêu cầu trên 272.000 token đầu vào ở mức 2× cho đầu vào và bộ nhớ đệm, và 1,5× cho đầu ra so với không có điều khoản tương đương trên thẻ đã công bố
• Intelligence Index, độc lập, nỗ lực tối đa — 51,8 so với 43,6
• Chi phí mỗi tác vụ chỉ số, độc lập — 0,72 USD so với 2,00 USD
• Token đầu ra trong lần chạy chỉ số — 67 triệu so với 160 triệu, so với mức trung vị của bảng xếp hạng là 140 triệu cho lớp so sánh của nó
Bài đánh giá duy nhất mà K3 giành chiến thắng, và tại sao điều đó lại quan trọng
Trước phần số học, hãy nói về ngoại lệ, bởi vì nó là thật. Được chấm điểm theo từng đánh giá một ở mức nỗ lực tối đa trên Artificial Analysis v4.3.2, GPT-6.1 Sol dẫn đầu bảy trong mười hạng mục và không hòa hạng nào, nhưng mô hình giành chiến thắng ở bài đánh giá suy luận ngữ cảnh dài là K3:
• AA-LCR v1.1 — Kimi K3 0.887 so với GPT-6.1 Sol 0.830. Dẫn trước sáu điểm trên bài đánh giá được xây dựng riêng cho việc suy luận trên đầu vào dài.
• SciCode — Kimi K3 0.595 so với GPT-6.1 Sol 0.542. K3 cũng dẫn đầu về lập trình khoa học.
• Terminal-Bench 4.0 — Kimi K3 0.126 so với GPT-6.1 Sol 0.561. Khoảng cách 43 điểm theo hướng ngược lại, và hơn hẳn là mức chênh lệch lớn nhất trong cặp so sánh này.
• Humanity's Last Exam — Kimi K3 0.469 so với GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 so với GPT-6.1 Sol 41.5; về độ tin cậy thực tế, hai mô hình không thuộc cùng một lớp mô hình.
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 so với GPT-6.1 Sol Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 so với GPT-6.1 Sol 0.860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583, 0.22 và 0.234; Sol 0.649, 0.310 và 0.317.
Kết quả AA-LCR là thứ đáng để xem xét nghiêm túc, vì đây là con số duy nhất mâu thuẫn với câu chuyện về chi phí trên mỗi tác vụ, và nó chỉ ra một loại khối lượng công việc mà ở đó câu trả lời trông có vẻ rẻ lại sai theo cả hai hướng. Nếu lưu lượng của bạn là các đầu vào rất dài, một câu trả lời được tạo ra khiêm tốn, và việc tái sử dụng nhiều một tiền tố ổn định — đúng dạng mà ở đó sự dài dòng không bao giờ có cơ hội gây hại — thì sự kết hợp của K3 gồm điểm số ngữ cảnh dài hàng đầu, khả năng nhập hình ảnh và một checkpoint có thể tải xuống sẽ phù hợp hơn so với Sol, và con số chi phí trên mỗi tác vụ cho lượt chạy chỉ mục không áp dụng cho bạn. Đó là phiên bản trung thực của câu "trọng số mở đáng được trả giá cao hơn": đôi khi mô hình mở đơn giản chỉ là mô hình tốt hơn cho công việc, và ở đây nó đúng như vậy trên một khía cạnh.
Cũng đáng gọi tên điểm chung giữa hai chiến thắng đó. K3 mạnh ở những tác vụ có thể được trả lời trong một hành động đọc hoặc suy luận dài, và yếu ở những tác vụ phải được thực thi qua nhiều bước nhỏ và được kiểm tra. Khoảng cách 43 điểm trên Terminal-Bench và khoảng cách 22 điểm về khả năng toàn tri là cùng một phát hiện được nhìn từ hai góc độ: thực thi agentic bền bỉ không phải là điều mà checkpoint này được tối ưu hóa.
Phép tính, thứ thực sự quyết định điều đó.
Bảng giá của K3 bằng 1,5 lần của Sol ở mọi dòng, và chi phí đo được cho mỗi tác vụ lập chỉ mục đã hoàn thành là 2,8 lần; sự khác biệt giữa 1,5 và 2,8 hoàn toàn được giải thích bởi khối lượng token. Phép đo của chính hội đồng là 160 triệu token đầu ra cho K3 so với 67 triệu cho Sol trên cùng một bộ mười đánh giá. K3 tạo ra lượng đầu ra gấp 2,4 lần với mức giá gấp 1,5 lần, và 2,4 × 1,5 là 3,6 — con số $2,00 so với $0,72 của hội đồng có phần dễ coi hơn tỷ lệ thuần túy vì các đóng góp từ đầu vào và bộ nhớ đệm bù trừ nó đôi chút, nhưng chiều hướng thì không có gì phải tranh cãi.
Hoạt động marketing của chính Moonshoot lại đi ngược lại điều này theo một cách đáng để đọc kỹ. Công ty tuyên bố K3 phát ra ít token đầu ra hơn so với phiên bản tiền nhiệm, và phần việc kiến trúc — cơ chế attention, thiết kế residual — nhắm thẳng vào chi phí giải mã ngữ cảnh dài. Cả hai điều đó đều có thể đúng trong khi mô hình vẫn dài dòng gấp đôi mức trung vị của một benchmark trên một bộ kiểm thử tổng quát. Hai tuyên bố nói về hai thứ khác nhau: hiệu quả so với một Kimi trước đó, và hiệu quả so với toàn lĩnh vực. Chỉ cái thứ hai mới là thứ bạn đang bị tính phí dựa trên, và đó cũng là cái mà hội đồng độc lập đo lường.
Cache làm dịu điều đó. Cả hai mức giá đầu vào có cache đều bằng một phần mười mức giá đầu vào không cache của mô hình tương ứng — 0,30 USD cho K3, 0,10 USD cho Sol — nên dòng cache không làm thay đổi thứ tự, nhưng nó có nghĩa rằng một khối lượng công việc nhiều yêu cầu, ít câu trả lời sẽ thu hẹp khoảng cách xuống xấp xỉ tỷ lệ trên bảng giá thay vì tỷ lệ tác vụ đo được. Và điều khoản ngữ cảnh dài của Sol lại tác động theo hướng ngược lại: trên 272.000 token đầu vào, nó định giá lại toàn bộ yêu cầu ở mức 4,00 USD và 15,00 USD, với cache ở mức 0,20 USD, đây là dải duy nhất mà bảng giá phẳng của K3 thắng hoàn toàn. Điều đó đáng để biết vì hai lý do, bởi đây cũng là dải mà điểm ngữ cảnh dài của K3 là con số tốt nhất trong so sánh này.

Open weights thực sự đáng giá bao nhiêu ở đây
Ba điều, và đáng để tách chúng ra vì “trọng số mở” thường được dùng như một luận điểm trong khi thực chất là ba.
Điều đầu tiên là bạn có thể rời đi. Nếu Moonshoot bị mua lại, thay đổi giấy phép cho các phiên bản tương lai, ngừng hỗ trợ K3 hoặc tăng giá API, thì một checkpoint bạn đã tải xuống vẫn tiếp tục chạy. Đó không phải là giả định đối với phòng thí nghiệm này: Moonshoot đã tạm ngừng nhận đăng ký mới trong vòng khoảng 48 giờ sau một bản phát hành trước đó để bảo vệ chất lượng dịch vụ cho những khách hàng trả phí hiện hữu, đây là minh chứng sống động rằng quyền truy cập API là một quyết định chính sách chứ không phải là một tài sản. Không có điều nào trong số này xuất hiện trong bảng chi phí trên mỗi tác vụ và tất cả đều là thật.
Điều thứ hai là bạn có thể ghim. Một bản sửa đổi cố định, được tinh chỉnh, chạy bên trong ranh giới do bạn kiểm soát, là thứ có thể cho kiểm toán viên xem và API không thể cung cấp. Đối với lưu lượng được quản lý, điều đó đáng giá hơn một bảng giá cước.
Điều thứ ba — điều thường được mặc định — là nó sẽ rẻ hơn. Không phải vậy. Checkpoint là một artifact FP8 2,8 nghìn tỷ tham số, và hướng dẫn triển khai đã công bố được định hình xoay quanh các cấu hình nhiều bộ tăng tốc thay vì một nút đơn. Một nhóm đã vận hành loại cụm đó thì có một lựa chọn thực sự ở đây và phép tính thay đổi hoàn toàn, vì chi phí biên của một token trở thành tiền điện. Một nhóm không làm vậy đang so sánh hóa đơn API với một khoản mua sắm vốn, và hóa đơn API thắng với khoảng cách lớn. Tóm tắt trung thực là trọng số mở ở đây cho bạn khả năng rời đi, không phải khả năng chạy với chi phí rẻ.
Cả hai đều trên một phím, đó chính là điều khiến cho giao dịch này trở nên hữu ích
Kimi K3 đang có trên OrcaRouter với mức giá niêm yết của chính Moonshoot — $3,00 và $15,00 mỗi triệu token, với giá đọc cache là $0,30, không thay đổi so với bảng giá của nhà cung cấp — và GPT-6.1 Sol đã có mặt trên các tuyến của chúng tôi với mức giá của OpenAI vào ngày phát hành, $2,00 và $10,00 với đầu vào cache ở mức $0,10, và bước 272.000 token được chuyển tiếp đúng như đã niêm yết. Không có gì được cộng thêm vào cả hai. Nền tảng chuyển tiếp giá niêm yết của nhà cung cấp thay vì đội giá lên, vì vậy thay đổi giá của Moonshoot và thay đổi giá của OpenAI đều xuất hiện ở phía chúng tôi cùng ngày chúng xuất hiện ở phía nhà cung cấp, mà không cần hợp đồng thứ hai hay nhà bán lại trung gian.

Lý do khiến điều này quan trọng hơn đối với cặp mô hình này so với hầu hết các trường hợp khác là hai mô hình thuộc những kiểu thất bại khác nhau. GPT-6.1 Sol là mô hình bạn chạy để thực thi bền bỉ, lặp gọi công cụ và đảm bảo độ tin cậy dựa trên dữ kiện; Kimi K3 là mô hình bạn chạy cho những đầu vào rất dài, khi bạn muốn điểm ngữ cảnh dài tốt nhất và muốn một checkpoint như biện pháp phòng ngừa trước quyết định kinh doanh của người khác. Đó không phải là những lựa chọn cạnh tranh nhau, mà là hai tuyến đường phục vụ cùng một dòng lưu lượng. Việc đặt cả hai sau một endpoint, với khả năng tự động chuyển đổi dự phòng giữa chúng và một quy tắc chuyển công việc đầu vào dài sang K3 còn công việc thực thi sang Sol, chính là điều biến “chúng ta có một phương án dự phòng trọng số mở” từ một dòng trong tài liệu thiết kế thành thứ hoạt động được vào ba giờ sáng trong một cuộc gọi đang gặp sự cố.

Nơi mỗi người thuộc về
• Tác tử terminal, lập trình quy mô repo, thực thi đa bước — GPT-6.1 Sol, với khoảng cách 43 điểm trên Terminal-Bench 4.0. Không hề sát nút.
• Câu trả lời ở nơi ảo giác phải trả giá đắt — GPT-6.1 Sol, với khoảng cách 22 điểm trên AA-Omniscience.
• Đầu vào rất dài với câu trả lời tạo ra ngắn — Kimi K3. Điểm suy luận ngữ cảnh dài tốt nhất trong so sánh này, có đầu vào hình ảnh, và mức độ dài dòng không bao giờ có cơ hội phát huy.
• Tự vận hành hoặc một stack suy luận mà bạn phải có khả năng đóng băng — Kimi K3, và chỉ khi bạn đã vận hành phần cứng. Checkpoint mới là thứ được bàn giao; bài toán kinh tế của việc chạy nó là chuyện riêng.
• Một biện pháp phòng ngừa trước việc nhà cung cấp thay đổi điều khoản — Kimi K3, và đây là lập luận duy nhất mà GPT-6.1 Sol không thể trả lời dù với bất kỳ mức giá nào.
• Lựa chọn dựa trên bảng giá — cả K3 lẫn Sol đều không phải lựa chọn rẻ trong so sánh này, và cũng không phải lựa chọn rẻ trong dòng GPT-6. Nếu hóa đơn là yếu tố quyết định, mô hình bạn muốn nằm ở phía dưới bảng giá, chứ không phải ở bảng này.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
