
Dots vs Kimi K3: Một bên đọc toàn bộ thư viện, bên kia đi tìm nó
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 349 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 210 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Có một loại công việc cụ thể mà chỉ một trong hai thứ này có thể làm được, và điều đó đáng được gọi tên trước tiên. Kimi K3, được Moonshot AI công bố vào ngày 15 tháng 7 năm 2026, là một mô hình mixture-of-experts 2,8 nghìn tỷ tham số với cửa sổ ngữ cảnh 1.048.576 token, chấp nhận văn bản và hình ảnh rồi trả về văn bản, có giá 3,00 USD cho mỗi triệu token đầu vào và 15,00 USD cho mỗi triệu token đầu ra, với lượt đọc từ bộ nhớ đệm là 0,30 USD. Dots là tác nhân luôn hoạt động của công ty, được công bố tại DevDay vào ngày 29 tháng 9 năm 2026, với máy tính đám mây và trình duyệt riêng, các trình kết nối tới hơn 4.000 ứng dụng, và một vị trí bên trong ChatGPT, Slack và Teams, chạy trên GPT-6 Astra và được bao gồm trong Pro và Business Premium. K3 có thể giữ toàn bộ một kho lưu trữ trong một yêu cầu và trả lời các câu hỏi về nó. Một dot có thể đi lấy tài liệu tiếp theo mà bạn chưa nghĩ tới. Đọc và truy xuất là những công việc khác nhau, và chọn sai một trong hai là sai lầm tốn kém.
Con số mà Kimi K3 sở hữu trọn vẹn
Khả năng gợi nhớ ngữ cảnh dài là thước đo phân biệt giữa marketing và năng lực thực sự, bởi một cửa sổ ngữ cảnh lớn thì rất dễ để tuyên bố nhưng lại khó để sử dụng. K3 đạt 88,7 ở chỉ số này — con số cao nhất trong số mọi mô hình mà chúng tôi liệt kê, trên mức 84 của GPT-5.6 Sol, 83 của MiniMax M3 và 82 của Gemini 3.1 Pro. Mô hình này cũng đạt 93,5 trên GPQA Diamond và 59,5 trên SciCode, đồng thời có Chỉ số Lập trình Artificial Analysis là 76,2, xếp thứ chín trong số 138 mô hình được đo, và Chỉ số Thông minh là 43,6, xếp thứ mười chín trong số 145. Đó đều là các số liệu của bên thứ ba, được đưa vào danh mục của chúng tôi kèm nguồn đi kèm thay vì lặp lại từ một bài đăng ra mắt.
Điều đó mang lại cho bạn một loại tác vụ đơn giản là không thể phân rã: đọc toàn bộ một codebase trước khi trả lời một câu hỏi về nó, so sánh một năm hợp đồng với một mẫu mới, hay duy trì một phiên agentic dài mà phần giữa không bị rơi khỏi bộ nhớ. K3 được xây dựng chính xác cho việc đó — Moonshot định vị nó cho các agent lập trình và công việc tri thức dài hạn — và nó khác thường ở chỗ từ chối hoàn toàn các tham số lấy mẫu. Không có temperature, không có top_p, không có seed; độ sâu suy luận chỉ là một núm duy nhất gọi là reasoning_effort. Đó là một sự đánh đổi có chủ đích: ít núm vặn hơn, nhất quán hơn trong suốt một phiên dài.

Dấu chấm dùng để làm gì, nói thẳng không cần chiêu trò tiếp thị.
Dot là một worker có lịch. Đầu vào của nó rất bình thường — tin nhắn của bạn, dữ liệu ứng dụng của bạn, một tác vụ bạn mô tả bằng một câu — và đầu ra của nó là một thay đổi ở một nơi khác: một tệp được di chuyển, một ticket được cập nhật, một tin nhắn được soạn và gửi sau khi bạn phê duyệt, một trang được mở trong trình duyệt riêng của nó. Tài liệu ra mắt của OpenAI mô tả nó đang đưa nhiều dự án tiến lên cùng một lúc và học hỏi từ phản hồi, và cách hiểu trung thực là bạn đang mua phần kết nối, chứ không phải trí tuệ.
Phần mô liên kết mới là phần tốn kém để xây dựng. Một trình duyệt hành xử như của một con người, các trình kết nối do nhà cung cấp ứng dụng duy trì, một chế độ xem hoạt động, các cổng phê duyệt, sự cách ly khỏi máy của chính bạn — về nguyên tắc, không thứ nào trong đó là khó, và trên thực tế, tất cả đều tẻ nhạt. Đó là thứ mà gói đăng ký trả tiền để có. Thứ mà nó không trả tiền để có là khả năng đo lường.
• Chi phí — được bao gồm trong Pro hoặc Business Premium, hạn mức chưa được công bố (Dots) so với $3.00 mỗi triệu token đầu vào và $15.00 mỗi triệu token đầu ra, lượt đọc từ bộ nhớ đệm $0.30 (Kimi K3)
• Mức trần cho một yêu cầu — không có tài liệu dù chỉ một dấu chấm, so với 1.048.576 token ngữ cảnh và mức 88,7 thân thiện với thiết bị di động về khả năng nhớ lại ngữ cảnh dài (Kimi K3)
• Đầu vào và đầu ra — tin nhắn và dữ liệu ứng dụng được kết nối đi vào, các thay đổi bên trong phần mềm khác đi ra (Dots) so với văn bản và hình ảnh đi vào, văn bản đi ra (Kimi K3)
• Kiểm soát lấy mẫu — không công bố gì (Dots) so với không temperature, không top_p và không seed, với độ sâu suy luận được đặt chỉ bởi reasoning_effort mà thôi (Kimi K3)
• Tốc độ bạn nên mong đợi — không được ghi nhận đối với một dấu chấm, so với thời gian trung vị 8,82 giây để có token đầu tiên và khoảng 39 token đầu ra mỗi giây trong phép đo bảy ngày của chính chúng tôi (Kimi K3)
• Bằng chứng độc lập — bản demo và tuyên bố năng lực của nhà cung cấp, không có benchmark (Dots) so với AA Coding Index 76.2 ở vị trí thứ chín trong 138, GPQA Diamond 93.5, khả năng nhớ lại ngữ cảnh dài 88.7 (Kimi K3)
Điều mà không ai đề cập khi mua một agent
Một gói đăng ký có hạn mức chưa được công bố sở hữu một đặc tính mà bảng giá không có: bạn không thể phân biệt được giữa một tác vụ rẻ và một tác vụ đắt. Mọi công việc đều tốn cùng một chi phí — không có gì mang tính biên — cho đến tận lúc nó không còn như vậy, và khi đó câu trả lời đến dưới dạng một giới hạn chứ không phải một hóa đơn. Đối với một nhóm mà công việc mang tính khám phá, đó là một đặc điểm có lợi. Đối với một nhóm phải quy chi phí về một dự án, đó là một lỗ hổng trong hạch toán.
Cũng có một hiệu ứng bậc hai nữa. Khi chi phí biên của một lệnh gọi trở nên vô hình, bạn thôi hỏi liệu lệnh gọi đó có cần thiết không, và cách tối ưu hóa rẻ nhất trong bất kỳ pipeline nào — không thực hiện yêu cầu — trở nên không còn dùng được với bạn. Một mô hình tính phí theo lượng đo buộc bạn phải đặt câu hỏi đó mỗi khi có ai đó xem bảng giá cước.

Kết hợp chúng mà không giả vờ rằng chúng là những lựa chọn thay thế.
Hình dạng hiệu quả là một dấu chấm biết nhận ra và một mô hình ngữ cảnh dài biết đọc. Công việc đến — một tài liệu trong ổ đĩa dùng chung, một tin nhắn trong một luồng — và dấu chấm quyết định liệu nó có quan trọng hay không. Nếu có, tài liệu sẽ được gửi đến Kimi K3 cùng mọi thứ khác mà nó có thể cần, được đính kèm, trong một yêu cầu duy nhất, và câu trả lời quay về hoàn toàn bám sát nguồn thay vì dựa trên bản tóm tắt của nguồn. Dấu chấm xử lý việc đôn đốc và những khâu hậu cần tẻ nhạt; mô hình xử lý việc đọc, ở một khối lượng mà không vòng lặp gọi nhỏ nào có thể tập hợp đúng được.
Kimi K3 được định tuyến trên OrcaRouter với tên kimi/kimi-k3 theo đúng giá niêm yết của Moonshot, không cộng thêm phụ phí, nằm trong cùng một danh mục với hơn 200 mô hình khác phía sau một khóa duy nhất, kèm khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp thượng nguồn khi một bên suy giảm và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi duy nhất. Đó chỉ là nửa phần tính phí theo lưu lượng của pipeline và không hơn thế: dots không có trong danh mục, không tồn tại endpoint nào cho chúng, và cũng không có mã định danh nào để trỏ một yêu cầu tới. Nếu lớp đọc là phần bạn cần kiểm soát — và với bất cứ thứ gì bạn định vận hành trong cả một năm, thì thường là vậy — thì đó chính là lớp bạn nên tự sở hữu.
Việc mua nào lãng phí tiền
Việc mua một dot để đọc một kho ngữ liệu lớn là lãng phí, bởi vì dot sẽ tìm nạp và tóm tắt thay vì giữ toàn bộ nội dung, và tóm tắt chính là nơi chi tiết bạn cần bị chôn vùi. Mua Kimi K3 để theo đuổi một dự án xuyên suốt năm ứng dụng là lãng phí vì lý do ngược lại: một mô hình chỉ trả lời khi được gọi sẽ không gọi bạn.
Nếu công việc là truy xuất và hậu cần, hãy thuê nhân công. Nếu công việc là thấu hiểu ở quy mô lớn, hãy mua đồng hồ đo và đưa cho nó mọi thứ cùng một lúc. Hai thứ này chồng lấn ít hơn nhiều so với từ "agentic" gợi ý, và vùng chồng lấn không phải là nơi mà bên nào làm tốt.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
