
Grok 4.7 vs Kimi K3: Nửa giá, nửa ngữ cảnh, không có trọng số
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hãy lấy một tháng làm việc lập trình dạng agentic với 300 triệu token và chạy nó qua cả hai mô hình theo mức giá niêm yết của chúng, và lựa chọn sẽ không còn giống như một cuộc tranh luận về benchmark nữa. Grok 4.7, được SpaceXAI phát hành vào ngày 21 tháng 9 năm 2026, tính 2 USD mỗi triệu token đầu vào và 6 USD mỗi triệu token đầu ra. Kimi K3, được Moonshot AI phát hành vào ngày 16 tháng 7 năm 2026, tính 3 USD và 15 USD. Trong tháng giả định đó — chẳng hạn 200 triệu token đầu vào và 100 triệu token đầu ra — Grok 4.7 tốn khoảng 1.000 USD và Kimi K3 tốn khoảng 2.100 USD. Khoảng cách này không phải là một khác biệt nhỏ do làm tròn; nó là ngân sách đủ cho cả một mô hình thứ hai. Đổi lại, Kimi K3 cho bạn cửa sổ ngữ cảnh 1.000.000 token thay vì 500.000, đầu vào video gốc cũng như hình ảnh, và trọng số có thể tải xuống. Grok 4.7 cho bạn một mô hình đóng, nhanh hơn, rẻ hơn, được huấn luyện rõ ràng cho công việc terminal tầm xa mà Kimi K3 cũng nhắm tới. Cả hai đều thuộc đẳng cấp tiên tiến. Chúng không phải là cùng một giao dịch mua.
Hai mô hình, một cách ngắn gọn
Grok 4.7 là mô hình tiên phong về lập trình và công việc tri thức của SpaceXAI, được xây dựng trên một mô hình nền tảng lớn hơn Grok 4.6 và được chạy huấn luyện tăng cường dài hơn nhắm đến các tác vụ có thể kéo dài hàng giờ. Nó là độc quyền — không có trọng số, không thể tải xuống — phục vụ cửa sổ ngữ cảnh 500.000 token, nhận văn bản và hình ảnh đầu vào rồi trả về văn bản, đồng thời hỗ trợ các mức nỗ lực suy luận từ low đến xhigh. Tuyên bố nổi bật của nó là tốc độ và giá: SpaceXAI định vị nó nhanh khoảng gấp đôi các mô hình tương đương với mức giá chỉ bằng khoảng một nửa.
Kimi K3 là mô hình hỗn hợp chuyên gia mở hàng đầu của Moonshot AI, mô hình mở đầu tiên thuộc lớp ba nghìn tỷ tham số: tổng cộng 2,8 nghìn tỷ tham số với 104 tỷ tham số hoạt động mỗi token, được xây dựng trên Kimi Delta Attention và trọng số MXFP4 nhận biết lượng tử hóa. Mô hình nhận văn bản, hình ảnh và video làm đầu vào, phục vụ ngữ cảnh 1.000.000 token, chạy suy luận luôn bật với mức nỗ lực có thể cấu hình, và trọng số của nó có thể tải xuống theo Giấy phép Kimi K3 — được phép sử dụng cho mục đích thương mại, kèm theo các hạn chế. Theo thiết kế, đây là mô hình bạn có thể mang về nhà cùng mình.
Đó là toàn bộ khác biệt về cấu trúc giữa chúng. Một cái là endpoint đóng, rẻ và nhanh. Cái kia là artifact mở, đắt hơn, chậm hơn với ngữ cảnh gấp đôi. Mọi thứ bên dưới đều là hệ quả của điều đó.
Các benchmark thực sự so sánh điều gì
Đây là chỗ mà hầu hết các bài viết so sánh Grok 4.7 với Kimi K3 đều sai, nên đáng để nói thẳng: những con số được công bố của hai mô hình phần lớn không đo lường cùng một thứ, và ít nhất một cặp trông có vẻ so sánh được thì lại không phải vậy.
Bắt đầu với cặp số liệu thực sự gây hiểu lầm. Tài liệu ra mắt của Kimi K3 dẫn điểm Terminal-Bench 2.1 là 88.3. Tài liệu ra mắt của Grok 4.7 dẫn Terminal-Bench 4.0 ở mức 38.0%. Đó là những phiên bản benchmark khác nhau với bộ nhiệm vụ khác nhau và cách tính điểm khác nhau, và việc đặt chúng cạnh nhau sẽ gợi ý rằng Kimi K3 là mô hình agentic mạnh hơn gấp đôi. Đó không phải là cách đọc có thể biện minh được, và không ai nên lặp lại điều đó. Cả hai con số đều do nhà cung cấp tự báo cáo — chưa có con số nào được tái lập một cách độc lập.
Điều có thể so sánh được là chỉ số tổng hợp độc lập, và ở đó hai mô hình rất sát nhau. Trên Chỉ số Trí tuệ Artificial Analysis hiện tại, phiên bản v4.3.2, Kimi K3 đạt 44 — đứng thứ hai trong số 113 mô hình, vị trí cao nhất của bất kỳ mô hình trọng số mở nào trên bảng xếp hạng. Grok 4.7 đạt 46, đứng thứ mười sáu trong số 655. Cách nhau hai điểm, với vị trí của Kimi K3 đạt được ở mức nỗ lực suy luận tối đa. Trên chỉ số tổng hợp hỗn hợp, các mô hình này ngang hàng.
• Tổng hợp độc lập — Grok 4.7 đạt 46 trên AA Intelligence Index v4.3.2 so với Kimi K3 đạt 44 trên cùng phiên bản. Thực tế là hòa nhau.
• Cửa sổ ngữ cảnh — Grok 4.7 500.000 token so với Kimi K3 1.000.000 token. Một lợi thế thực sự, tuyệt đối dành cho Kimi K3, và là khác biệt thông số duy nhất không kèm bất kỳ lưu ý nào.
• Phương thức đầu vào — Grok 4.7 văn bản và hình ảnh so với Kimi K3 văn bản, hình ảnh và video. Kimi K3 rộng hơn, nếu khối lượng công việc của bạn có video trong đó.
• Trọng số — Grok 4.7 độc quyền, không cho tải xuống, so với Kimi K3 có trọng số mở theo Kimi K3 License. Đối với yêu cầu triển khai tại chỗ hoặc air-gapped, đây là dòng duy nhất quan trọng.
• Giá mỗi triệu token — Grok 4.7 2 USD vào / 6 USD ra so với Kimi K3 3 USD vào / 15 USD ra, với mức giá đầu vào được cache của Kimi là $0.30 mỗi triệu. Grok 4.7 rẻ hơn trên mọi phương diện, và rẻ hơn đáng kể ở đầu ra.
• Kiểm soát mức độ nỗ lực suy luận — Grok 4.7 từ low đến xhigh so với Kimi K3 luôn bật với mức nỗ lực có thể cấu hình. Về mặt chức năng thì tương tự; điểm khác biệt là Grok 4.7 cho phép bạn giảm mức suy luận xuống.
• Bằng chứng agentic do nhà cung cấp tự báo cáo — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (tất cả đều do nhà cung cấp tự báo cáo) so với Kimi K3 Terminal-Bench 2.1 88,3%, Frontend Code Arena đứng thứ nhất với 1,679 Elo (do nhà cung cấp tự báo cáo khi ra mắt). Không thể so sánh — xem ở trên.


Tiền thực sự đi đâu
Bảng giá đánh giá thấp khoảng cách, vì hai mô hình tiêu thụ token theo cách khác nhau. Grok 4.7 là một mô hình suy luận dài dòng — Artificial Analysis đo được 240 triệu token đầu ra được tạo ra khi chạy Intelligence Index của nó, so với mức trung vị 92 triệu trên các mô hình. Kimi K3 là kiểu đắt đỏ ngược lại: nó là một mô hình suy luận lớn luôn hoạt động, và ở mức 15 USD mỗi triệu token đầu ra, thứ bạn đang mua chính là sự dài dòng.
Vậy mô hình chi phí trung thực không phải là "$2/$6 so với $3/$15." Nó là số token đầu ra trên mỗi tác vụ đã hoàn thành, nhân với mức giá đầu ra, cộng với số token đầu vào bao gồm mọi lần thử lại, nhân với mức giá đầu vào. Một mô hình giải quyết một tác vụ chỉ trong một lượt dài với giá $6 mỗi triệu token có thể đánh bại một mô hình cần ba lần thử với giá $15 mỗi triệu token, và nó cũng có thể thua mô hình đó nếu các lượt của mô hình rẻ đủ dài. Đó là một phép đo bạn tự chạy trên kho mã của chính mình, không phải thứ ai đó công bố sẵn cho bạn.
Một điểm bất đối xứng đáng để biết trước khi bạn chạy nó: Grok 4.6, tiền nhiệm của Grok 4.7, áp dụng một ngưỡng giá tăng vọt ở 200.000 token đầu vào, khi đó một yêu cầu vượt qua ranh giới sẽ khiến toàn bộ yêu cầu được định giá lại với mức gấp đôi. Công việc ngữ cảnh dài ở phía Grok cần được đối chiếu với bảng giá hiện hành của mô hình bạn triển khai, vì cửa sổ 500.000 token và ngưỡng 200.000 token tương tác theo hướng rất bất lợi. Giá của Kimi K3 là mức giá phẳng, và đó là lợi thế âm thầm hơn trong hai điểm.
Nơi mỗi thứ bị hỏng
Cả hai mô hình đều có một kiểu lỗi mà tài liệu ra mắt không đề cập trước tiên, và chúng là những kiểu lỗi khác nhau.
Điểm mấu chốt của Kimi K3's là độ tin cậy dưới tải liên tục. Các bài kiểm thử của cộng đồng và độc lập khi ra mắt cho thấy hiệu năng tác tử của nó suy giảm khi các lượt chạy kéo dài — kết quả mạnh ở lượt chạy đơn lẻ, tỷ lệ vượt qua bền vững yếu hơn — và tốc độ xuất ra của nó ở khoảng 37 đến 38 token mỗi giây, tức là chậm đối với lập trình tương tác. Moonshot cũng phải tạm dừng đăng ký mới cho người dùng phổ thông ngay sau khi ra mắt vì nhu cầu vượt quá năng lực đáp ứng, điều đó phần nào cho thấy dư địa phục vụ ở phía máy chủ lưu trữ.
Grok 4.7 thì có hình dạng ngược lại: nó nhanh, rẻ và đóng, nghĩa là bạn không thể kiểm tra nó, không thể tự chạy nó, và không thể phòng ngừa trước việc nó bị ngừng hỗ trợ. SpaceXAI đã công khai sắp xếp Grok 4.8, Grok 4.9 và Grok 5 nối tiếp bản phát hành này, và Grok 4.6 chỉ tồn tại khoảng năm tuần trước khi bị thay thế. Bất cứ thứ gì bạn xây dựng trên Grok 4.7 cũng nên được xây dựng sao cho ID mô hình là một giá trị cấu hình, chứ không phải một giả định.
Có một cân nhắc thứ ba không phải là thất bại của cả hai mô hình: không mô hình nào là câu trả lời đúng cho một phiên chạy tự hành kéo dài hai tuần, và cả hai nhà cung cấp đều đã demo đúng điều đó. Các bản demo viết mã tự hành 16 ngày và 48 giờ đã công bố đều do nhà cung cấp vận hành, trên các tác vụ do nhà cung cấp lựa chọn, mà không có tái lập độc lập. Chúng đáng để biết đến và không đáng để lập kế hoạch dựa trên đó.

Chạy cả hai, và lý do đó mới là câu trả lời thực sự
Khoảng cách chi phí và khoảng cách ngữ cảnh chỉ về hai hướng ngược nhau, và đó là lập luận cho việc không chọn một cái duy nhất. Kimi K3 xứng đáng với mức giá của nó trong công việc ở quy mô kho mã nguồn, nơi cửa sổ 1M nghĩa là bạn không phải chia nhỏ đầu vào, và với bất cứ thứ gì phải tự lưu trữ. Grok 4.7 xứng đáng với mức giá của nó ở khối lượng lớn — các vòng lặp tác nhân nhiều lượt, pipeline nặng về gọi công cụ, và những phiên terminal dài, nơi tốc độ và chi phí đầu ra chiếm ưu thế.
Kimi K3 đã có mặt trên OrcaRouter, điều này biến sự phân chia đó thành một quyết định về định tuyến chứ không phải về mua sắm. Nó nằm trong danh mục ở mức giá niêm yết của Moonshot, và vì OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức chênh 0%, một đợt giảm giá từ nhà cung cấp sẽ có hiệu lực ngay tại đây vào đúng ngày được công bố thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Đối với những khối lượng công việc mà ở đó một lượt xử lý ngữ cảnh dài và một lượt thực thi nên phối hợp với nhau thay vì cạnh tranh — một mô hình nắm giữ toàn bộ kho mã trong tầm nhìn, một mô hình khác hành động dựa trên đó — DSL định tuyến kết hợp nhiều mô hình vào một lời gọi duy nhất, và tính năng hợp nhất mô hình cho phép một nhóm mô hình cùng trả lời khi tác vụ xứng đáng với khoản chi thêm. Một khóa API duy nhất bao trùm Kimi K3 cùng hơn 200 mô hình khác, nhờ đó phần thực thi trong sự phân chia đó có thể đến từ bất kỳ mô hình nào rẻ nhất và nhanh nhất cho công việc, thay vì từ mô hình tình cờ đang nắm giữ ngữ cảnh.
Có một điều cần làm rõ: trọng số mở của Kimi K3 có thể tải xuống, nhưng endpoint được lưu trữ mới là thứ OrcaRouter định tuyến tới. Nếu yêu cầu của bạn thực sự là suy luận tại chỗ (on-premise), thì đó là một dự án tự lưu trữ trên phần cứng của chính bạn, không phải một quyết định định tuyến — và đây là tình huống duy nhất mà so sánh này chỉ có một câu trả lời đúng.
Phán quyết, và con số duy nhất cần nắm giữ
Nếu bạn đang chọn dựa trên chi phí và tốc độ, Grok 4.7 thắng và không hề sít sao: giá đầu vào bằng một nửa, giá đầu ra dưới một nửa, tốc độ phục vụ nhanh hơn, và một núm điều chỉnh suy luận mà bạn có thể vặn giảm. Nếu bạn đang chọn dựa trên ngữ cảnh, độ rộng phương thức, hoặc khả năng sở hữu mô hình, Kimi K3 thắng với cùng các tiêu chí đó. Nếu bạn chỉ chọn dựa trên năng lực, chỉ số tổng hợp độc lập cho thấy chúng cách nhau hai điểm, và bạn nên quyết định dựa trên đánh giá của chính mình thay vì dựa trên biểu đồ ra mắt của bất kỳ nhà cung cấp nào.
Con số cần bám lấy là con số ở trên cùng: $2/$6 so với $3/$15. Mọi thứ khác trong so sánh này đều có thể thương lượng, còn tỷ lệ đó thì không.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
