Thẻ tiêu đề hero cho bài so sánh 'Grok 4.6 vs DeepSeek V4 Pro', phụ đề 'Một cuộc chiến giá cả tiên phong, diễn ra cách nhau 24 giờ,' kèm huy hiệu 'So sánh · Tháng 8 năm 2026'.
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro: Cuộc chiến giá cả tiên phong, diễn ra cách nhau 24 giờ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình tiên phong ra mắt cách nhau chưa đầy 24 giờ, và khoảng cách giữa bảng giá của chúng là lớn nhất mà thế hệ này từng tạo ra. Grok 4.6 ra mắt ngày 12 tháng 8 năm 2026 với giá $2 mỗi triệu token đầu vào và $6 mỗi triệu token đầu ra. DeepSeek V4 Pro — bản phát hành sản xuất chính thức của mô hình chủ lực DeepSeek, phiên bản DeepSeek-V4-Pro-0813 — tiếp nối vào ngày 13 tháng 8 năm 2026 với giá ¥3 mỗi triệu token đầu vào không trúng bộ nhớ đệm và ¥6 mỗi triệu token đầu ra, tương đương khoảng $0.42 và $0.85. Cùng phân khúc, cùng tham vọng về tác nhân, nhưng chênh lệch giá tới một bậc độ lớn. Đây không phải là sự so sánh giữa hai thông số kỹ thuật; đây là sự so sánh giữa hai chiến lược về mức giá mà một mô hình dạng tác nhân nên có, và cả hai đều được phát hành trong tuần này.

Bài viết này đặt hai bảng giá cạnh nhau, đọc từng tuyên bố điểm chuẩn của mỗi nhà cung cấp với nhãn nhà cung cấp được gắn rõ, rồi tính toán xem khoảng cách đó thực sự tốn kém bao nhiêu trên một khối lượng công việc thực tế — bởi vì trên giấy tờ, các mô hình này gần nhau về năng lực hơn là về triết lý thiết kế, và chênh lệch giá trên mỗi tác vụ chính là yếu tố quyết định.

Thời điểm chính là điểm mấu chốt

Việc cả hai mô hình ra mắt trong cùng một cửa sổ 48 giờ không phải là một sự trùng hợp ngẫu nhiên của lịch. Grok 4.6 là bản tái cấu trúc agentic của SpaceXAI dựa trên nền tảng 1.5T của họ — một bản làm mới hậu huấn luyện nặng về học tăng cường trên các lĩnh vực lập trình, công việc kernel và CAD, được định giá như nhiên liệu cho các sản phẩm Cursor và Grok Bot mà công ty sở hữu. DeepSeek V4 Pro là sự chính thức hóa của một bản xem trước đã âm thầm định nghĩa lại ý nghĩa của "agentic" với mức giá chỉ bằng một phần nhỏ, nay được nâng cấp cho nền kinh tế agent: ghi chú phát hành cho bản build 0813 của D​eepSeek mở đầu với khả năng agent được cải thiện đáng kể, bổ sung hỗ trợ cho Responses API và tích hợp Codex, đồng thời giữ cả hai chế độ thinking (mặc định) và non-thinking, đầu ra JSON, gọi công cụ và định dạng API Anthropic. Hai công ty rất khác nhau đã đồng thời đi đến kết luận rằng thị trường quan trọng vào cuối năm 2026 là các agent — và định giá sản phẩm của họ cho những túi tiền rất khác nhau.

Hai bảng giá, đặt cạnh nhau

Grok 4.6 — $2.00 / $6.00 / $0.50 (đầu vào được lưu trong bộ nhớ đệm) trên mỗi triệu token, ngữ cảnh 500K, một mức tăng $4 / $12 / $1 so với khoảng 200K token đầu vào, và một biến thể nhanh hơn với giá gấp đôi mức cơ bản.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) cho đầu vào không trúng bộ nhớ đệm, ¥0.025 (≈$0.0035) cho đầu vào đã lưu trong bộ nhớ đệm, ¥6.00 (≈$0.85) cho đầu ra trên mỗi triệu token, với cửa sổ ngữ cảnh 1 triệu token và tối đa 384K token đầu ra. Phiên bản rẻ hơn của nó, V4 Flash, có giá ¥1 / ¥2.

Ngay cả khi so với Grok 4.6 — vốn đã là API tiên phong rẻ nhất trong thế hệ của nó — DeepSeek V4 Pro rẻ hơn khoảng năm lần đối với đầu vào cache-miss và rẻ hơn bảy lần đối với đầu ra, đồng thời mang lại cửa sổ ngữ cảnh lớn gấp 2 lần và đầu ra tối đa lớn hơn nhiều trong cùng một phân khúc giá. Hai mô hình này không cạnh tranh về giá; D​eepSeek đã đơn phương thiết lập một mức sàn mới và Grok giờ là lựa chọn cao cấp trong cùng một câu nói. Cách nhìn nhận đó quan trọng, vì cách nhìn nhận trước đó — "Grok 4.6 là mô hình tiên phong rẻ" — đã chỉ đúng trong đúng một ngày.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Những gì DeepSeek V4 Pro thực sự cải thiện

Các con số ra mắt của DeepSeek là ấn tượng nhất vì chúng được đo lường so với bản xem trước của chính nó, và bước nhảy từ bản xem trước đến bản phát hành là rất lớn. Theo đánh giá của chính nhà cung cấp:

DeepSWE — 62.7% trên bản phát hành, tăng từ 12.8% ở bản xem trước — một điểm số tầm xa kỹ thuật phần mềm mà nhà cung cấp xếp giữa 58.0% của Opus 4.8 và 70.0% của Claude Fable 5.

Cybergym — 83,3%, tăng từ 52,7%, nhỉnh hơn mức 83,1% của Fable 5 và vượt qua mức 78,3% của Opus 4.8.

Terminal Bench 2.1 — đạt 87.9%, chỉ kém Fable 5 (88.0%) một điểm và vượt trước Opus 4.8 (85.0%).

AutomationBench (public) — 31,8%, tăng từ 12,8%, vượt qua cả Fable 5 (29,1%) và Opus 4.8 (27,2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack và DSBench-Hard — lần lượt đạt 74.1%, 61.5%, 71.1% và 67.2%, tập trung ở mức hoặc gần mức Opus 4.8 / Fable 5.

Tất cả những con số đó đều do DeepSeek tự báo cáo trên bộ đánh giá của chính họ. Xu hướng thì rõ ràng không thể nhầm lẫn — bản xem trước chưa sẵn sàng cho các vòng lặp agent trong môi trường sản xuất, còn bản phát hành thì tuyên bố là đã sẵn sàng — nhưng nói thẳng ra là chưa có phòng thí nghiệm độc lập nào chấm điểm DeepSeek V4 Pro, và các mô hình dùng để so sánh điểm chuẩn cũng không do bên ngoài nêu tên.

Grok 4.6 trả lời bằng gì

Bộ đếm của Grok 4.6 khác hẳn về bản chất: đây là cái duy nhất trong hai bên có bảng điểm độc lập. Artificial Analysis đo được nó đạt 61 điểm trên Intelligence Index — ngang bằng với GPT-5.6 Sol, vượt qua Kimi K3 (60) — trước cả khi DeepSeek V4 Pro được phát hành. Bảng số liệu của nhà cung cấp tuyên bố đạt vị trí dẫn đầu với 65,9% trên DeepSWE v1.1 và 69,9% trên CursorBench v3.2, cùng điểm yếu được công khai thừa nhận là 26% trên Terminal-Bench v3.0. Đây đều là số liệu do xAI công bố, chưa có số liệu nào được tái lập độc lập tính đến ngày 13 tháng 8.

Sự lệch phiên bản sẽ trở thành vấn đề khi bạn cố so sánh trực tiếp hai mô hình với nhau. Điểm 87.9 của D​eepSeek là trên Terminal Bench 2.1; còn mức 26% của Grok là trên bản v3.0 khó hơn — đây là những bài kiểm tra khác nhau, nên câu "D​eepSeek vượt trội Grok ở mảng terminal" không phải là một nhận định trung thực, và câu "Grok dẫn đầu trên DeepSWE" cũng vậy nếu không nói rõ hai nhà cung cấp đã chạy các phiên bản đánh giá khác nhau và cả hai con số đều không phải từ bên thứ ba. Điều có thể so sánh được nằm ở khía cạnh độc lập: Grok 4.6 có một bảng điểm đã được kiểm chứng, còn DeepSeek V4 Pro thì chưa có bảng điểm nào — và khi cần quyết định đưa vào sản xuất, sự bất đối xứng đó tự thân nó đã là thông tin.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

Tổng chi phí cho một lần chạy agent dài

Hãy lấy một công việc tác tử thực tế — đọc và suy luận trên 500K token ngữ cảnh, viết ra 100K token đầu ra, tức là một lần refactor cỡ trung hoặc một pipeline tài liệu dài, trong cửa sổ ngữ cảnh của cả hai mô hình:

Grok 4.6 — 0.5M đầu vào với giá $2 = $1.00, cộng 0.1M đầu ra với giá $6 = $0.60. Tổng cộng: $1.60.

DeepSeek V4 Pro — 0.5M đầu vào cache-miss với giá ¥3 = ¥1.50, cộng 0.1M đầu ra với giá ¥6 = ¥0.60. Tổng: ¥2.10, khoảng $0.29.

Đó là chênh lệch gấp 5,5 lần trên cùng một tác vụ danh nghĩa, chưa tính đến bất kỳ lợi thế bộ nhớ đệm nào — và cửa sổ 1M của D​eepSeek cộng với đầu ra tối đa 384K cũng đồng nghĩa với việc công việc có thể nằm gọn trong một lần xử lý, trong khi cửa sổ 500K của Grok 4.6 có thể buộc phải xử lý hai lần. Điều khiến đây không phải là một câu trả lời đơn giản chính là chi phí suy luận và rủi ro: chế độ suy nghĩ của D​eepSeek được bật theo mặc định, nên mọi yêu cầu đều phải trả phí cho một chuỗi suy luận đầy đủ ngay cả khi bạn không cần đến, và độ tin cậy của điểm chuẩn do chính nhà cung cấp công bố vẫn chưa được bất kỳ bên độc lập nào kiểm chứng. Rẻ trên mỗi token với suy luận luôn bật vẫn là rẻ trên mỗi tác vụ ở mức giá này, nhưng "rẻ" và "đã được kiểm chứng" là hai khẳng định khác nhau, và chỉ một trong hai mô hình này mang khẳng định thứ hai.

Ai nên chọn cái nào

Quyết định không phải là "cái nào tốt hơn" mà là "hồ sơ rủi ro nào phù hợp với khối lượng công việc":

Khối lượng lớn, bị ràng buộc về chi phí, và sẵn sàng chấp nhận những con số chưa được kiểm chứng — DeepSeek V4 Pro là phương án giá sàn. Ngữ cảnh 1M và đầu ra 384K khiến nó trở thành ứng viên mạnh hơn cho ngữ cảnh dài và xử lý theo lô, và mức giá đầu vào cache ¥0.025 khiến các pipeline nặng về truy xuất gần như miễn phí. Chỉ cần tự bạn đánh giá, vì chưa có ai độc lập xác minh.

Độ sâu tác nhân với một bảng điểm độc lập, trong một hệ sinh thái tương thích OpenAI — Điểm 61 của Grok 4.6 đã được xác minh, hướng điểm chuẩn mã hóa và tác nhân là nhất quán, và điểm yếu cuối cùng được biết trước. Thời gian 42 giây để có token đầu tiên là cái giá bạn phải trả cho chất lượng đã được xác minh.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Lưu lượng hỗn hợp — đây là trường hợp dành cho định tuyến thay vì lựa chọn. Trên OrcaRouter, cả hai mô hình nằm sau một khóa duy nhất với mức giá chuyển tiếp theo danh sách nhà cung cấp — vì vậy ¥3/¥6 của DeepSeek vẫn là ¥3/¥6 trên hóa đơn, và Grok 4.6 vẫn là $2/$6, không có phụ phí cho cả hai. Một quy tắc định tuyến có thể gửi các tác vụ có ngữ cảnh dài, nhạy cảm chi phí đến DeepSeek V4 Pro và các tác vụ agentic đã được xác minh đến Grok 4.6, chia lưu lượng theo từng yêu cầu cho đến khi đánh giá của chính bạn chốt tỷ lệ phân chia, và dựa vào cơ chế chuyển đổi dự phòng tự động nếu hành vi trong tuần đầu tiên của một trong hai nhà cung cấp mâu thuẫn với số liệu ra mắt. Đối với một cặp mô hình mới chỉ một ngày tuổi ở hai đầu đối lập của một cuộc chiến giá, khả năng so sánh cả hai trên chính tải công việc của bạn — và đổi tỷ lệ phân chia mà không cần sửa mã — không phải là một sự tiện lợi. Đó là cách duy nhất có thể bảo vệ được để áp dụng một trong hai.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube