
Grok 4.7 vs DeepSeek V4 Pro: Một cái thì mới, cái kia đang bị tráo đổi ngay dưới mũi bạn
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ghi chú được công bố ngày 10 tháng 9 năm 2026 đã thay đổi điều mà so sánh này hướng tới. “Chúng tôi đang loại bỏ dần V4-Pro,” nó viết, và từ 04:00 UTC ngày 14 tháng 9 năm 2026, mọi yêu cầu tới chuỗi model deepseek-v4-pro đều được định tuyến tới DeepSeek-V4.1-Flash với mức giá của V4.1-Flash — tình trạng mà bài đăng nói sẽ tiếp tục “cho đến khi V4.1-Pro ra mắt”. Chuỗi model vẫn phản hồi. Model đứng sau nó không phải là model bạn đã benchmark. Điều đó khiến một so sánh đối đầu với Grok 4.7 — được nhà cung cấp phát hành ngày 21 tháng 9 năm 2026, một ngày trước khi bản này được viết — trở thành so sánh có ngày hết hạn ở một phía. Trên các con số hiện có, Grok 4.7 là model mạnh hơn và DeepSeek V4 Pro là model rẻ hơn. Ở câu hỏi thực sự quyết định một tích hợp, chỉ một trong hai vẫn là thứ mà nó tự nhận.
Mỗi mô hình là gì, trước khi xét đến điểm số
DeepSeek V4 Pro đã đạt mức sẵn sàng chung vào ngày 13 tháng 8 năm 2026 với tư cách là checkpoint DeepSeek-V4-Pro-0813, sau bản xem trước ngày 24 tháng 4. Đây là trọng số mở theo MIT — giấy phép cho phép sử dụng thương mại, sửa đổi và phân phối lại mà không có ngưỡng doanh thu hay ngoại lệ theo khu vực — với tổng cộng 1,7 nghìn tỷ tham số trên model card GA, cửa sổ ngữ cảnh 1 triệu token và đầu ra tối đa 384K, mức trần đầu ra lớn nhất trong cuộc so tài này. Nó chỉ xử lý văn bản: trang định giá của chính DeepSeek nêu rõ rằng không hỗ trợ thị giác trên v4-pro, đây là một hạn chế thực sự đối với bất kỳ ai đưa cho nó ảnh chụp màn hình hoặc PDF. Nó cung cấp một nút điều chỉnh nỗ lực suy luận ở mức thấp, cao và tối đa, và bị giới hạn ở 500 yêu cầu đồng thời mỗi tài khoản, với khả năng mở rộng theo yêu cầu.
Grok 4.7 có trọng số đóng và mới ra được một ngày. Nó có ngữ cảnh 500k token — bằng một nửa của DeepSeek — nhận đầu vào văn bản và hình ảnh, và vận hành núm điều chỉnh mức nỗ lực riêng. Giá niêm yết của nó là 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra dưới 200k token prompt, tăng gấp đôi lên 4,00 USD và 12,00 USD khi đạt hoặc vượt ngưỡng đó, với giá đọc từ bộ nhớ đệm là 0,50 USD và 1,00 USD. xAI cũng liệt kê một biến thể nhanh hơn với tốc độ đầu ra gấp đôi và giá gấp đôi. Không nhà cung cấp nào công bố con số đầu ra tối đa cho Grok 4.7 trong tài liệu được kiểm tra ở đây, nên hãy coi thông số đó là chưa biết thay vì bằng nhau.
Trên chỉ mục chia sẻ, khoảng cách bị lệch hẳn về một phía.
Cả hai mô hình đều được chấm điểm trên Artificial Analysis Intelligence Index v4.3.2, bản sửa đổi được công bố ngày 19 tháng 9 năm 2026. Cột của Grok 4.7 được đo ở mức nỗ lực xhigh; còn của DeepSeek là checkpoint 0813 ở mức nỗ lực tối đa. Khi đọc cùng nhau, khoảng cách tổng hợp đánh giá thấp mức độ khác biệt trong cách hai mô hình này được định hình.
• Tổng hợp — Grok 4.7: 46 trên Chỉ số Trí tuệ Artificial Analysis v4.3.2. DeepSeek V4 Pro 0813: 36 trên cùng bản sửa đổi.
• Tác nhân terminal — Grok 4.7: Terminal-Bench 4.0 26. DeepSeek V4 Pro: 14. Gần gấp đôi, trên bài đánh giá sát nhất với công việc phần mềm tự chủ.
• Tự động hóa — Grok 4.7: AutomationBench-AA 66%. DeepSeek V4 Pro: 57%. Cả hai đều đáng tin cậy; Grok dẫn trước chín điểm.
• Kiến thức và ảo giác — Grok 4.7: AA-Omniscience 32. DeepSeek V4 Pro: 1. Đây là điểm dị thường trên bảng, và nó không phải là sai số làm tròn — chỉ số này đánh giá cả những gì mô hình biết lẫn tần suất nó bịa ra câu trả lời khi thực sự không biết.
• Ngữ cảnh dài — Grok 4.7: AA-LCR v1.1 77%, cửa sổ 500k. DeepSeek V4 Pro: 80%, cửa sổ 1M. Đây là chiến thắng rõ ràng duy nhất của DeepSeek, và cũng chính là trục mà cửa sổ 1M của nó được xây dựng để hướng tới.
• Suy luận khó — Grok 4.7: HLE 43, CritPt 18. DeepSeek V4 Pro: HLE 41, CritPt 18. Hòa nhau trên bài kiểm tra vật lý và Grok nhỉnh hơn hai điểm ở HLE.
• Mức độ dài dòng — Grok 4.7: 240 triệu token đầu ra để chạy chỉ mục, bị đánh dấu là dài dòng bất thường. DeepSeek V4 Pro: 163 triệu. Cả hai đều dài dòng; Grok dài dòng hơn.

Câu chuyện về giá không phải là một con số, mà là một lịch trình.
Giá của DeepSeek là yếu tố quyết liệt nhất ở nó, và cũng là thứ kém ổn định nhất để báo giá. Giá niêm yết cho deepseek-v4-pro là $0,66 mỗi triệu token đầu vào khi cache miss và $1,98 mỗi triệu token đầu ra — trong giờ thấp điểm. Vào giờ cao điểm, các mức này tăng gấp đôi lên $1,32 và $3,96. Theo tài liệu của chính DeepSeek, giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC từ Thứ Hai đến Thứ Sáu, trừ các ngày lễ công cộng của Trung Quốc; mọi thời điểm khác, kể cả toàn bộ cuối tuần, đều là giờ thấp điểm với đúng một nửa giá. Đọc đầu vào từ cache mới là điểm đáng chú ý thật sự: $0,022 vào giờ thấp điểm và $0,044 vào giờ cao điểm, rẻ hơn ba mươi lần so với cache miss, khiến một khối lượng công việc DeepSeek được cache tốt trở nên rẻ hơn đáng kể so với mức mà bảng giá của nó ngụ ý.
So với điều đó, mức 2,00 đô la và 6,00 đô la của Grok 4.7 trông có vẻ đắt đỏ — đắt hơn khoảng 3 lần so với giá đầu vào ngoài giờ cao điểm của DeepSeek và 3 lần so với giá đầu ra ngoài giờ cao điểm của nó. Sự so sánh thu hẹp lại theo những cách đáng để biết. Giá của Grok 4.7 là cố định trong khung của nó chứ không phụ thuộc vào thời điểm, nên một đợt tăng vọt sản lượng lúc 09:00 UTC cũng tốn đúng bằng một lô chạy vào đêm Chủ nhật; còn DeepSeek thì không như vậy. Và trên 200k token gợi ý, Grok 4.7 tăng gấp đôi, lúc đó nó đắt gấp bốn đến sáu lần mức giá ngoài giờ cao điểm của DeepSeek chứ không phải ba lần. Cách nói rõ ràng nhất là thế này: DeepSeek V4 Pro là mô hình rẻ hơn trên mọi phương diện, và mức độ chênh lệch phụ thuộc vào thời điểm bạn chạy và mức độ bạn cache tốt đến đâu.
Ngày 14 tháng 9 đã thay đổi điều gì
Đây là phần khiến lập luận về giá trở nên khó dựa vào hơn. Từ ngày 14 tháng 9 năm 2026, DeepSeek định tuyến các yêu cầu deepseek-v4-pro đến DeepSeek-V4.1-Flash và tính phí chúng theo mức giá của Flash — vốn còn thấp hơn nữa. Nhật ký thay đổi và trang giá của DeepSeek kể một câu chuyện hơi khác so với bài đăng tin ngày 10 tháng 9: bảng giá vẫn liệt kê deepseek-v4-pro như một mục còn hiệu lực với mức giá riêng và không có nhãn ngừng sử dụng, còn mục nhật ký thay đổi nói rằng dịch vụ API cho V4 Pro vẫn tiếp tục sau ngày 14 tháng 9 với việc tính phí không thay đổi. Điều không còn tranh cãi là hướng đi. V4.1-Pro đã được xác nhận là đang trong quá trình phát triển và chưa có ngày công bố, và V4.1-Flash — ra mắt ngày 10 tháng 9 — là thứ mà chính thông báo của DeepSeek nói rằng vượt V4 Pro về "hiệu năng, chi phí, tốc độ và tổng thời gian chạy", một tuyên bố của nhà cung cấp chưa được tái lập độc lập trên phạm vi rộng như vậy.
Vậy nên câu hỏi thực tế không phải là “Grok 4.7 hay DeepSeek V4 Pro” mà là “Grok 4.7 hay bất kỳ mô hình DeepSeek nào mà chuỗi đó phân giải thành vào quý sau.” Nếu bạn đã chạy benchmark V4 Pro vào tháng 8 và định cỡ ngân sách ngữ cảnh của mình quanh cửa sổ 1M với trần đầu ra 384K, thì mô hình bạn gọi vào tháng 11 có thể không phải là mô hình bạn đã đo — và giới hạn ngữ cảnh cùng đầu ra của phiên bản kế nhiệm không phải là những giới hạn mà bạn đã thiết kế dựa trên. Grok 4.7 có hồ sơ rủi ro ngược lại: một mô hình chỉ mới ra mắt một ngày với các con số do nhà cung cấp công bố và phần lớn chưa được tái lập, nhưng danh tính của nó thì không bị đặt dấu hỏi.

Bộ định tuyến phù hợp ở đâu và không phù hợp ở đâu
OrcaRouter cung cấp DeepSeek V4 Pro, và trang mô hình liệt kê nó theo đúng mức giá của nhà cung cấp — 0,66 USD cho đầu vào và 1,98 USD cho đầu ra với cửa sổ ngữ cảnh 1M và đầu ra tối đa 384k — vì chúng tôi chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức chênh lệch 0%. Điều đó càng quan trọng hơn bình thường với một nhà cung cấp có mức giá thay đổi theo lịch cao điểm/thấp điểm và có thông báo ngày 10 tháng 9 kèm theo việc giảm giá: thay đổi giá của DeepSeek có hiệu lực ngay trên cùng một key trong cùng ngày, không có độ trễ định giá lại và không cần hợp đồng thứ hai. Khi nhà cung cấp định tuyến lại một chuỗi mô hình ở phía họ, thay đổi sẽ đến qua cùng một endpoint thay vì buộc bạn phải tích hợp lại, và tính năng chuyển đổi dự phòng tự động giúp một giới hạn tốc độ hay sự kiện thiếu năng lực phía nhà cung cấp không trở thành tình trạng gián đoạn dịch vụ — hữu ích khi một phía trong stack của bạn bị giới hạn ở 500 yêu cầu đồng thời. Grok 4.7 hiện chưa có trong danh mục OrcaRouter tính đến thời điểm này; muốn gọi nó thì phải đi qua API riêng của xAI và các nền tảng bên thứ ba có cung cấp nó.
Sự phân chia mà điều này gợi ý thì không hào nhoáng nhưng có thể biện minh được: hãy giữ DeepSeek V4 Pro cho những khối lượng công việc nơi định giá cache-hit và cửa sổ 1M đang phát huy tác dụng, và neo kỳ vọng của bạn vào V4.1-Flash thay vì vào checkpoint tháng Tám. Hãy dùng Grok 4.7 cho những nhiệm vụ mà mô hình phải biết những gì nó không biết — chỉ số AA-Omniscience là 1 là một tín hiệu mạnh mẽ về việc một mô hình sẵn sàng trả lời một cách tự tin và sai, và không có lợi thế về giá nào tồn tại được khi người tiêu dùng hạ nguồn tin vào một câu trả lời bịa đặt.
Cuộc gọi
Grok 4.7 là mô hình tốt hơn ở đây và khoảng cách không hề sát nút: dẫn trước 10 điểm tổng hợp, gấp đôi điểm Terminal-Bench, lợi thế về tự động hóa, và khoảng cách về tính trung thực kiến thức đủ rộng để tạo nên khác biệt về hạng mục. DeepSeek V4 Pro rẻ hơn khoảng 3 lần vào giờ thấp điểm và có cửa sổ ngữ cảnh gấp đôi, đó là lý do thực sự và chính đáng để giữ nó — nhưng bạn không mua mô hình mà bạn đã đánh giá, bạn đang mua một chuỗi mô hình mà DeepSeek đã thông báo sẽ chuyển hướng, với mức giá thay đổi theo từng giờ, trên một giấy phép và một tập trọng số khiến việc tự vận hành trở thành một lựa chọn thứ ba thực sự. Nếu khối lượng công việc thuộc dạng ngữ cảnh dài, lưu lượng lớn và có thể cache, thì bài toán kinh tế của DeepSeek rất khó bị đánh bại và bạn nên thiết kế cho phiên bản kế nhiệm thay vì checkpoint. Nếu đó là bất kỳ thứ gì mà việc sai thì tốn kém, hãy trả gấp 3 lần và chọn mô hình thừa nhận sự không chắc chắn.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
