
OpenAI o3 đấu DeepSeek V4 Pro: Kỷ nguyên suy luận cao cấp kết thúc nơi khoảng cách giá mở ra
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
Cuộc đối đầu giữa OpenAI o3 và DeepSeek V4 Pro thực sự là sự va chạm của hai con số. OpenAI o3, phát hành ngày 16 tháng 4 năm 2025, là điểm tham chiếu cho suy luận cao cấp — mô hình bạn phải trả giá đắt khi chi phí cho một câu trả lời sai còn cao hơn chi phí token. DeepSeek V4 Pro, chính thức phát hành (GA) dưới dạng build 0813 vào ngày 13 tháng 8 năm 2026 sau một buổi tối phát hành lặng lẽ và quy trình triển khai bao gồm việc rút lại thông báo và tải lại trọng số, là mô hình khiến mức giá cao cấp đó trông như một sai lầm phân loại: một chỉ số độc lập vượt trên chỉ số của o3, với giá chỉ khoảng một phần năm, cùng trọng số mở. Và cuộc va chạm này có dấu ấn thời gian, bởi vì OpenAI o3 sẽ rời khỏi ChatGPT vào ngày 26 tháng 8 năm 2026, các bản chụp API của nó sẽ theo sau vào ngày 11 tháng 12, và mỗi tuần so sánh đều nghiêng về mô hình sẽ không đi đâu cả.
Hai mẫu sản phẩm được phát hành cách nhau một năm về mặt triết lý.
o3 là mẫu flagship thuần suy luận: một mô hình đóng được huấn luyện để suy nghĩ trong thời gian dài trước khi đưa ra câu trả lời, với cửa sổ ngữ cảnh 200K, đầu ra tối đa 100K, và đầu vào hình ảnh được tích hợp vào chuỗi suy nghĩ của nó. Theo chính số liệu của OpenAI, nó đã đặt ra mức chuẩn cho năm 2025 — 96,7% trên AIME 2024, 87,7% trên GPQA Diamond, 69,1% trên SWE-bench Verified mà không cần scaffolding, Elo Codeforces 2727 — và sau đó OpenAI đã hạ giá từ $10/$40 xuống $2/$8 mỗi triệu token, mức giá vẫn được duy trì đến nay. DeepSeek V4 Pro lại là một bài toán kinh tế hoàn toàn khác: mô hình mixture-of-experts với 1,6 nghìn tỷ tham số, khoảng 49 tỷ tham số được kích hoạt cho mỗi token, cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 384K, đầu vào chỉ văn bản, và — mới có ở bản GA 0813 — một stack hậu huấn luyện được xây dựng lại cùng tích hợp native Responses-API và Codex, giúp điểm số agent của nó tăng vọt từ 12,8 ở bản preview lên 62,7 trên DeepSWE. Mô hình này cũng có trọng số mở: checkpoint DeepSeek-V4-Pro-0813 có thể tải xuống trên Hugging Face theo giấy phép MIT, sau 24 giờ đầu hỗn loạn khi banner phát hành bị gỡ xuống và trọng số tạm thời báo lỗi 404 trước khi được niêm yết lại với cấu hình đã sửa.
Khoảng cách chi phí bằng những con số thực tế
Các bảng giá tự bản thân chúng đã thuyết phục được phần lớn:
OpenAI o3 — $2,00 cho mỗi triệu token đầu vào, $8,00 cho mỗi triệu token đầu ra, $0,50 cho token đầu vào được lưu cache. Token suy luận được tính phí như token đầu ra, vì vậy một câu hỏi khó sẽ tiêu tốn token tư duy trước khi đưa ra câu trả lời.
DeepSeek V4 Pro — $0,435 cho mỗi triệu token đầu vào (trượt bộ nhớ đệm), $0,003625 khi trúng bộ nhớ đệm, $0,87 cho mỗi triệu token đầu ra hiện tại. Đầu ra rẻ hơn khoảng 4,6 lần so với o3, đầu vào trúng bộ nhớ đệm gần như miễn phí.
• Lời cảnh báo có kèm ngày tháng — đợt tăng giá dự kiến vào ngày 17 tháng 8 của DeepSeek sẽ đưa giá đầu ra của V4 Pro từ 6 yuan lên 27 yuan mỗi triệu token trong giờ cao điểm (13,5 ngoài giờ cao điểm) và đầu vào cache-miss từ 3 lên 9 yuan. Ngay cả ở mức giá giờ cao điểm mới, đầu ra chỉ bằng một phần nhỏ so với mức 8 đô la của o3. Cửa sổ thời gian để xây dựng dựa trên mức giá hiện tại chỉ tính bằng ngày, và bản thân điều đó cũng là một phần trong bài toán di chuyển.
Tính kinh tế trên mỗi câu trả lời đúng càng làm rõ vấn đề. Các token suy luận ẩn của o3 khiến chi phí thực tế cho mỗi câu trả lời khó cao gấp nhiều lần mức phí đầu ra của nó. DeepSeek V4 Pro cũng suy luận, và phần suy nghĩ của nó cũng được tính phí như đầu ra, nhưng với $0,87, chi phí tuyệt đối chỉ là một sai số làm tròn so với một phiên o3 suy nghĩ đến một phút rưỡi. Khung chi phí tác nhân mà DeepSeek sử dụng khi ra mắt — khoảng chênh lệch 45× về giá mỗi tác vụ so với biên giới đóng — là đánh giá quá cao khi so với o3 nói riêng, nhưng xu hướng thì không thể tranh cãi: đây là khoảng cách 4–10× về chi phí thực tế tùy theo khối lượng công việc.
Khoảng cách chất lượng thực sự nằm ở đâu
Điểm số quan trọng nhất là điểm số độc lập. Trên Chỉ số Trí tuệ của Artificial Analysis, DeepSeek V4 Pro đạt 53 và xếp hạng #2 trong số 104 mô hình mà chỉ số này hiện liệt kê; o3 đạt khoảng 30 — chênh lệch hơn 20 điểm trên cùng một hệ thống đánh giá. Đó là bản tóm tắt rõ ràng nhất về việc hai năm tiến bộ đã đưa chiếc flagship suy luận cao cấp đến đâu: nó không còn chỉ bị cạnh tranh về giá; nó còn bị đánh bại ở chỉ số tổng hợp độc lập.
Bức tranh theo từng benchmark phức tạp hơn và cần được gắn nhãn trung thực. Các con số agent nổi bật của DeepSeek V4 Pro — Terminal-Bench 2.1 đạt 87.9, CyberGym đạt 83.3, DeepSWE đạt 62.7, AutomationBench vượt qua nhóm frontier đóng — là những tuyên bố của chính DeepSeek từ lần ra mắt 0813, chưa được tái lập độc lập tính đến thời điểm viết bài này, và sự cố cấu hình sai trong đợt triển khai khiến không ai có thể chắc chắn rằng API đã phục vụ các bộ trọng số đã hiệu chỉnh cuối cùng khi các số liệu ban đầu từ bên thứ ba được thu thập. Các benchmark ra mắt của o3 cũng do nhà cung cấp tự báo cáo, nhưng chúng đã được xác nhận một phần nhờ kiểm tra lại độc lập hồi năm 2025, khi o3 thực sự dẫn đầu các bảng xếp hạng suy luận. Về toán học và suy luận thuần túy, thành tích công bố của o3 vẫn trông tốt hơn của DeepSeek V4 Pro — thế mạnh của DeepSeek nằm ở việc sử dụng công cụ agentic, lập trình và các tác vụ tầm xa, một bộ bài kiểm tra khác với các kỳ thi olympiad toán mà o3 từng thống trị.

Những gì o3 vẫn làm tốt hơn
Hai điều vẫn đứng vững sau cuộc so sánh. Thứ nhất, toán học và lập luận cẩn thận: AIME 96,7% và GPQA 87,7% của o3 vẫn cao hơn mọi con số mà DeepSeek V4 Pro từng công bố, và nếu công việc của bạn là một chứng minh khó hoặc một bài toán thi, o3 — khi nó vẫn còn hoạt động — là câu trả lời an toàn hơn. Thứ hai, suy luận hình ảnh: o3 có thể suy nghĩ về ảnh chụp màn hình hoặc sơ đồ trong chuỗi suy luận của nó, còn DeepSeek V4 Pro chỉ hỗ trợ văn bản; bản dựng 0813 không thêm bộ mã hóa thị giác, và nếu tác vụ của bạn cần mô hình đọc hình ảnh, DeepSeek V4 Pro không thể thay thế o3 ở khía cạnh đó. Cả hai lợi thế đều không phải là lý do để ở lại với một mô hình đang ngừng hoạt động, nhưng cả hai đều là lý do để thành thật rằng việc chuyển đổi không phải là một nâng cấp thuần túy.
Điều đáng nói nữa là sự khác biệt về trọng số mở, vốn hoàn toàn không phải là một benchmark. o3 là mô hình đóng và giờ đang bị khai tử dần; bạn không thể giữ nó chạy trên phần cứng của riêng mình. Checkpoint 0813 của DeepSeek V4 Pro là của bạn, vĩnh viễn, dưới giấy phép MIT — cùng trọng số, cùng mô hình 1,6 nghìn tỷ tham số, tự lưu trữ nếu bạn có khoảng 1,5 terabyte phần cứng cho nó. Với những đội ngũ từng bị tổn thương vì phụ thuộc vào một mô hình đóng mà nhà cung cấp có thể cho ngừng hoạt động, đó chính là câu trả lời mang tính cấu trúc cho đúng vấn đề mà việc o3 bị khai tử đặt ra.
Đang di chuyển khối lượng công việc
{{1}}Đối với nhóm API chuyển từ o3,{{/1}} {{2}}DeepSeek V4 Pro là điểm đến rẻ nhất{{/2}} {{3}}và, đối với các tác vụ agent và lập trình—vốn là phần lớn mục đích sử dụng API thực tế—hiếm khi đây là một sự tụt cấp.{{/3}} {{4}}Các điểm hóc búa thực sự nằm ở vận hành, không phải chất lượng:{{/4}} {{5}}V4 Pro bị giới hạn ở mức 500 yêu cầu đồng thời trên API chính thức,{{/5}} {{6}}một trần bạn sẽ chạm phải với một đội agent,{{/6}} {{7}}và giá của nó sẽ thay đổi vào ngày 17 tháng 8.{{/7}} {{8}}Cả hai điều đó chính xác là những gì một lớp định tuyến dùng để giải quyết.{{/8}}
Trên OrcaRouter, DeepSeek V4 Pro được phục vụ ở mức giá niêm yết của nhà cung cấp, chuyển thẳng với 0% phụ phí — vì vậy mức $0.44/$0.87 hôm nay có hiệu lực tại đây cùng ngày với khi có hiệu lực tại DeepSeek, và khi lịch giờ cao điểm/ngoài giờ cao điểm ngày 17 tháng 8 được áp dụng, nó cũng phản ánh tại đây trong cùng ngày. Một khóa (key) cũng truy cập được phần còn lại của nhóm thay thế o3 này, và chuyển đổi dự phòng tự động là câu trả lời gọn gàng cho giới hạn 500 kết nối đồng thời: trỏ một đường dẫn sản xuất vào V4 Pro cùng với một mô hình thứ hai trên cùng một khóa và để bộ định tuyến hấp thụ trần giới hạn đó. Bản thân OpenAI o3 không nằm trên khóa đó — nó vẫn khả dụng qua API của chính OpenAI và một số nền tảng bên thứ ba cho đến thời điểm chốt bản chụp ngày 11 tháng 12.

Ai được toán học ưu ái
Với bất kỳ ai có khối lượng công việc o3 là viết mã, vòng lặp tác nhân, hay xử lý ngữ cảnh dài, sự so sánh không hề kề cận: DeepSeek V4 Pro vượt trội o3 trên chỉ số độc lập, chi phí chỉ bằng một phần nhỏ, và trọng số mở của nó có nghĩa là sự phụ thuộc cụ thể này không thể bị cho nghỉ hưu sau lưng bạn. Các nhóm có lý do thực sự để giữ o3 tồn tại lúc này là những nhóm chuyên biệt hẹp — suy luận toán học thuần túy khó nhằn, và bất cứ thứ gì được xây dựng trên khả năng tư duy hình ảnh của o3 — và ngay cả những nhóm đó cũng nên thử nghiệm các giải pháp thay thế bằng khối lượng công việc thực tế trước tháng 12, vì hạn chót không quan tâm đến trường hợp ngoại lệ của bạn. Kỷ nguyên suy luận cao cấp mà o3 định nghĩa đã kết thúc cùng thông báo nghỉ hưu của nó; DeepSeek V4 Pro chỉ tình cờ là nơi có chỗ ngồi rẻ nhất trong kỷ nguyên kế tiếp.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
