Thẻ bài viết nổi bật có dòng chữ 'OpenAI o3 vs DeepSeek V4 Pro' với huy hiệu 'SO SÁNH MÔ HÌNH' và phụ đề 'Kỷ nguyên suy luận cao cấp kết thúc khi khoảng cách giá mở ra', hiển thị biểu tượng thẻ giá ở bên trái và biểu tượng đồng xu ở bên phải, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

OpenAI o3 đấu DeepSeek V4 Pro: Kỷ nguyên suy luận cao cấp kết thúc nơi khoảng cách giá mở ra

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cuộc đối đầu giữa Ope​nAI o3 và DeepSeek V4 Pro thực sự là sự va chạm của hai con số. Ope​nAI o3, phát hành ngày 16 tháng 4 năm 2025, là điểm tham chiếu cho suy luận cao cấp — mô hình bạn phải trả giá đắt khi chi phí cho một câu trả lời sai còn cao hơn chi phí token. DeepSeek V4 Pro, chính thức phát hành (GA) dưới dạng build 0813 vào ngày 13 tháng 8 năm 2026 sau một buổi tối phát hành lặng lẽ và quy trình triển khai bao gồm việc rút lại thông báo và tải lại trọng số, là mô hình khiến mức giá cao cấp đó trông như một sai lầm phân loại: một chỉ số độc lập vượt trên chỉ số của o3, với giá chỉ khoảng một phần năm, cùng trọng số mở. Và cuộc va chạm này có dấu ấn thời gian, bởi vì Ope​nAI o3 sẽ rời khỏi ChatGPT vào ngày 26 tháng 8 năm 2026, các bản chụp API của nó sẽ theo sau vào ngày 11 tháng 12, và mỗi tuần so sánh đều nghiêng về mô hình sẽ không đi đâu cả.

Hai mẫu sản phẩm được phát hành cách nhau một năm về mặt triết lý.

o3 là mẫu flagship thuần suy luận: một mô hình đóng được huấn luyện để suy nghĩ trong thời gian dài trước khi đưa ra câu trả lời, với cửa sổ ngữ cảnh 200K, đầu ra tối đa 100K, và đầu vào hình ảnh được tích hợp vào chuỗi suy nghĩ của nó. Theo chính số liệu của OpenAI, nó đã đặt ra mức chuẩn cho năm 2025 — 96,7% trên AIME 2024, 87,7% trên GPQA Diamond, 69,1% trên SWE-bench Verified mà không cần scaffolding, Elo Codeforces 2727 — và sau đó OpenAI đã hạ giá từ $10/$40 xuống $2/$8 mỗi triệu token, mức giá vẫn được duy trì đến nay. DeepSeek V4 Pro lại là một bài toán kinh tế hoàn toàn khác: mô hình mixture-of-experts với 1,6 nghìn tỷ tham số, khoảng 49 tỷ tham số được kích hoạt cho mỗi token, cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 384K, đầu vào chỉ văn bản, và — mới có ở bản GA 0813 — một stack hậu huấn luyện được xây dựng lại cùng tích hợp native Responses-API và Codex, giúp điểm số agent của nó tăng vọt từ 12,8 ở bản preview lên 62,7 trên DeepSWE. Mô hình này cũng có trọng số mở: checkpoint DeepSeek-V4-Pro-0813 có thể tải xuống trên Hugging Face theo giấy phép MIT, sau 24 giờ đầu hỗn loạn khi banner phát hành bị gỡ xuống và trọng số tạm thời báo lỗi 404 trước khi được niêm yết lại với cấu hình đã sửa.

Khoảng cách chi phí bằng những con số thực tế

Các bảng giá tự bản thân chúng đã thuyết phục được phần lớn:

OpenAI o3 — $2,00 cho mỗi triệu token đầu vào, $8,00 cho mỗi triệu token đầu ra, $0,50 cho token đầu vào được lưu cache. Token suy luận được tính phí như token đầu ra, vì vậy một câu hỏi khó sẽ tiêu tốn token tư duy trước khi đưa ra câu trả lời.

DeepSeek V4 Pro — $0,435 cho mỗi triệu token đầu vào (trượt bộ nhớ đệm), $0,003625 khi trúng bộ nhớ đệm, $0,87 cho mỗi triệu token đầu ra hiện tại. Đầu ra rẻ hơn khoảng 4,6 lần so với o3, đầu vào trúng bộ nhớ đệm gần như miễn phí.

• Lời cảnh báo có kèm ngày tháng — đợt tăng giá dự kiến vào ngày 17 tháng 8 của DeepSeek sẽ đưa giá đầu ra của V4 Pro từ 6 yuan lên 27 yuan mỗi triệu token trong giờ cao điểm (13,5 ngoài giờ cao điểm) và đầu vào cache-miss từ 3 lên 9 yuan. Ngay cả ở mức giá giờ cao điểm mới, đầu ra chỉ bằng một phần nhỏ so với mức 8 đô la của o3. Cửa sổ thời gian để xây dựng dựa trên mức giá hiện tại chỉ tính bằng ngày, và bản thân điều đó cũng là một phần trong bài toán di chuyển.

Tính kinh tế trên mỗi câu trả lời đúng càng làm rõ vấn đề. Các token suy luận ẩn của o3 khiến chi phí thực tế cho mỗi câu trả lời khó cao gấp nhiều lần mức phí đầu ra của nó. DeepSeek V4 Pro cũng suy luận, và phần suy nghĩ của nó cũng được tính phí như đầu ra, nhưng với $0,87, chi phí tuyệt đối chỉ là một sai số làm tròn so với một phiên o3 suy nghĩ đến một phút rưỡi. Khung chi phí tác nhân mà DeepSeek sử dụng khi ra mắt — khoảng chênh lệch 45× về giá mỗi tác vụ so với biên giới đóng — là đánh giá quá cao khi so với o3 nói riêng, nhưng xu hướng thì không thể tranh cãi: đây là khoảng cách 4–10× về chi phí thực tế tùy theo khối lượng công việc.

Khoảng cách chất lượng thực sự nằm ở đâu

Điểm số quan trọng nhất là điểm số độc lập. Trên Chỉ số Trí tuệ của Artificial Analysis, DeepSeek V4 Pro đạt 53 và xếp hạng #2 trong số 104 mô hình mà chỉ số này hiện liệt kê; o3 đạt khoảng 30 — chênh lệch hơn 20 điểm trên cùng một hệ thống đánh giá. Đó là bản tóm tắt rõ ràng nhất về việc hai năm tiến bộ đã đưa chiếc flagship suy luận cao cấp đến đâu: nó không còn chỉ bị cạnh tranh về giá; nó còn bị đánh bại ở chỉ số tổng hợp độc lập.

Bức tranh theo từng benchmark phức tạp hơn và cần được gắn nhãn trung thực. Các con số agent nổi bật của DeepSeek V4 Pro — Terminal-Bench 2.1 đạt 87.9, CyberGym đạt 83.3, DeepSWE đạt 62.7, AutomationBench vượt qua nhóm frontier đóng — là những tuyên bố của chính DeepSeek từ lần ra mắt 0813, chưa được tái lập độc lập tính đến thời điểm viết bài này, và sự cố cấu hình sai trong đợt triển khai khiến không ai có thể chắc chắn rằng API đã phục vụ các bộ trọng số đã hiệu chỉnh cuối cùng khi các số liệu ban đầu từ bên thứ ba được thu thập. Các benchmark ra mắt của o3 cũng do nhà cung cấp tự báo cáo, nhưng chúng đã được xác nhận một phần nhờ kiểm tra lại độc lập hồi năm 2025, khi o3 thực sự dẫn đầu các bảng xếp hạng suy luận. Về toán học và suy luận thuần túy, thành tích công bố của o3 vẫn trông tốt hơn của DeepSeek V4 Pro — thế mạnh của DeepSeek nằm ở việc sử dụng công cụ agentic, lập trình và các tác vụ tầm xa, một bộ bài kiểm tra khác với các kỳ thi olympiad toán mà o3 từng thống trị.

A two-column scoreboard for OpenAI o3 vs DeepSeek V4 Pro: left column o3 shows $2/$8 pricing, 200K context, closed weights, Artificial Analysis Index around 30, math-and-reasoning strength, retiring August 26 2026; right column DeepSeek V4 Pro shows $0.44/$0.87 pricing today, 1M context, MIT open weights, Artificial Analysis Index 53 (#2 of 104), agentic-and-coding strength, GA August 13 2026. Footer: o3 figures partly independent; DeepSeek agent benchmarks vendor-reported. OrcaRouter logo bottom-right.

Những gì o3 vẫn làm tốt hơn

Hai điều vẫn đứng vững sau cuộc so sánh. Thứ nhất, toán học và lập luận cẩn thận: AIME 96,7% và GPQA 87,7% của o3 vẫn cao hơn mọi con số mà DeepSeek V4 Pro từng công bố, và nếu công việc của bạn là một chứng minh khó hoặc một bài toán thi, o3 — khi nó vẫn còn hoạt động — là câu trả lời an toàn hơn. Thứ hai, suy luận hình ảnh: o3 có thể suy nghĩ về ảnh chụp màn hình hoặc sơ đồ trong chuỗi suy luận của nó, còn DeepSeek V4 Pro chỉ hỗ trợ văn bản; bản dựng 0813 không thêm bộ mã hóa thị giác, và nếu tác vụ của bạn cần mô hình đọc hình ảnh, DeepSeek V4 Pro không thể thay thế o3 ở khía cạnh đó. Cả hai lợi thế đều không phải là lý do để ở lại với một mô hình đang ngừng hoạt động, nhưng cả hai đều là lý do để thành thật rằng việc chuyển đổi không phải là một nâng cấp thuần túy.

Điều đáng nói nữa là sự khác biệt về trọng số mở, vốn hoàn toàn không phải là một benchmark. o3 là mô hình đóng và giờ đang bị khai tử dần; bạn không thể giữ nó chạy trên phần cứng của riêng mình. Checkpoint 0813 của DeepSeek V4 Pro là của bạn, vĩnh viễn, dưới giấy phép MIT — cùng trọng số, cùng mô hình 1,6 nghìn tỷ tham số, tự lưu trữ nếu bạn có khoảng 1,5 terabyte phần cứng cho nó. Với những đội ngũ từng bị tổn thương vì phụ thuộc vào một mô hình đóng mà nhà cung cấp có thể cho ngừng hoạt động, đó chính là câu trả lời mang tính cấu trúc cho đúng vấn đề mà việc o3 bị khai tử đặt ra.

Đang di chuyển khối lượng công việc

{{1}}Đối với nhóm API chuyển từ o3,{{/1}} {{2}}DeepSeek V4 Pro là điểm đến rẻ nhất{{/2}} {{3}}và, đối với các tác vụ agent và lập trình—vốn là phần lớn mục đích sử dụng API thực tế—hiếm khi đây là một sự tụt cấp.{{/3}} {{4}}Các điểm hóc búa thực sự nằm ở vận hành, không phải chất lượng:{{/4}} {{5}}V4 Pro bị giới hạn ở mức 500 yêu cầu đồng thời trên API chính thức,{{/5}} {{6}}một trần bạn sẽ chạm phải với một đội agent,{{/6}} {{7}}và giá của nó sẽ thay đổi vào ngày 17 tháng 8.{{/7}} {{8}}Cả hai điều đó chính xác là những gì một lớp định tuyến dùng để giải quyết.{{/8}}

Trên OrcaRouter, DeepSeek V4 Pro được phục vụ ở mức giá niêm yết của nhà cung cấp, chuyển thẳng với 0% phụ phí — vì vậy mức $0.44/$0.87 hôm nay có hiệu lực tại đây cùng ngày với khi có hiệu lực tại DeepSeek, và khi lịch giờ cao điểm/ngoài giờ cao điểm ngày 17 tháng 8 được áp dụng, nó cũng phản ánh tại đây trong cùng ngày. Một khóa (key) cũng truy cập được phần còn lại của nhóm thay thế o3 này, và chuyển đổi dự phòng tự động là câu trả lời gọn gàng cho giới hạn 500 kết nối đồng thời: trỏ một đường dẫn sản xuất vào V4 Pro cùng với một mô hình thứ hai trên cùng một khóa và để bộ định tuyến hấp thụ trần giới hạn đó. Bản thân Ope​nAI o3 không nằm trên khóa đó — nó vẫn khả dụng qua API của chính Ope​nAI và một số nền tảng bên thứ ba cho đến thời điểm chốt bản chụp ngày 11 tháng 12.

Screenshot of the Artificial Analysis model page for o3 showing its rank of #107/182 on the Intelligence Index, a score of 31 (below the median of 35), a 200K-token context window, $2.00 per 1M input and $8.00 per 1M output pricing, and a 118 tokens-per-second speed reading.

Ai được toán học ưu ái

Với bất kỳ ai có khối lượng công việc o3 là viết mã, vòng lặp tác nhân, hay xử lý ngữ cảnh dài, sự so sánh không hề kề cận: DeepSeek V4 Pro vượt trội o3 trên chỉ số độc lập, chi phí chỉ bằng một phần nhỏ, và trọng số mở của nó có nghĩa là sự phụ thuộc cụ thể này không thể bị cho nghỉ hưu sau lưng bạn. Các nhóm có lý do thực sự để giữ o3 tồn tại lúc này là những nhóm chuyên biệt hẹp — suy luận toán học thuần túy khó nhằn, và bất cứ thứ gì được xây dựng trên khả năng tư duy hình ảnh của o3 — và ngay cả những nhóm đó cũng nên thử nghiệm các giải pháp thay thế bằng khối lượng công việc thực tế trước tháng 12, vì hạn chót không quan tâm đến trường hợp ngoại lệ của bạn. Kỷ nguyên suy luận cao cấp mà o3 định nghĩa đã kết thúc cùng thông báo nghỉ hưu của nó; DeepSeek V4 Pro chỉ tình cờ là nơi có chỗ ngồi rẻ nhất trong kỷ nguyên kế tiếp.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro showing a 1M-token context window, 384K max output, $0.44 per 1M input and $0.88 per 1M output tokens, and Tools/JSON/Reasoning capability chips.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube