Thẻ tiêu đề hero ghi "GPT-6 so với DeepSeek V4 Pro", với một chip ghi "GPT-6 trong ChatGPT cho mọi người 2026-10-07", hai dòng giá ghi "GPT-6 Sol $2 / $10" và "DeepSeek V4 Pro $0.66 / $1.98 cao điểm", một chip ghi "DeepSeek: trọng số MIT, đầu ra tối đa 384K", và chân trang ghi "Các mục do nhà cung cấp báo cáo được ghi nhãn trong văn bản; số liệu chỉ mục theo Artificial Analysis." Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

GPT-6 vs DeepSeek V4 Pro: Một cái bạn có thể thuê từ bất kỳ ai, một cái bạn có thể mang về nhà

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có đúng một điều bạn có thể làm với DeepSeek V4 Pro mà bạn không thể làm với GPT-6 Sol: mang nó về nhà. DeepSeek V4 Pro là mô hình chủ lực mixture-of-experts được cấp phép MIT — tổng cộng 1,6 nghìn tỷ tham số, 49 tỷ tham số hoạt động mỗi token — phát hành ngày 13 tháng 8 năm 2026, và checkpoint có thể tải về. GPT-6 Sol có trọng số đóng, được Ope​nAI phát hành ngày 22 tháng 9 năm 2026, và tính đến ngày 7 tháng 10 năm 2026, nó cũng là mô hình nằm dưới các gói trả phí trong đợt triển khai toàn cầu của ChatGPT tới hơn 1,2 tỷ người dùng hàng tuần.

Mọi thứ còn lại trong so sánh này là chuyện bạn đọc thước đo nào. Trên bảng giá, hai bên cách nhau bốn lần. Về chi phí thực tế để tạo ra một câu trả lời hoàn chỉnh trên bộ kiểm thử độc lập, chúng cách nhau 1,55×. Trên Intelligence Index, các hàng trông cách nhau mười sáu điểm và, theo phương pháp luận đã được chính đơn vị đánh giá ghi lại, hoàn toàn không thể trừ ra được. Việc xác định con số nào trong ba con số đó nên định hướng một quyết định là toàn bộ công việc, và câu trả lời khác nhau tùy vào việc bạn đang chọn nhà cung cấp hay chọn một tệp.

Mỗi mô hình là gì, mỗi mô hình một đoạn văn.

GPT-6 Sol là tầng giữa trong dòng GPT-6 của OpenAI — dưới mẫu flagship GPT-6 Astra, trên mẫu GPT-6 Luna tiết kiệm — với cửa sổ ngữ cảnh 1.050.000 token, giới hạn đầu ra 128.000 token, hỗ trợ đầu vào dạng văn bản, hình ảnh và tệp, gọi công cụ gốc, đầu ra có cấu trúc, và mức độ nỗ lực suy luận có thể chọn qua năm cấp từ thấp đến tối đa. Đây là tầng mà OpenAI định tuyến cho ChatGPT Plus, Pro, Business và Enterprise, với mức giá 2,00 USD mỗi triệu token đầu vào và 10,00 USD mỗi triệu token đầu ra, cùng một tầng ngữ cảnh dài sẽ tính lại giá cho toàn bộ yêu cầu ở mức 4,00 USD và 15,00 USD khi prompt vượt quá 272.000 token đầu vào.

DeepSeek V4 Pro là một flagship chỉ hỗ trợ văn bản với cửa sổ 1.048.576 token và đầu ra tối đa 384.000 token — gấp ba mức trần của GPT-6 Sol — và không có khả năng thị giác ở bất kỳ mức giá nào. Tài liệu API của chính DeepSeek liệt kê nó ở mức 0,66 USD cho mỗi triệu token đầu vào và 1,98 USD cho mỗi triệu token đầu ra trong giờ cao điểm, giảm một nửa xuống 0,33 USD và 0,99 USD vào giờ thấp điểm, với các lượt cache hit ở mức 0,022 USD vào giờ thấp điểm. Giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC vào các ngày trong tuần; mọi thời điểm khác, bao gồm cuối tuần và các ngày lễ công cộng của Trung Quốc, đều là giờ thấp điểm.

Ba mét

Hãy bắt đầu với cái được trích dẫn nhiều nhất, vì đó là cái thường xuyên bị trích dẫn nhất mà không có ngữ cảnh. Artificial Analysis cho DeepSeek V4 Pro 36.0 và GPT-6 Sol 47.6 điểm trên Intelligence Index v4.3.2. Mười một điểm rưỡi là kiểu khoảng cách đủ để chấm dứt một so sánh.

Điều đó thì không nên, và chính bên đánh giá cũng nói như vậy. Artificial Analysis chỉ so sánh các mô hình trọng số mở với các mô hình trọng số mở khác trong cùng lớp kích thước, với ranh giới ở 150 tỷ tham số, và so sánh các mô hình độc quyền trong một dải giá theo tỷ lệ đầu vào-đầu ra pha trộn 3:1. Đó là hai nhóm so sánh ngang hàng khác nhau, tạo ra hai thang đo khác nhau. Một điểm 36 và một điểm 47,6 nằm ở các hàng liền kề trong cùng một bảng không phải là một cuộc so sánh trực tiếp, và cách trung thực là nói điều đó, thay vì lấy cái này trừ cái kia rồi gọi đó là năng lực.

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

Hai đồng hồ đo có thể so sánh được cho chúng ta biết điều gì đó hữu ích hơn:

• Giá hỗn hợp theo tỷ lệ 3:1 — GPT-6 Sol 4,00 USD cho mỗi 1M so với DeepSeek V4 Pro 0,99 USD vào giờ cao điểm, hoặc 0,50 USD ngoài giờ cao điểm; mức chênh lệch từ 4× đến 8× tùy thuộc vào thời điểm bạn chạy
• Chi phí cho mỗi tác vụ lập chỉ mục hoàn thành — GPT-6 Sol 1,04 USD so với DeepSeek V4 Pro 0,67 USD; mức chênh lệch 1,55×
• Token đầu ra được tạo trên toàn bộ bộ kiểm thử — GPT-6 Sol 76,8M so với DeepSeek V4 Pro 162,9M, tức là mô hình rẻ hơn viết nhiều gấp 2,1 lần để hoàn thành cùng một khối lượng công việc
• Đầu ra tối đa — DeepSeek V4 Pro 384.000 token so với GPT-6 Sol 128.000; trần gấp 3×
• Đầu vào đa phương thức — GPT-6 Sol nhận văn bản, hình ảnh và tệp so với DeepSeek V4 Pro chỉ nhận văn bản
• Trọng số — DeepSeek V4 Pro được cấp phép MIT và có thể tải xuống, còn GPT-6 Sol thì đóng

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

Dòng thứ tư và thứ năm giải thích cho dòng thứ hai. Một mức chênh lệch tiêu đề 4× thu hẹp còn 1,55× trên công việc thực tế là điều xảy ra khi mô hình rẻ hơn cũng đồng thời dài dòng hơn: DeepSeek V4 Pro phát ra lượng token đầu ra gấp 2,1× so với GPT-6 Sol trên cùng một bộ đánh giá. Tính dài dòng là một hệ số nhân chi phí không bao giờ xuất hiện trên trang giá, và đây là con số bị xem nhẹ nhất trong cuộc so tài này.

Nơi mô hình mở thực sự thắng thế

Hai chỗ, và cả hai đều mang tính cấu trúc chứ không phải ngoài lề.

Giới hạn đầu ra là điều đầu tiên. 384.000 token so với 128.000 là mức chênh lệch gấp ba, và nó quyết định toàn bộ nhiều hạng mục công việc: tạo một sản phẩm có cấu trúc lớn trong một lần gọi, viết một tài liệu dài mà không cần nối chuỗi, tạo ra một bản tái cấu trúc lớn chỉ trong một phản hồi. GPT-6 Sol không thể làm những việc đó ở bất kỳ mức giá nào, vì giới hạn đó không phải là một bậc tính phí — mà là mức tối đa của mô hình.

Sử dụng công cụ dạng tác nhân đứng thứ hai, xét trên một phép đo cụ thể. DeepSeek V4 Pro đạt 96,2% trên τ²-Bench, bài đánh giá sử dụng công cụ dạng tác nhân, và đó là con số mà DeepSeek chọn làm điểm nhấn trên thẻ mô hình của chính mình. Đây cũng là con số mà mục trong danh mục OrcaRouter của mô hình lặp lại, tức là phiên bản của tuyên bố mà độc giả của chính chúng ta sẽ gặp. Con số τ²-Bench tương đương của GPT-6 Sol không được công bố trên cùng bảng, nên hãy coi so sánh này là có tính định hướng: trên bài đánh giá duy nhất mà DeepSeek chọn để đưa lên hàng đầu, mô hình mở đang đứng đầu lĩnh vực, còn mô hình đóng chưa đưa ra con số nào trong cùng cột.

Còn về quyền sở hữu, vốn không phải là một chuẩn đánh giá. Một checkpoint MIT có thể tải xuống nghĩa là bạn có thể chạy mô hình trên phần cứng của riêng mình, giữ một yêu cầu không đi qua mạng của bất kỳ ai, tinh chỉnh nó, ghim một phiên bản và biết rằng nó vẫn sẽ còn đó sau ba năm. Không nhà cung cấp nào có thể khai tử nó, đổi giá nó, hay loại nó khỏi bảng giá. Đối với một nhóm người mua — các ngành chịu quản lý chặt, bất kỳ ai có ràng buộc về lưu trú dữ liệu, bất kỳ ai từng bị tổn thương vì một mô hình bị ngừng hỗ trợ — điều đó đáng giá hơn mười một điểm chỉ số.

Nơi GPT-6 Sol giành chiến thắng, và đó không chỉ là chỉ số

Terminal-Bench 4.0 là dòng kém tôn vinh nhất trên hồ sơ của DeepSeek V4 Pro: 14,1% so với 43,9% của GPT-6 Sol. Đó không phải là khác biệt do làm tròn và nó chỉ ra một đặc điểm thực sự — mô hình mở mạnh ở điều phối công cụ đa lượt và yếu ở công việc terminal dài hạn, thứ tạo nên các coding agent hiện đại. Nếu khối lượng công việc của bạn là một agent phải duy trì một phiên shell liên tục trong hai mươi phút, thì đánh giá đơn lẻ này dự đoán trải nghiệm của bạn tốt hơn cả chỉ số tổng hợp.

Tính đa phương thức là điểm thứ hai. DeepSeek V4 Pro chỉ nhận văn bản và xuất văn bản. GPT-6 Sol nhận hình ảnh và tệp, và đó không phải là một ô đánh dấu tính năng — công việc chuyên môn nặng về tài liệu đồng nghĩa với ảnh chụp màn hình, trang quét, sơ đồ và PDF, và một mô hình chỉ có văn bản hoàn toàn không thể bước vào hạng mục đó.

Điều thứ ba là sự việc xảy ra trong tuần này. GPT-6 đã ra mắt trong tab Chat của ChatGPT dành cho Plus, Pro, Business và Enterprise vào ngày 7 tháng 10, với Free và Go tiếp theo từ ngày 8 tháng 10, mang theo một khả năng mà OpenAI gọi là Intelligent UI — các câu trả lời kết hợp văn bản, đồ họa, biểu đồ, biểu mẫu và điều khiển có thể nhấn cho từng câu hỏi thay vì mặc định dùng văn xuôi. Đó là một bề mặt, không phải tính năng API, và nó không thay đổi một dòng nào trong mã tích hợp của bạn. Điều nó thay đổi là mặc định xung quanh: mô hình mà nhóm của bạn đã mở trong tab trình duyệt giờ đây là GPT-6, và công việc tạo nguyên mẫu có xu hướng nghiêng về mô hình mà nhóm có thể truy cập mà không cần khóa. Do nhà cung cấp báo cáo và chưa được tái lập, OpenAI cũng tuyên bố rằng GPT-6 ở Extra High bắt đầu trả lời nhanh như GPT-5.6 ở Medium, và rằng GPT-6 Instant bắt đầu trả lời sớm hơn 44% đối với các câu hỏi dựa trên tìm kiếm.

Chạy một cái, hoặc chạy cả hai

Lý do sự ghép cặp cụ thể này dễ phòng ngừa rủi ro hơn hầu hết là cả hai mô hình đều nằm trong cùng một danh mục. OrcaRouter định tuyến GPT-6 Sol và DeepSeek V4 Pro — cùng với hơn 200 mô hình khác — thông qua một endpoint tương thích với Ope​AI trên một khóa, với mức phụ trội 0% so với giá niêm yết của nhà cung cấp. Chính việc chuyển tiếp nguyên giá đó là điều khiến cấu trúc cao điểm/thấp điểm trở nên rõ ràng thay vì bí ẩn: mức giảm một nửa vào giờ thấp điểm của Dee​Seek là của nhà cung cấp, chúng tôi không can thiệp vào, và khi nhà cung cấp định giá lại, thay đổi sẽ được cập nhật ở đây ngay trong ngày.

Đây cũng là nơi quyết định về khung giờ cao điểm trở thành quyết định định tuyến. Mức giá ngoài giờ cao điểm của DeepSeek V4 Pro chỉ bằng một nửa mức giá giờ cao điểm, và các khung giờ cao điểm là những giờ UTC cố định. Một tác vụ theo lô có thể dịch chuyển thì đáng để lên lịch quanh chúng, và một luồng nhạy cảm với độ trễ thì đáng để giữ tránh xa chúng. Khi cả hai mô hình nằm sau một khóa duy nhất, sự phân tách chỉ là một cấu hình thay vì một hợp đồng nhà cung cấp thứ hai: định tuyến khối lượng lớn và công việc có đầu ra dài đến DeepSeek V4 Pro vào giờ thấp điểm, định tuyến lưu lượng đa phương thức và thiên về suy luận đến GPT-6 Sol, và để cơ chế chuyển đổi dự phòng tự động xử lý giới hạn tốc độ ở một trong hai phía thay vì phát hiện ra nó trong môi trường vận hành thực tế.

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Điều tôi thực sự sẽ làm

Nếu bạn cần hình ảnh, tệp tin hoặc điểm suy luận tiên phong và bạn đang mua API, thì GPT-6 Sol là câu trả lời, và mười một điểm chỉ số phần lớn không mấy quan trọng — cổng đa phương thức định đoạt trước khi các benchmark có tiếng nói. Nếu bạn cần đầu ra 384.000 token, một giấy phép mà bạn có thể giữ, triển khai tại chỗ, hoặc chi phí thấp nhất trên bảng cho mỗi tác vụ hoàn thành, DeepSeek V4 Pro thắng và khoảng cách chỉ số là nhóm đồng đẳng của người khác.

Điều tôi sẽ không làm là đọc 36 so với 47,6 như một khoảng cách về năng lực rồi mua dựa trên đó. Các thước đo tương đương — 0,67 đô la so với 1,04 đô la mỗi tác vụ, và khác biệt độ rườm rà 2,1× ẩn bên trong mức chênh lệch 4× trên tiêu đề — kể một câu chuyện sát thực tế hơn nhiều so với các hàng chỉ số, và chúng mới là những con số xuất hiện trên hóa đơn.

Điều đáng theo dõi tiếp theo là liệu Dee​pSeek có thu hẹp khoảng cách Terminal-Bench trong một bản làm mới V4 Pro hay không, vì đó là phép đo duy nhất mà mô hình mở thực sự có vẻ bị bỏ lại phía sau chứ không phải chỉ được chấm điểm theo cách khác. Về phần mình, GPT-6 vừa không còn là một lựa chọn nữa mà đã trở thành mặc định, và rất khó để phản bác các mặc định ngay cả khi bài benchmark nói điều ngược lại.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày