Một thẻ hero được tạo cho GPT-6.1 Sol vs DeepSeek V4 Pro có tiêu đề 'Ba thước đo, ba câu trả lời khác nhau', với ba thẻ chỉ số ghi 'Giá hỗn hợp 4x', 'Chi phí mỗi tác vụ chỉ số 1.07x' và 'Intelligence Index 16 điểm', một dòng ghi 'Một cái là độc quyền và nhìn thấy hình ảnh. Một cái là trọng số mở theo giấy phép MIT và chỉ văn bản.', một chân trang ghi 'Giá theo OpenAI và DeepSeek; số liệu chỉ số và chi phí mỗi tác vụ theo Artificial Analysis, đơn vị so sánh các mô hình trọng số mở và độc quyền trong các nhóm tương đồng khác nhau.', và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

GPT-6.1 Sol so với DeepSeek V4 Pro: Ba thước đo, ba câu trả lời khác nhau

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hỏi xem GPT-6.1 Sol và DeepSeek V4 Pro cách nhau bao xa và câu trả lời trung thực là điều đó phụ thuộc vào việc bạn đọc thước đo nào, và ba thước đo này bất đồng với nhau nhiều hơn mức mà hầu hết các so sánh mô hình bất đồng về mọi thứ. Về giá trên mỗi triệu token, được trộn theo tỷ lệ đầu vào-đầu ra 3:1, chúng là $4.00 so với $0.99 — gấp bốn lần. Về chi phí thực tế để chạy cùng một bộ đánh giá, chúng là $0.72 so với $0.67 mỗi tác vụ — bảy phần trăm. Trên Chỉ số Thông minh Artificial Analysis, chúng là 51.8 so với 36 — mười sáu điểm, nghe có vẻ mang tính quyết định cho đến khi bạn nhìn vào việc mỗi con số được so sánh với đối tượng nào, bởi vì phương pháp luận của chính đơn vị đánh giá đó đặt hai mô hình vào những đẳng cấp khác nhau. GPT-6.1 Sol được phát hành ngày 29 tháng 9 năm 2026 với giá $2.00 đầu vào và $10.00 đầu ra cùng cửa sổ 1,050,000 token. DeepSeek V4 Pro là một mô hình chủ lực mixture-of-experts được cấp phép MIT, 1.6 nghìn tỷ tham số với 49 tỷ tham số hoạt động, được phát hành ngày 13 tháng 8 năm 2026 với giá $0.66 và $1.98 cùng cửa sổ 1,048,576 token. Một mô hình là mô hình văn bản mà bạn có thể tải xuống. Mô hình kia thì nhìn thấy hình ảnh. Việc xác định xem trong ba thước đo đó, bạn thực sự nên định hướng theo thước nào chính là toàn bộ công việc.

Hàng chỉ mục không phải là phép so sánh như vẻ ngoài của nó

Hãy bắt đầu với con số được trích dẫn nhiều nhất, bởi vì đó chính là con số thường bị trích dẫn sai nhất.

Artificial Analysis công bố phương pháp luận của mình song song với bảng xếp hạng, và có hai câu trong đó đáng lưu ý ở đây. Theo nội dung này, các mô hình trọng số mở chỉ được so sánh với các mô hình trọng số mở khác cùng lớp kích thước — tí hon, nhỏ, trung bình, lớn, với ranh giới ở 150 tỷ tham số. Các mô hình độc quyền thay vào đó được so sánh trong cùng một dải giá, theo tỷ lệ pha trộn 3:1 giữa đầu vào và đầu ra. Đó là hai nhóm so sánh khác nhau. DeepSeek V4 Pro 0813 là trọng số mở — chính FAQ của đơn vị đánh giá nói vậy và chỉ ra các trọng số đã công bố — và với tổng cộng 1,6 nghìn tỷ tham số, nó nằm trong lớp lớn của nhóm trọng số mở. GPT-6.1 Sol là độc quyền và được chấm điểm so với các mô hình trong cùng dải giá của nó.

51,8 và 36 nằm ở hai hàng liền kề trong cùng một bảng, vì vậy không phải là một cuộc đối đầu trực tiếp. Chúng là điểm số so với một nhóm đồng đẳng này và điểm số so với một nhóm đồng đẳng khác, và chính vì thế mà các con số chi phí trên mỗi tác vụ có thể so sánh được, còn các con số chỉ số thô thì không. Nếu bạn muốn biết liệu DeepSeek V4 Pro có tốt đối với một mô hình có thể tải xuống hay không, thì 36 là con số trả lời cho điều đó. Nếu bạn muốn biết nó thể hiện ra sao so với một mô hình tiên tiến được lưu trữ trên máy chủ, thì cột chỉ số sẽ không cho bạn biết điều đó, và đây là trường hợp mà cách hành xử trung thực là nói thẳng như vậy thay vì lấy 51,8 trừ đi 36 rồi gọi đó là một khoảng cách.

Những gì có thể so sánh một cách rõ ràng: các thẻ giá, giới hạn ngữ cảnh và đầu ra, danh sách các phương thức, và chi phí chạy cùng một bộ đánh giá — bởi vì con số cuối cùng đó là một bản hạch toán của cùng một khối lượng công việc, không phải là điểm số.

Những gì các đồng hồ đo thô cho thấy

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• Giá đầu vào — GPT-6.1 Sol $2.00 so với DeepSeek V4 Pro $0.66 mỗi triệu token

• Giá đầu ra — GPT-6.1 Sol $10.00 so với DeepSeek V4 Pro $1.98, giảm xuống $1.32 và $3.96 trong hai khung bốn giờ theo UTC vào các ngày trong tuần

• Đọc bộ nhớ đệm — GPT-6.1 Sol $0.10 so với DeepSeek V4 Pro $0.022 trên mỗi triệu token; cả hai đều có bộ nhớ đệm, và bên rẻ hơn lại rẻ hơn gấp 4,5 lần nữa

• Chi phí mỗi tác vụ chỉ mục — GPT-6.1 Sol $0.72 so với DeepSeek V4 Pro $0.67

• Token đầu ra được phát ra trên bộ chỉ mục — GPT-6.1 Sol 67M so với DeepSeek V4 Pro 160M

• Đầu ra tối đa — DeepSeek V4 Pro 384.000 token so với GPT-6.1 Sol 128.000 token

• Phương thức — GPT-6.1 Sol nhận văn bản, hình ảnh và tệp; DeepSeek V4 Pro chỉ nhận văn bản

Dòng thứ tư và thứ năm là cặp đáng chú ý. DeepSeek V4 Pro phát ra lượng token gấp 2,4 lần trên cùng một bộ kiểm thử mà vẫn hoàn thành với chi phí rẻ hơn 7% mỗi tác vụ, bởi đơn giá đầu ra của nó chỉ bằng một phần năm của GPT-6.1 Sol. Đó là dáng vẻ của một mô hình lấy giá làm động lực khi bạn đo lượng đầu ra thay vì đơn giá: việc dài dòng là có thật, và nó không xóa bỏ lợi thế. Cửa sổ thời gian chính là dấu hoa thị. Hai khung bốn giờ vào các ngày trong tuần — 40 trong số 168 giờ một tuần — đưa mức giá niêm yết tăng gấp đôi lên $1.32 và $3.96, và khoản phụ phí đó áp dụng cho chính những token mà nếu không thì sẽ rẻ nhất trên cả hai bảng giá.

Những gì mô hình rẻ hơn không làm

Ba điều, và mỗi điều là một giới hạn cứng chứ không phải là một sự đánh đổi.

Nó không nhìn thấy. DeepSeek V4 Pro là văn bản vào, văn bản ra. Không ảnh chụp màn hình, không PDF quét, không đọc biểu đồ, không sơ đồ trong ticket. Các quy trình làm việc dùng máy tính và nhiều tài liệu — đúng những khối lượng công việc mà GPT-6.1 Sol được định vị — đều không được xem xét ở bất kỳ mức giá nào. Nếu pipeline của bạn đã định tuyến hình ảnh đến một mô hình thị giác, đây không phải vấn đề; nếu chưa, đó là ràng buộc mang tính quyết định.

Nó không có một nhịp phát hành mà bạn có thể lên kế hoạch dựa vào. Cái tên "deepseek-v4-pro" đã trỏ tới bản dựng 0813 kể từ tháng Tám, và hành trình đến đó không hề êm ả: nhà cung cấp đã thông báo sẽ khai tử bản dựng này vào ngày 14 tháng 9, rồi rút lại thông báo hai ngày trước mốc đó, và vẫn tiếp tục phục vụ API với mức tính phí không đổi. Danh mục của chính chúng tôi vẫn liệt kê nó là mẫu chủ lực với cùng context, giới hạn đầu ra và mức trần đồng thời. Một nhà cung cấp có thể rút lại thông báo ngừng hỗ trợ trong hai ngày thì cũng có thể từ chối rút lại; bài học vận hành không phải là mô hình bất ổn, mà là cái tên chỉ là một con trỏ, và việc ghim hành vi vào một mã định danh bản dựng thay vì tên tuyến chính là bảo hiểm giá rẻ.

Nó không mang theo kiến thức xung quanh. GPT-6.1 Sol mới ra đời được tám ngày và đã có một cấu hình độc lập được công bố; DeepSeek V4 Pro có lịch sử đánh giá dài hơn và cộng đồng người thực hành lớn hơn nhiều, bao gồm một ngăn xếp phục vụ đã được công bố và các công trình đo thông lượng của bên thứ ba. Đối với một triển khai tự lưu trữ, khối tài liệu đó đáng giá hơn hàng chỉ mục, vì đó là thứ bạn tham khảo khi mô hình cư xử kỳ lạ trên phần cứng của bạn chứ không phải trên một benchmark.

Khi chiếc đồng hồ rẻ hơn bốn lần lại là chiếc đồng hồ sai

Nếu mô hình rẻ chỉ đơn giản là kém hơn ở mọi thứ, thì đây sẽ là một bài viết ngắn. Sự thật khó xử là hai mô hình chỉ cách nhau 7% mỗi tác vụ trên cùng một công việc, và cách nhau 2,4× về lượng chúng viết ra để đạt được kết quả đó. Điều đó có nghĩa là thước đo token hỗn hợp — cái nói 4× — đang đo một khác biệt mà phần lớn bạn không phải trả, vì nó định giá một hỗn hợp token mà bạn có thể sẽ không bao giờ gửi. Và thước đo chỉ số, cái nói 16 điểm, đang đo xuyên hai nhóm ngang hàng và không thể trừ được.

Vậy nên sự phân chia thực tế không phải là "mô hình tiên phong cho việc khó, mô hình rẻ cho việc dễ." Đó là phân chia theo phương thức và phân chia theo khối lượng. Mọi thứ có hình ảnh đều đi đến GPT-6.1 Sol, và tương tự với bất cứ thứ gì mà câu trả lời ngắn còn phần suy luận là phần tốn kém — năm mức nỗ lực của nó, từ thấp đến tối đa với trung bình là mặc định, cho phép bạn mua phần suy luận mà không phải mua phần văn xuôi, và đầu vào được lưu đệm ở mức $0.10 của nó khiến một prompt lặp lại dài trở nên rẻ. Bất cứ thứ gì chỉ có văn bản, khối lượng lớn và chấp nhận được câu trả lời dài hơn — phân loại, trích xuất, tóm tắt, tạo hàng loạt với ngân sách đầu ra 384.000 token — đều đi đến DeepSeek V4 Pro, lý tưởng nhất là ngoài hai khung giờ UTC.

Cả hai đều nằm trên một phím, và phần tách là một dòng cấu hình

Cả hai mô hình đều có trên OrcaRouter theo mức giá công bố của chính nhà cung cấp, không cộng thêm gì: GPT-6.1 Sol ở mức $2.00 / $10.00, tăng lên $4.00 / $15.00 khi trên 272,000 token prompt, và DeepSeek V4 Pro ở mức $0.66 / $1.98 với hai khung thời gian được giữ nguyên như đã liệt kê. Một khóa, một hóa đơn, một endpoint tương thích OpenAI cho cả hai.

Đó là lý do vì sao việc phân tách ở trên đáng được viết ra thay vì tranh cãi về nó. Một phân tách theo phương thức có thể được biểu diễn dưới dạng quy tắc định tuyến, nên các yêu cầu mang hình ảnh sẽ đi tới mô hình thị giác và phần lớn văn bản sẽ đi tới mô hình rẻ mà không cần thay đổi ứng dụng; nếu một tuyến bị suy giảm, cơ chế chuyển đổi dự phòng sẽ chuyển cuộc gọi thay vì để nó thất bại. Và vì cả hai đều nằm trên cùng một endpoint, phép so sánh giá thực sự quan trọng — của bạn, trên lưu lượng của bạn, theo tỷ lệ token của bạn — có thể được tạo ra từ chính hóa đơn của bạn thay vì từ mức trung bình của một bộ benchmark.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

Phán quyết, trong một dòng, là cách đọc rẻ hơn gấp bốn lần là thứ đáng ngờ, còn cách đọc bảy phần trăm là thứ cần kiểm tra. Bốn lần là điều mà máy đo tổng hợp nói về một hỗn hợp token mà bạn có thể không gửi. Bảy phần trăm là mức cùng một đánh giá tốn trên cả hai, và nó đi kèm với chênh lệch độ dài dòng 2,4× vốn đã cố hữu. Mười sáu điểm là thật, chúng cũng nằm across hai nhóm ngang hàng, và ràng buộc thực sự quyết định hầu hết các triển khai của cặp này hoàn toàn không phải là một con số: một trong hai mô hình này có thể đọc ảnh chụp màn hình còn mô hình kia thì không.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày