Đã tạo thẻ tiêu đề hero cho Claude Sonnet 5.5 vs DeepSeek V4 Pro, với phụ đề 'Hai mươi điểm chỉ số và một lần đọc cache $0.022', hiển thị $2.00 và $10.00 mỗi triệu token so với $0.66 và $1.98, cùng logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Claude Sonnet 5.5 so với DeepSeek V4 Pro: 20 điểm chỉ số và một lượt đọc bộ nhớ đệm ở mức $0.022

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt hai bảng giá cạnh nhau và cuộc so sánh trông như đã ngã ngũ trước khi bắt đầu. Claude Sonnet 5.5, được cung cấp rộng rãi từ ngày 28 tháng 9 năm 2026, có giá $2.00 cho mỗi triệu token đầu vào và $10.00 cho mỗi triệu token đầu ra. DeepSeek V4 Pro, phát hành ngày 24 tháng 4 năm 2026, có giá $0.66 và $1.98. Đầu ra là dòng quan trọng trong công việc agent, và $10.00 so với $1.98 là khoảng cách năm trên một — một đô la so với hai mươi xu cho mỗi một trăm nghìn token. Rồi nhìn sang khía cạnh năng lực, nơi Artificial Analysis xếp Claude Sonnet 5.5 ở mức 56 trên Intelligence Index v4.3 và DeepSeek V4 Pro ở mức 36, một khoảng cách hai mươi điểm trên cùng một harness. Đó là toàn bộ sự căng thẳng: mô hình của DeepSeek nằm ở một phần năm giá đầu ra và khoảng hai phần ba năng lực được đo lường, và hai sự thật đó không thể dẫn đến một khuyến nghị duy nhất nếu không biết khối lượng công việc của bạn thực sự làm gì với một token.

Chính xác thì mỗi mô hình là gì

Cách đặt tên là nơi đầu tiên khiến so sánh này sai, nên hãy sửa ngay tại đây. DeepSeek V4 Pro như chúng tôi liệt kê là deepseek/deepseek-v4-pro, phát hành ngày 24 tháng 4 năm 2026, một mô hình ngữ cảnh 1.048.576 token với đầu ra tối đa 384.000 token và đầu vào chỉ văn bản. Artificial Analysis theo dõi một bản chụp nhanh mà họ dán nhãn DeepSeek V4 Pro 0813 — một bản dựng ngày 13 tháng 8 — và các số liệu được trích dẫn bên dưới đến từ hàng đó. Phía Sonnet là của Anthropic anthropic/claude-sonnet-5.5, đầu vào văn bản, hình ảnh và tệp, ngữ cảnh 1M, đầu ra tối đa 128K. Nếu bạn đang so sánh trang của nhà cung cấp với trang của đơn vị đánh giá và các con số không khớp, hãy kiểm tra hậu tố bản dựng trước khi kết luận rằng một trong hai là sai.

DeepSeek V4 Pro chỉ hỗ trợ đầu vào văn bản. Claude Sonnet 5.5 cũng nhận cả hình ảnh và tệp. Đó là khác biệt cấu trúc đầu tiên và không hề nhỏ: bất kỳ pipeline nào nạp ảnh chụp màn hình, PDF hay sơ đồ đều không thể chỉ đơn giản hoán đổi cái này cho cái kia, vì một trong hai không thể nhìn thấy.

Bảng giá, từng dòng một

• Đầu vào — 0,66 USD cho mỗi triệu token đối với DeepSeek V4 Pro, so với 2,00 USD đối với Claude Sonnet 5.5; DeepSeek rẻ hơn 67%

• Đầu ra — $1.98 mỗi triệu so với $10.00; DeepSeek rẻ hơn 80%, khoảng cách đơn lẻ lớn nhất trong so sánh này

• Đọc bộ nhớ đệm — 0,022 USD mỗi triệu so với 0,20 USD; DeepSeek rẻ hơn 89% ở hạng mục chiếm phần lớn trong các vòng lặp agent dài

• Ghi bộ nhớ đệm — $2.50 mỗi triệu cho cửa sổ năm phút trên Claude Sonnet 5.5; dòng trong danh mục của DeepSeek V4 Pro không có mục ghi bộ nhớ đệm riêng

• Ngữ cảnh — 1,048,576 token so với 1,000,000; DeepSeek dài hơn một chút, một khác biệt không có hậu quả thực tiễn

• Đầu ra tối đa — 384.000 token so với 128.000; DeepSeek thắng gấp ba lần ở mức trần vốn ràng buộc việc tạo hàng loạt

• Phương thức đầu vào — chỉ văn bản so với văn bản, hình ảnh và tệp

• Reasoning — cả hai đều sử dụng mức độ suy luận có thể cấu hình thay vì ngân sách suy nghĩ cố định, nên độ sâu là một tham số yêu cầu trên mỗi cái

Có một chi tiết về lịch trình ở phía DeepSeek mà việc so sánh bảng giá sẽ che mất. Dòng trong danh mục của chúng tôi có một cửa sổ định giá theo thời gian: từ 01:00 đến 04:00 UTC, và lần nữa từ 06:00 đến 10:00 UTC, mức giá niêm yết được nhân đôi. Vào những giờ đó, V4 Pro có giá $1.32 cho đầu vào và $3.96 cho đầu ra — vẫn rẻ hơn Claude Sonnet 5.5, lần lượt 34% và 60%, nhưng không còn ở mức chênh lệch mà những con số nổi bật gợi ý. Các khối lượng công việc theo lô có thể lên lịch thì đáng để lên lịch, còn những khối lượng công việc không thể thì nên được định giá theo mức giá cao điểm thay vì mức trung bình. Đây cũng là kiểu điều chỉ lộ ra nếu bạn đọc danh mục thay vì trang tiếp thị, và đó là lập luận cho việc đặt mọi mô hình ứng viên sau một endpoint duy nhất thay vì ba tài khoản nhà cung cấp.

Hai con số về năng lực, một trong số đó không độc lập

Về phía bên thứ ba, thứ hạng là rõ ràng không thể tranh cãi. Artificial Analysis cho Claude Sonnet 5.5 đạt 56 điểm và DeepSeek V4 Pro đạt 36 điểm trên Intelligence Index v4.3, cả hai đều ở cấu hình suy luận nỗ lực tối đa. Cùng đơn vị đánh giá này xếp Claude Opus 5 ở mức 51 và Gemini 3.1 Pro Preview ở mức 30, vì vậy con số 36 của V4 Pro đặt nó dưới mẫu flagship trước đó của Anthropic và trên phân khúc Pro của Google — một vị trí đáng nể đối với một mô hình có giá chỉ bằng một phần năm, và còn cách đỉnh khá xa.

Sự đảo ngược chi phí trên mỗi tác vụ cũng xuất hiện ở đây, và trong cuộc so tài này, nó diễn ra theo hướng ngược lại so với lần trước. DeepSeek V4 Pro tốn 0,67 đô la để đánh giá trên bộ chỉ số. Claude Sonnet 5.5 tốn 7,60 đô la. Đó không phải là lỗi đánh máy và cũng không phải là sai số làm tròn: mô hình Anthropic mới hơn phát ra 410 triệu token trên toàn bộ bộ kiểm thử, so với mức trung vị là 88 triệu, và độ dài dòng của mô hình DeepSeek không thể thu hẹp khoảng cách giá lớn đến vậy. Trên các tác vụ mở không bị ràng buộc, mô hình rẻ hơn thực sự rẻ hơn một bậc độ lớn trên thực tế, chứ không chỉ trên bảng giá.

Các con số do nhà cung cấp đưa ra cần được xử lý cẩn trọng hơn. DeepSeek công bố một con số τ²-Bench là 96,2 cho V4 Pro, một con số mạnh, nhưng đó là do nhà cung cấp báo cáo và τ²-Bench đã bị loại khỏi chỉ mục Artificial Analysis trong bản sửa đổi v4.3 — nên đây là con số không thể được đặt một cách độc lập trên cùng thang đo với bất cứ thứ gì Anthropic công bố. Bảng công bố của chính Anthropic cho Claude Sonnet 5.5 cũng có những lưu ý riêng, bao gồm chú thích rằng thiết lập nỗ lực Max đạt điểm thấp hơn Xhigh trên FrontierCode và ghi chú rằng hai trong số các benchmark được chạy trên một bản triển khai tiền phát hành có lỗi structured-outputs. Đặt bảng của hai nhà cung cấp cạnh nhau thì bạn có hai tài liệu tiếp thị, không phải một bảng xếp hạng. Những con số duy nhất trong bài viết này thuộc về cùng một trục là hai điểm chỉ mục và hai chi phí theo tác vụ, vì một đơn vị đánh giá đã tạo ra cả bốn con số.

Vì sao mức trần đầu ra lại quan trọng hơn giá cả

Con số trong phép so sánh này nhận được ít sự chú ý nhất lại chính là con số làm thay đổi kiến trúc: 384.000 token đầu ra so với 128.000.

Giới hạn đầu ra không phải là một tính năng để cho thoải mái. Nó quyết định liệu một tác vụ là một lần gọi hay cả một chuỗi. Sinh ra một tệp nguồn lớn, xuất ra một tài liệu hoàn chỉnh, tạo ra một báo cáo có cấu trúc dài, dịch một chương sách — bất cứ thứ gì mà sản phẩm tạo ra lớn hơn 128.000 token — đều không thể làm được trong một lần gọi duy nhất tới Claude Sonnet 5.5, mà phải được chia nhỏ thành một chuỗi với trạng thái được mang theo giữa các lần gọi. Chia nhỏ nghĩa là nhiều token đầu vào hơn bị gửi lại ở mỗi bước, nhiều lượt đọc bộ nhớ đệm hơn, nhiều mã điều phối hơn, và một loại lỗi mới, nơi các mối nối giữa các đoạn chính là chỗ lỗi trú ngụ. Một mô hình có giá gấp năm lần nhưng loại bỏ được cả một tầng điều phối có thể rẻ hơn về giờ công kỹ sư trước khi nó rẻ hơn về token, và theo chiều ngược lại, một tác vụ vừa vặn trong một lần gọi là tác vụ mà giới hạn đầu ra không bao giờ bước vào phép tính.

Vậy câu hỏi về mức trần đứng trước câu hỏi về giá. Nếu sản phẩm đầu ra dài nhất của bạn nằm dưới 128.000 token, hãy bỏ qua phần này và so sánh theo chi phí cho mỗi tác vụ hoàn thành. Nếu không, hãy tính chi phí cho pipeline mà bạn sẽ phải xây dựng, chứ không chỉ riêng token.

Chi phí chuyển đổi và vấn đề phương án dự phòng

Việc di trú theo cả hai hướng chủ yếu xoay quanh việc viết prompt hơn là code, với một ngoại lệ đáng để dự trù ngân sách.

Cả hai mô hình đều cấu hình suy luận thông qua một tham số effort, nhưng chúng là tham số của các nhà cung cấp khác nhau, với các mức và giá trị mặc định khác nhau. Một prompt được tinh chỉnh cho thiết lập Anthropic mức effort cao không chuyển sang thiết lập effort của DeepSeek như một hoán đổi tương đương; nó chuyển sang như một lần đo lường lại. Hãy dự kiến dành một ngày cho mỗi workload để thiết lập lại chất lượng trước khi bạn tin vào một dự phóng chi phí, ở cả hai phía của việc chuyển đổi.

Ngoại lệ là thị giác. Claude Sonnet 5.5 đọc được hình ảnh và tệp; DeepSeek V4 Pro chỉ đọc văn bản. Bất kỳ phần nào trong pipeline của bạn đưa cho mô hình một ảnh chụp màn hình, một trang quét hay một biểu đồ được kết xuất đều không có tương đương trên DeepSeek, nên việc di chuyển hoàn toàn chỉ khả thi với tập con dạng văn bản trong lưu lượng của bạn. Đó là một ranh giới cần vạch ra sớm, vì nó thường có nghĩa câu trả lời không phải là một mô hình duy nhất mà là một sự tách đôi.

Cả hai đều có thể định tuyến trên OrcaRouter ngay hôm nay — deepseek/deepseek-v4-pro và anthropic/claude-sonnet-5đều là những mục trong danh mục đang hoạt động, được định giá theo bảng giá niêm yết của nhà cung cấp với mức chênh lệch 0%, trên cùng một thông tin xác thực. Điều đó đặc biệt quan trọng trong chính kiểu so sánh này, nơi yếu tố quyết định không phải là mô hình nào tốt hơn trên lý thuyết, mà là mô hình nào nên nhận một yêu cầu cụ thể. Việc phân tách để gửi khối lượng công việc chỉ có văn bản đến mô hình rẻ và công việc thị giác đến mô hình đắt tiền là một quy tắc định tuyến, và nó dễ diễn đạt hơn nhiều khi cả hai điểm cuối đều dùng chung một khóa và cùng một chính sách chuyển đổi dự phòng. Bản thân Claude Sonnet 5.5 vẫn chưa phải là một tuyến trên nền tảng của chúng tôi, nên phiên bản hiện tại của sự phân tách đó ghép mô hình Anthropic với DeepSeek V4 Pro thay vì thay thế nó.

Quyết định, được phát biểu như một quy tắc

Gửi nó cho Claude Sonnet 5.5 khi tác vụ cần nhìn thấy — hình ảnh, PDF, ảnh chụp màn hình, đầu ra đã kết xuất — khi sản phẩm dài hơn một trang văn xuôi và bạn muốn một mô hình tiên tiến viết nó, hoặc khi khoảng cách 20 điểm trên chỉ số là sự khác biệt giữa một bản nháp mà con người phải viết lại và một bản mà họ có thể phát hành.

Hãy gửi nó đến DeepSeek V4 Pro khi khối lượng công việc là đầu vào văn bản, đầu ra văn bản, khối lượng lớn, và chấp nhận mức trần thấp hơn về chất lượng suy luận: phân loại, trích xuất, tóm tắt, viết lại hàng loạt, chuyển đổi mã với đặc tả rõ ràng, và bất cứ việc gì mà nếu không bạn sẽ phải trả mười đô la cho mỗi triệu token đầu ra chỉ để di chuyển từ ngữ. Mức chiết khấu 89% khi đọc bộ nhớ đệm khiến các vòng lặp tác nhân ngữ cảnh dài trên mô hình này rẻ về mặt cấu trúc theo cách mà không thứ nào khác trong bảng so sánh có được.

Kết luận thẳng thắn: đây không phải là một cuộc đua năng lực mà DeepSeek đang thua, mà là một quyết định phân bổ nguồn lực mà hầu hết các đội làm sai theo hướng mua năng lực họ không dùng. Nếu lưu lượng của bạn là văn bản và chuẩn chất lượng của bạn là “đủ tốt để xem xét” chứ không phải “đủ tốt để phát hành mà không cần đọc”, thì V4 Pro với 20% giá đầu ra và $0.022 cho mỗi lần đọc cache là mặc định đúng, còn hai mươi điểm chỉ số là một khoản thuế mà bạn đang tự nguyện trả.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày