Đã tạo thẻ tiêu đề hero cho Claude Sonnet 5.5 so với Claude Sonnet 5, với phụ đề 'Giá giống hệt nhau, hóa đơn khác nhau', hiển thị $2.00 và $10.00 mỗi triệu token ở cả hai bên cùng với một con số chi phí trên mỗi tác vụ phân kỳ bên dưới, và logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Claude Sonnet 5.5 vs Claude Sonnet 5: Giá giống hệt nhau, hóa đơn khác nhau

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình từ cùng một nhà cung cấp, cùng hạng, cùng tên, và — trên mọi dòng của bảng giá đã công bố — cùng một mức giá. Claude Sonnet 5 ra mắt ngày 30 tháng 6 năm 2026 với giá $2.00 cho mỗi triệu token đầu vào và $10.00 cho mỗi triệu token đầu ra. Claude Sonnet 5.5 đạt trạng thái sẵn sàng chung vào ngày 28 tháng 9 năm 2026 với mức $2.00 và $10.00, với đọc cache ở mức $0.20 và ghi cache năm phút ở mức $2.50 trên cả hai. Không có gì về giá thay đổi. Điều đã thay đổi là mọi thứ mà một bảng giá không đo lường, và kết quả là một trong hai mô hình này rẻ hơn đáng kể để vận hành so với mô hình kia dù chi phí trên mỗi token hoàn toàn giống nhau. Tiêu đề của chính Anthropic cho bản phát hành cũng ngụ ý điều đó mà không hẳn nói thẳng ra: chi phí thấp hơn tới 30% cho hầu hết công việc, trên một bảng giá không đổi. Cách duy nhất để cả hai câu đều đúng là mô hình mới hơn phải hoàn thành cùng một công việc với ít token hơn, đó là điều các benchmark cho thấy và các số liệu độc lập theo từng tác vụ xác nhận.

Claude Sonnet 5.5 có đắt hơn Claude Sonnet 5 không?

Không — và dù sao thì câu hỏi này vẫn đáng được xem xét một cách nghiêm túc, bởi vì rất nhiều cuộc chuyển đổi đã thất bại vì coi một bảng giá cố định là một hóa đơn cố định.

Tính theo từng token, hai mô hình giống hệt nhau: $2.00 cho đầu vào, $10.00 cho đầu ra, $0.20 để đọc một token đã lưu trong bộ nhớ đệm, $2.50 để ghi một token. Không có khung giá theo bậc và không có phụ phí cho ngữ cảnh dài. Dù mô hình mới hơn có là gì đi chăng nữa, nó cũng không phải là một đợt tăng giá được ngụy trang thành một thế hệ mới.

Tính trên mỗi tác vụ hoàn thành, bức tranh sẽ đảo chiều tùy thuộc vào việc bạn đang mô tả khối lượng công việc của ai. Artificial Analysis báo cáo chi phí $5.09 cho mỗi tác vụ đối với Claude Sonnet 5 và $7.60 cho mỗi tác vụ đối với Claude Sonnet 5.5 trên cùng bộ Intelligence Index v4.3 — mô hình mới hơn đắt hơn 49% để hoàn thành một tác vụ, với cùng một đơn giá. Báo cáo tương tự cũng ghi nhận Sonnet 5.5 phát ra 410 triệu token trên toàn bộ bộ đánh giá, so với 370 triệu của Sonnet 5, cả hai đều so với mức trung vị 88 triệu của nhóm được theo dõi. Trên các lời nhắc mở của bên đánh giá, mô hình mới hơn chỉ đơn giản là viết nhiều hơn, và với mức giá ngang nhau, nhiều token hơn đồng nghĩa với hóa đơn lớn hơn.

Tuyên bố rẻ hơn 30% của Anthropic là tuyên bố của nhà cung cấp về các khối lượng công việc do chính họ chọn. Con số $7.60 so với $5.09 của bên thứ ba là kết quả đo trên một tập hợp khác. Cả hai đều không sai; chính sự bất đồng mới là toàn bộ câu chuyện, và yếu tố quyết định là liệu các tác vụ của bạn có tự giới hạn đầu ra của chúng hay không.

Điều gì thực sự đã thay đổi giữa hai thế hệ

Bảng giá là cố định; mô hình thì không. Khi được trình bày dưới dạng một danh sách duy nhất, các mức chênh lệch rất lớn và phần lớn chỉ theo một chiều.

• Terminal-Bench 4.0 — 70,6% cho Claude Sonnet 5.5 so với 10,3% cho Claude Sonnet 5, bước nhảy vọt lớn nhất trong một thế hệ mà Anthropic từng công bố trên bài kiểm tra này

• CursorBench 4.0 — 55,5% so với 34,1%

• Chartography, không dùng công cụ — 61,6% so với 15,6%

• GDPval-AA v2.1 — 1844 so với 1449

• AA-Briefcase v1.1 — 1811 so với 1359

Humanity's Last Exam, với công cụ — 64,5% so với 54,9%

• OSWorld 2.1, hoàn thành một phần — 80,1% so với 57,0%

• Artificial Analysis Intelligence Index v4.3 — 56 so với 38, một khoảng cách mười tám điểm trên thang đo của bên thứ ba, được đo lường theo cùng cấu hình "Adaptive Reasoning, Max Effort"

Hình dạng của danh sách đó không phải là tiến bộ đồng đều. Chartography tăng từ 15,6% lên 61,6% và Terminal-Bench từ 10,3% lên 70,6% trông giống như những năng lực trước đây vắng mặt và nay đã hiện diện, chứ không phải những năng lực được cải thiện. Humanity's Last Exam tăng mười điểm và OSWorld hai mươi ba điểm với mức giá không đổi là kiểu mẫu của một thế hệ đã khép lại những khoảng trống cụ thể thay vì một thế hệ trở nên thông minh hơn một cách tổng quát. Khoảng cách chỉ số mười tám điểm là trung bình cộng của điều đó: thực tế, lớn, và tập trung vào sử dụng công cụ, thực thi mã và công việc thị giác.

Có một chú thích đáng lưu ý cho bất kỳ ai đọc kỹ bảng của nhà cung cấp. Anthropic nêu rằng trên FrontierCode, cấu hình nỗ lực tối đa Max đạt điểm thấp hơn so với Xhigh, và họ cũng lưu ý rằng các lần chạy GDPval-AA và AA-Briefcase được thực hiện trên một bản triển khai tiền phát hành mang lỗi đầu ra có cấu trúc. Những con số ở trên vẫn là tốt nhất hiện có, nhưng hãy coi chúng như một ảnh chụp từ một bản triển khai chứ không phải một thuộc tính cố định của mô hình.

Tại sao giá lại bằng nhau mà hóa đơn thì không?

Ba cơ chế, theo thứ tự giảm dần về mức độ tác động của chúng đến một hóa đơn thực tế.

Đầu tiên là kỷ luật về độ dài đầu ra. Sonnet 5.5 là một tác nhân có năng lực hơn, nghĩa là nó làm nhiều hơn trước khi trả lời, và trên một bộ kiểm thử không có ràng buộc về độ dài, nó viết nhiều hơn Sonnet 5 khoảng 11% trong khi vẫn tốn cùng chi phí trên mỗi token. Trên một khối lượng công việc giới hạn đầu ra — trích xuất vào một lược đồ cố định, phân loại, tóm tắt có giới hạn — 11% đó không bao giờ thành hiện thực và tuyên bố 30% trở nên đáng tin, bởi vì lợi ích nằm ở việc đi đến câu trả lời trong ít lượt hơn thay vì ít token hơn mỗi lượt.

Thứ hai là hành vi bộ nhớ đệm, và đó là lý do vì sao giá đọc bộ nhớ đệm không đổi không có nghĩa là chi phí bộ nhớ đệm không đổi. Đọc và ghi bộ nhớ đệm được định giá giống hệt nhau trên cả hai mô hình, vì vậy mọi thay đổi về lượng token được lưu trong bộ nhớ đệm đều đi thẳng vào hóa đơn. Một mô hình mất ít lượt hơn để hoàn thành một tác vụ agentic sẽ đọc tiền tố của nó ít lần hơn. Đó là một khoản tiết kiệm không hề có thay đổi giá nào đằng sau, và nó vô hình trong mọi bảng so sánh chỉ liệt kê các dòng bảng giá.

Điều thứ ba là điều mà hầu hết các nhóm làm sai trong ngày di chuyển: mặc định của effort. Claude Sonnet 5.5 cấu hình suy luận thông qua một tham số effort với các cài đặt low, medium, high, xhigh và max, mặc định là high trên Claude Platform và medium bên trong Claude apps. Nếu bạn đã di chuyển từ một triển khai Sonnet 5 nơi bạn đã cố định ngân sách suy luận, thì mặc định mới có thể có độ sâu khác so với mức bạn đang trả tiền. Hãy đo lường trước khi giả định đó là khoản tiết kiệm hay khoản tăng.

Cũng có một hệ quả về hành vi đáng được nêu ra trước khi triển khai thay vì sau đó. Anthropic tuyên bố rằng Claude Sonnet 5.5 là Sonnet đầu tiên ra mắt với các biện pháp bảo vệ an ninh mạng và cơ chế dự phòng ngang hàng với các mô hình hàng đầu của mình, vì vậy các yêu cầu an ninh mạng có rủi ro cao hơn sẽ rõ ràng được chuyển sang Sonnet trước đó. Nhật ký của bạn sẽ hiển thị một mô hình mà bạn không yêu cầu. Liên quan đến điều đó, nếu bạn chạy Sonnet khi đã tắt thinking, bạn phải chuyển sang hành vi giữa các công cụ — một thay đổi mã, không phải một cờ.

Trên OrcaRouter, anthropic/claude-sonnet-5 hiện có thể định tuyến ngay hôm nay chỉ với một thông tin xác thực, theo đúng giá niêm yết của nhà cung cấp với mức chênh lệch 0%, cùng với Claude Opus 5.5, Claude Opus 5, DeepSeek V4 Pro và Gemini 3.1 Pro Preview. Bản thân Claude Sonnet 5.5 vẫn chưa phải là một tuyến trên nền tảng của chúng tôi, nên hình thức thực tế của phép so sánh này ở thời điểm hiện tại là: một nhóm đã chạy Sonnet 5 có thể đo được mức chênh lệch ngay khi nó được niêm yết mà không cần chạm vào khóa API, và trong lúc chờ đợi có thể chuyển đổi dự phòng giữa các bậc bằng cách thay đổi một chuỗi.

Những câu hỏi mọi người thường hỏi trước khi chuyển đổi

Tôi có thể chạy cả hai cùng lúc và so sánh trên lưu lượng của riêng mình không?Hiện thì chưa thể, nếu chỉ qua một thông tin xác thực OrcaRouter duy nhất, vì Claude Sonnet 5.5 chưa phải là một tuyến được liệt kê. Cách khắc phục là chạy mô hình mới hơn trên API riêng của Anthropic và mô hình cũ hơn qua chúng tôi, rồi so sánh số token trên mỗi tác vụ đã hoàn thành thay vì chi phí trên mỗi token, bởi vì đó mới chính là chỉ số mà hai mô hình thực sự khác nhau.

Việc giá không thay đổi có nghĩa là Anthropic không thu phí cho khả năng mới hay không?Điều đó có nghĩa là giá niêm yết được giữ nguyên trong khi mô hình được cải thiện, đây cũng là mô thức giống như hai thế hệ Sonnet trước. Việc điều đó có kéo dài hay không là câu hỏi thương mại, không phải câu hỏi kỹ thuật, và cửa sổ ngừng hỗ trợ đã công bố — không sớm hơn tháng 9 năm 2027 — là cam kết duy nhất đi kèm.

Tôi nên tin con số nào, 30% của Anthropic hay 49% của bên thứ ba?Không cái nào, nếu xét như một tuyên bố chung. Con số của Anthropic mô tả các khối lượng công việc mà ở đó mô hình đi đến câu trả lời trong ít lượt hơn; con số của Artificial Analysis mô tả một bộ chỉ số không bị ràng buộc, nơi độ dài dòng có thể tự do tăng lên. Hãy chọn cái giống với tập lệnh của bạn, và nếu bạn không thể nói cái nào là đúng, thì chính sự mơ hồ đó là câu trả lời — hãy đo lường nó.

Điểm mấu chốt

Claude Sonnet 5.5 không phải là một đợt tăng giá, nhưng cũng không tự động là một khoản tiết kiệm. Anthropic giữ nguyên mọi dòng trong bảng giá và thay mô hình bên dưới nó, nghĩa là toàn bộ bài toán kinh tế đều dựa vào số token trên mỗi tác vụ hoàn thành — một con số tốt hơn 30% trên những khối lượng công việc mà nhà cung cấp tự chọn và tệ hơn 49% trên bộ kiểm thử mà một đơn vị đánh giá độc lập chọn. Nếu tác vụ của bạn tự giới hạn đầu ra, hãy chuyển sang và tận hưởng lợi thế. Nếu không, mức giá giữ nguyên không phải là lý do để bỏ qua việc đo lường, bởi vì bạn có thể phải trả nhiều hơn gấp rưỡi cho mỗi tác vụ đối với một mô hình rõ ràng làm việc tốt hơn.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Sonnet 5 across eight rows. Both columns carry the identical rate card: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output. The rows that differ are AA Intelligence Index v4.3 score 56 for Claude Sonnet 5.5 against 38 for Claude Sonnet 5, $7.60 per task on the index run against $5.09, and Terminal-Bench 4.0 (vendor) 70.6% against 10.3%. The card heading reads "Identical rate cards, different bills: Claude Sonnet 5.5 against Claude Sonnet 5", and a footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Every price line is a tie by design: the two models share one rate card and differ only in what they emit to finish the same task."Screenshot of the OrcaRouter model page for Anthropic Claude Sonnet 5 (anthropic/claude-sonnet-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.24-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-06-30" line, and the $2.00 input and $10.00 output prices per million tokens.Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.