Thẻ hero có tiêu đề Claude Sonnet 5.5 vs Qwen3.8 Max, phụ đề sáu tuần, hai hạng, một kết luận về chi phí, với các pill ghi đầu vào $2 cho cả hai, đầu ra $10 so với $6, và Chỉ số 56 so với 45, cùng chân trang trích dẫn Artificial Analysis v4.3.2 và giá của nhà cung cấp.
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max: Sáu Tuần, Hai Hạng, Một Phán Quyết Về Chi Phí

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Thử làm phép tính với ba lời nhắc và phép so sánh phần lớn đã ngã ngũ trước cả khi bạn chạm đến các bài đo chuẩn. Một lệnh gọi trả lời hỗ trợ ngắn: 2.000 token đầu vào, 500 token đầu ra. Với Qwen3.8 Max ở mức $2 mỗi triệu token đầu vào và $6 mỗi triệu token đầu ra, con số đó là bốn phần mười xu; với Claude Sonnet 5.5 ở mức $2 và $10, con số đó là chín phần mười xu. Một lần tái cấu trúc kho mã: 400.000 đầu vào, 30.000 đầu ra — bốn mươi ba xu so với tám mươi ba xu. Một phiên agentic dài thực sự tiêu hết ngân sách: hai triệu token đầu vào, 200.000 đầu ra, vậy $5,20 so với $6,30 khi các con số đủ lớn để phía đầu vào chiếm ưu thế.

Khoảng cách ban đầu là mức chênh lệch 2,25× về giá đầu ra thu hẹp xuống còn khoảng 1,2× ở quy mô agentic, và việc mở rộng quy mô đó không phải là một điều tầm thường. Qwen3.8 Max và Claude Sonnet 5.5 đều là các mô hình 1M token với trần đầu ra lớn, đều có giá 2 USD mỗi triệu token đầu vào, và đều được phát hành chỉ cách nhau trong vòng tám tuần — của nhà cung cấp vào ngày 3 tháng 8 năm 2026 với bản làm mới ghi ngày 2 tháng 9, của Anthro​pic vào ngày 28 tháng 9. Khác biệt giữa chúng không nằm ở bảng giá. Mà là ở việc mỗi mô hình chi ra bao nhiêu để hoàn thành.

Những gì đã được phát hành, và khi nào

Qwen3.8 Max là tầng năng lực cao nhất của Alibaba cho đến nay. Alibaba định vị nó trực tiếp đối đầu với GPT-5.5, Claude Opus 4.7 và Gemini 3.1 Pro trong hướng dẫn chuyển đổi của chính mình, và khuyến nghị nó mỗi khi cần khả năng suy luận mạnh nhất hiện có. Nó có cửa sổ ngữ cảnh 1 triệu token, nhận đầu vào văn bản, hình ảnh và video, đồng thời xuất ra văn bản — khả năng nhập video là điểm mà Claude Sonnet 5.5 không có. Giá là 2 USD mỗi triệu token đầu vào và 6 USD mỗi triệu token đầu ra, với đọc bộ nhớ đệm ở mức 0,25 USD và ghi bộ nhớ đệm ở mức 2,50 USD. Mục ngày 3 tháng 8 trong danh mục của chúng tôi có thêm bản làm mới ngày 2 tháng 9 được liệt kê là Qwen3.8 Max (0902), với mức giá niêm yết tương tự và giới hạn đầu ra 131K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 là mô hình thứ hai trong thế hệ 5.5 của Anthropic, ra mắt ngày 28 tháng 9 năm 2026, sáu ngày sau Claude Opus 5.5. Nó được phát hành dưới dạng claude-sonnet-5-5 trên Claude API và trên Amazon Bedrock, Google Cloud và Microsoft Foundry, với cửa sổ 1M token, giới hạn đầu ra đồng bộ 128K mở rộng lên 300K trên Message Batches API đằng sau header output-300k-2026-03-24, và mức giá của Claude Sonnet 5 được giữ nguyên chính xác: 2 đô vào, 10 đô ra, 0,20 đô đọc cache, 2,50 đô ghi cache. Không lưu giữ dữ liệu kể từ khi ra mắt, thời điểm ngừng hỗ trợ không sớm hơn ngày 28 tháng 9 năm 2027.

Vậy nên mức giá đầu vào là như nhau, các cửa sổ ngữ cảnh có cùng kích thước, và hai nhà cung cấp đã cập nhật cách nhau trong vòng một tháng. Mọi thứ phân biệt họ đều nằm ở phần đầu ra trên hóa đơn hoặc trong các phép đo hiệu năng.

Điểm chuẩn: bảng của nhà cung cấp so với chỉ số độc lập

Ở đây có hai loại bằng chứng và chúng không thể thay thế cho nhau.

Bảng công bố khi ra mắt của Anthropic do nhà cung cấp tự báo cáo, chưa được bất kỳ bên thứ ba nào tái lập, và bao gồm tám đánh giá. Những hàng đáng quan tâm

• Terminal-Bench 4.0 — Claude Sonnet 5.5 đạt 70,6% so với 10,3% của Claude Sonnet 5

• CursorBench 4.0 — 55,5% so với 34,1% của Claude Sonnet 5

• GDPval-AA v2.1 — 1844 so với 1449 của Claude Sonnet 5, 1846 của Claude Opus 5.5 và 1487 của GPT-6 Sol

• Humanity's Last Exam, với công cụ — 64,5% so với 54,9%; Claude Opus 5.5 đạt 67,7%

• OSWorld 2.1, một phần — 80,1% so với 57,0%

• Chartography, không dùng công cụ — 61,6% so với 15,6%

Alibaba không công bố bảng bốn cột tương đương trực tiếp, nên những số liệu duy nhất có thể đặt trên cùng một trục là những số liệu độc lập. Artificial Analysis, bản sửa đổi v4.3.2

• Chỉ số Trí tuệ Tổng hợp — Claude Sonnet 5.5 56 ở vị trí thứ 3 trong số 216; Qwen3.8 Max 45 ở vị trí thứ 27

• Chi phí cho mỗi tác vụ Intelligence Index — 7,60 USD so với 5,41 USD

• Tốc độ đầu ra — mô hình của Anthropic được đo so với đường cơ sở Claude Sonnet 5 ở mức 78,7 token mỗi giây; Qwen3.8 Max được đo ở mức 39,1

• Độ dài dòng — 410M token đầu ra trên Index so với 190M

Điểm số theo từng đánh giá của riêng Qwen3.8 Max là mức đáng nể chứ không phải chỉ tàm tạm: 92.8% trên GPQA Diamond, 88.8% trên Terminal-Bench 2.1, 80.3% về khả năng ghi nhớ ngữ cảnh dài, 47.8% trên tau-banking. Nó mất lợi thế ở điểm tổng hợp vì không thắng dứt khoát ở hạng mục nào, trong khi dòng Anthropic mới hơn lại thắng hẳn một số hạng mục. Cũng lưu ý rằng trang độc lập về Qwen3.8 Max ghi ngày phát hành 2 tháng 9 năm 2026 và thông số ngữ cảnh 984K — trang đó mô tả bản làm mới (0902), chứ không phải bản dựng tháng 8, và việc trộn lẫn các con số giữa hai bản sẽ là một sai lầm.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

Điều còn thiếu ở cả hai cột cũng quan trọng như điều có trong đó. Chưa ai tự mình tái lập được các con số OSWorld hay Terminal-Bench của Anthropic. Chưa ai công bố một con số Chartography hay CursorBench cho Qwen3.8 Max. Điểm tổng hợp là con số duy nhất được đo theo cùng một cách trên cả hai mô hình, và đó chính xác là lý do vì sao con số chi phí trên mỗi tác vụ bên dưới nó lại có sức nặng đến vậy.

Con số quyết định điều đó, và nó không nằm trên bảng giá nào trong hai bảng giá.

Artificial Analysis tính phí cho cả hai mô hình theo cùng một cách: chạy mười bài đánh giá trong Index, đếm token, nhân với giá niêm yết. Claude Sonnet 5.5 cho ra mức $7.60 mỗi tác vụ và Qwen3.8 Max là $5.41, mức cao hơn 40% cho mô hình Anthropic bất chấp điểm tổng hợp cao hơn. Các chỉ số về độ dài đầu ra giải thích hướng — 410M token so với 190M — và các chỉ số về tốc độ giải thích phần còn lại: một mô hình phát ra ít token hơn và mất nhiều thời gian hơn cho mỗi token thì không phải là mô hình phải trả cho đầu ra với mức gấp đôi.

Tuyên bố về hiệu quả của chính Anthropic khớp với cùng câu chuyện đó thay vì mâu thuẫn với nó. Công ty nói rằng Claude Sonnet 5.5 tạo đầu ra nhanh hơn Claude Sonnet 5 hơn 30% và có chi phí "thấp hơn tới 30% cho mỗi tác vụ" ở cùng mức giá — một tuyên bố về số token trên mỗi tác vụ, không phải về đơn giá. Liệu điều đó có đứng vững trước một mô hình dùng ít hơn một nửa số token hay không chính là điều mà con số $7.60 đang hỏi, và một lần chạy độc lập chỉ là một điểm dữ liệu.

Hệ quả thực tế: mức giá đầu ra $6 so với $10 là con số mà bộ phận thu mua sẽ nhìn vào, và đó là con số ít có tính dự báo nhất trong bài viết. Con số có tính dự báo là số token cho mỗi tác vụ trên chính prompt của bạn, và không nhà cung cấp nào sẽ đưa nó cho bạn.

Đầu vào, video và cái bẫy migration

Khác biệt về năng lực lộ ra ngay lập tức là phương thức. Qwen3.8 Max chấp nhận video cùng với văn bản và hình ảnh; Claude Sonnet 5.5 chấp nhận văn bản và hình ảnh. Đối với phân tích bản ghi màn hình, các pipeline xử lý cảnh quay cuộc họp hay bất cứ thứ gì coi video là đầu vào hạng nhất, đó không phải là khoảng cách về điểm chuẩn — mà là một câu hỏi nhị phân về tính đủ điều kiện, và chỉ một trong hai mô hình này đạt.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

Khác biệt xuất hiện một tuần sau đó mang tính hành vi. Claude Sonnet 5.5 tạo ra năm thay đổi phá vỡ tương thích đối với mã chạy trên Claude Sonnet 5. Một giá trị không mặc định của temperature, top_p hoặc top_k giờ trả về 400. Gửi thinking: {"type": "disabled"} trả về 400 trỏ đến between_tools, thiết lập thinking thấp nhất mới, được chấp nhận ở mức low, medium và high và bị từ chối ở xhigh hoặc max. Việc buộc sử dụng công cụ — tool_choice là "any" hoặc một công cụ được đặt tên — trả về 400 ngay lập tức. Công cụ computer-use cũ hơn computer_20251124 bị từ chối trên Claude API và Google Cloud. Và các khối thinking bị ràng buộc với mô hình và tài khoản đã tạo ra chúng, nên suy luận có thể được mang tiếp từ Claude Sonnet 5 nhưng không thể mang sang một họ khác, và một tiền tố hội thoại đã chỉnh sửa có thể biến một lần phát lại thành lỗi.

Qwen3.8 Max không đòi hỏi bất kỳ điều nào trong số đó. Đây là một mô hình theo định dạng OpenAI với bề mặt yêu cầu thông thường, và việc chuyển sang nó từ một bậc Qwen khác chỉ là một thay đổi chuỗi mô hình.

Hãy cân nhắc hai cái giá này một cách trung thực. Chọn mô hình Qwen khiến bạn phải chịu khoảng cách tổng hợp mười một điểm và những con số từ nhà cung cấp Anthropic mà dù sao bạn cũng không thể tự mình xác minh. Chọn mô hình Anthropic khiến bạn phải chịu đầu vào video và một danh sách bốn thay đổi API, mỗi thay đổi sẽ thất bại ầm ĩ với lỗi 400 ngay lần đầu bị chạm tới — đó là kiểu thất bại tốt, nhưng dù sao cũng tốn một ngày công.

OrcaRouter phù hợp ở đâu

Lý do nên định tuyến thay vì chọn là con số mang tính quyết định — chi phí cho mỗi tác vụ trên lưu lượng của bạn — không thể được tính ra từ tài liệu của bất kỳ nhà cung cấp nào trong hai bên.

OrcaRouter là một endpoint duy nhất tương thích OpenAI, phủ hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển thẳng không cộng thêm markup, nên một đợt giảm giá hay thay đổi hạng dịch vụ ở bất kỳ bên nào cũng có hiệu lực ngay trong ngày được công bố. Cả hai bản dựng Qwen3.8 Max đều có trong danh mục với đúng mức 2 USD / 6 USD của Alibaba — bản ra mắt tháng Tám và bản làm mới (0902) — cùng với Claude Sonnet 5, mô hình mà phần lớn lưu lượng Claude API vẫn đang chạy, có thể định tuyến từ ngày 30 tháng 6 với mức 2 USD / 10 USD của Anthropic cùng tốc độ đo được 150 token đầu ra mỗi giây. Bản thân Claude Sonnet 5.5 vẫn chưa có trong danh mục của chúng tôi; trong khi điều đó còn đúng, con đường trung thực để tiếp cận nó là API của chính nhà cung cấp và ba nền tảng đám mây mà Anthropic liệt kê, và cách để dùng thử mà không phải di chuyển khối lượng công việc là một phần lưu lượng đặt sau cơ chế chuyển đổi dự phòng tự động sang Claude Sonnet 5 hoặc Qwen3.8 Max.

Cái nào, cho công việc nào?

Qwen3.8 Max giành ưu thế ở đầu vào video, ở tốc độ đầu ra, ở chi phí đo được cho mỗi tác vụ chỉ mục và ở nỗ lực tích hợp. Nó là lựa chọn mặc định đúng đắn cho khối lượng công việc lớn, được đặc tả rõ ràng, nơi khoảng cách tổng hợp mười hai điểm không thể hiện ra trong chất lượng đầu ra.

Claude Sonnet 5.5 thắng ở chỉ số tổng hợp độc lập, ở các đánh giá lập trình agentic nơi số liệu nhà cung cấp của Anthropic cho thấy mức tăng 60 điểm so với chính phiên bản tiền nhiệm trên Terminal-Bench 4.0, ở mức trần đầu ra theo lô 300K, và ở một quyết định định hình theo công việc mà bảng giá không thể đưa ra: đây là mô hình nên chọn khi nhiệm vụ đủ khó đến mức việc đúng quan trọng hơn việc rẻ.

Điều sẽ thay đổi câu trả lời cho dù là bên nào trong hai thì cũng là cùng một thứ, và đó không phải là một bản phát hành benchmark mới. Đó là số lượng token trên mỗi tác vụ trên chính các prompt của bạn, ở các thiết lập effort của chính bạn, cho cả hai mô hình. Tham số effort của Anthropic và giới hạn đầu ra của Qwen đều là những đòn bẩy tác động lên con số đó, và cả hai đều do bạn đặt ra chứ không phải bởi bảng giá của nhà cung cấp.

Điều duy nhất mà so sánh này thực sự làm rõ: ở mức 2 USD cho mỗi triệu token đầu vào, phía đầu vào của hóa đơn không còn là yếu tố tạo khác biệt giữa một mô hình chủ lực Trung Quốc và mô hình tầm trung của Anthropic. Cuộc đua đó đã chuyển sang phía đầu ra và sang số lượng token từ nhiều tháng trước.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày