
Claude Sonnet 5.5 vs Qwen3.8 Max: Sáu Tuần, Hai Hạng, Một Phán Quyết Về Chi Phí
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Thử làm phép tính với ba lời nhắc và phép so sánh phần lớn đã ngã ngũ trước cả khi bạn chạm đến các bài đo chuẩn. Một lệnh gọi trả lời hỗ trợ ngắn: 2.000 token đầu vào, 500 token đầu ra. Với Qwen3.8 Max ở mức $2 mỗi triệu token đầu vào và $6 mỗi triệu token đầu ra, con số đó là bốn phần mười xu; với Claude Sonnet 5.5 ở mức $2 và $10, con số đó là chín phần mười xu. Một lần tái cấu trúc kho mã: 400.000 đầu vào, 30.000 đầu ra — bốn mươi ba xu so với tám mươi ba xu. Một phiên agentic dài thực sự tiêu hết ngân sách: hai triệu token đầu vào, 200.000 đầu ra, vậy $5,20 so với $6,30 khi các con số đủ lớn để phía đầu vào chiếm ưu thế.
Khoảng cách ban đầu là mức chênh lệch 2,25× về giá đầu ra thu hẹp xuống còn khoảng 1,2× ở quy mô agentic, và việc mở rộng quy mô đó không phải là một điều tầm thường. Qwen3.8 Max và Claude Sonnet 5.5 đều là các mô hình 1M token với trần đầu ra lớn, đều có giá 2 USD mỗi triệu token đầu vào, và đều được phát hành chỉ cách nhau trong vòng tám tuần — của nhà cung cấp vào ngày 3 tháng 8 năm 2026 với bản làm mới ghi ngày 2 tháng 9, của Anthropic vào ngày 28 tháng 9. Khác biệt giữa chúng không nằm ở bảng giá. Mà là ở việc mỗi mô hình chi ra bao nhiêu để hoàn thành.
Những gì đã được phát hành, và khi nào
Qwen3.8 Max là tầng năng lực cao nhất của Alibaba cho đến nay. Alibaba định vị nó trực tiếp đối đầu với GPT-5.5, Claude Opus 4.7 và Gemini 3.1 Pro trong hướng dẫn chuyển đổi của chính mình, và khuyến nghị nó mỗi khi cần khả năng suy luận mạnh nhất hiện có. Nó có cửa sổ ngữ cảnh 1 triệu token, nhận đầu vào văn bản, hình ảnh và video, đồng thời xuất ra văn bản — khả năng nhập video là điểm mà Claude Sonnet 5.5 không có. Giá là 2 USD mỗi triệu token đầu vào và 6 USD mỗi triệu token đầu ra, với đọc bộ nhớ đệm ở mức 0,25 USD và ghi bộ nhớ đệm ở mức 2,50 USD. Mục ngày 3 tháng 8 trong danh mục của chúng tôi có thêm bản làm mới ngày 2 tháng 9 được liệt kê là Qwen3.8 Max (0902), với mức giá niêm yết tương tự và giới hạn đầu ra 131K.

Claude Sonnet 5.5 là mô hình thứ hai trong thế hệ 5.5 của Anthropic, ra mắt ngày 28 tháng 9 năm 2026, sáu ngày sau Claude Opus 5.5. Nó được phát hành dưới dạng claude-sonnet-5-5 trên Claude API và trên Amazon Bedrock, Google Cloud và Microsoft Foundry, với cửa sổ 1M token, giới hạn đầu ra đồng bộ 128K mở rộng lên 300K trên Message Batches API đằng sau header output-300k-2026-03-24, và mức giá của Claude Sonnet 5 được giữ nguyên chính xác: 2 đô vào, 10 đô ra, 0,20 đô đọc cache, 2,50 đô ghi cache. Không lưu giữ dữ liệu kể từ khi ra mắt, thời điểm ngừng hỗ trợ không sớm hơn ngày 28 tháng 9 năm 2027.
Vậy nên mức giá đầu vào là như nhau, các cửa sổ ngữ cảnh có cùng kích thước, và hai nhà cung cấp đã cập nhật cách nhau trong vòng một tháng. Mọi thứ phân biệt họ đều nằm ở phần đầu ra trên hóa đơn hoặc trong các phép đo hiệu năng.
Điểm chuẩn: bảng của nhà cung cấp so với chỉ số độc lập
Ở đây có hai loại bằng chứng và chúng không thể thay thế cho nhau.
Bảng công bố khi ra mắt của Anthropic do nhà cung cấp tự báo cáo, chưa được bất kỳ bên thứ ba nào tái lập, và bao gồm tám đánh giá. Những hàng đáng quan tâm
• Terminal-Bench 4.0 — Claude Sonnet 5.5 đạt 70,6% so với 10,3% của Claude Sonnet 5
• CursorBench 4.0 — 55,5% so với 34,1% của Claude Sonnet 5
• GDPval-AA v2.1 — 1844 so với 1449 của Claude Sonnet 5, 1846 của Claude Opus 5.5 và 1487 của GPT-6 Sol
• Humanity's Last Exam, với công cụ — 64,5% so với 54,9%; Claude Opus 5.5 đạt 67,7%
• OSWorld 2.1, một phần — 80,1% so với 57,0%
• Chartography, không dùng công cụ — 61,6% so với 15,6%
Alibaba không công bố bảng bốn cột tương đương trực tiếp, nên những số liệu duy nhất có thể đặt trên cùng một trục là những số liệu độc lập. Artificial Analysis, bản sửa đổi v4.3.2
• Chỉ số Trí tuệ Tổng hợp — Claude Sonnet 5.5 56 ở vị trí thứ 3 trong số 216; Qwen3.8 Max 45 ở vị trí thứ 27
• Chi phí cho mỗi tác vụ Intelligence Index — 7,60 USD so với 5,41 USD
• Tốc độ đầu ra — mô hình của Anthropic được đo so với đường cơ sở Claude Sonnet 5 ở mức 78,7 token mỗi giây; Qwen3.8 Max được đo ở mức 39,1
• Độ dài dòng — 410M token đầu ra trên Index so với 190M
Điểm số theo từng đánh giá của riêng Qwen3.8 Max là mức đáng nể chứ không phải chỉ tàm tạm: 92.8% trên GPQA Diamond, 88.8% trên Terminal-Bench 2.1, 80.3% về khả năng ghi nhớ ngữ cảnh dài, 47.8% trên tau-banking. Nó mất lợi thế ở điểm tổng hợp vì không thắng dứt khoát ở hạng mục nào, trong khi dòng Anthropic mới hơn lại thắng hẳn một số hạng mục. Cũng lưu ý rằng trang độc lập về Qwen3.8 Max ghi ngày phát hành 2 tháng 9 năm 2026 và thông số ngữ cảnh 984K — trang đó mô tả bản làm mới (0902), chứ không phải bản dựng tháng 8, và việc trộn lẫn các con số giữa hai bản sẽ là một sai lầm.

Điều còn thiếu ở cả hai cột cũng quan trọng như điều có trong đó. Chưa ai tự mình tái lập được các con số OSWorld hay Terminal-Bench của Anthropic. Chưa ai công bố một con số Chartography hay CursorBench cho Qwen3.8 Max. Điểm tổng hợp là con số duy nhất được đo theo cùng một cách trên cả hai mô hình, và đó chính xác là lý do vì sao con số chi phí trên mỗi tác vụ bên dưới nó lại có sức nặng đến vậy.
Con số quyết định điều đó, và nó không nằm trên bảng giá nào trong hai bảng giá.
Artificial Analysis tính phí cho cả hai mô hình theo cùng một cách: chạy mười bài đánh giá trong Index, đếm token, nhân với giá niêm yết. Claude Sonnet 5.5 cho ra mức $7.60 mỗi tác vụ và Qwen3.8 Max là $5.41, mức cao hơn 40% cho mô hình Anthropic bất chấp điểm tổng hợp cao hơn. Các chỉ số về độ dài đầu ra giải thích hướng — 410M token so với 190M — và các chỉ số về tốc độ giải thích phần còn lại: một mô hình phát ra ít token hơn và mất nhiều thời gian hơn cho mỗi token thì không phải là mô hình phải trả cho đầu ra với mức gấp đôi.
Tuyên bố về hiệu quả của chính Anthropic khớp với cùng câu chuyện đó thay vì mâu thuẫn với nó. Công ty nói rằng Claude Sonnet 5.5 tạo đầu ra nhanh hơn Claude Sonnet 5 hơn 30% và có chi phí "thấp hơn tới 30% cho mỗi tác vụ" ở cùng mức giá — một tuyên bố về số token trên mỗi tác vụ, không phải về đơn giá. Liệu điều đó có đứng vững trước một mô hình dùng ít hơn một nửa số token hay không chính là điều mà con số $7.60 đang hỏi, và một lần chạy độc lập chỉ là một điểm dữ liệu.
Hệ quả thực tế: mức giá đầu ra $6 so với $10 là con số mà bộ phận thu mua sẽ nhìn vào, và đó là con số ít có tính dự báo nhất trong bài viết. Con số có tính dự báo là số token cho mỗi tác vụ trên chính prompt của bạn, và không nhà cung cấp nào sẽ đưa nó cho bạn.
Đầu vào, video và cái bẫy migration
Khác biệt về năng lực lộ ra ngay lập tức là phương thức. Qwen3.8 Max chấp nhận video cùng với văn bản và hình ảnh; Claude Sonnet 5.5 chấp nhận văn bản và hình ảnh. Đối với phân tích bản ghi màn hình, các pipeline xử lý cảnh quay cuộc họp hay bất cứ thứ gì coi video là đầu vào hạng nhất, đó không phải là khoảng cách về điểm chuẩn — mà là một câu hỏi nhị phân về tính đủ điều kiện, và chỉ một trong hai mô hình này đạt.

Khác biệt xuất hiện một tuần sau đó mang tính hành vi. Claude Sonnet 5.5 tạo ra năm thay đổi phá vỡ tương thích đối với mã chạy trên Claude Sonnet 5. Một giá trị không mặc định của temperature, top_p hoặc top_k giờ trả về 400. Gửi thinking: {"type": "disabled"} trả về 400 trỏ đến between_tools, thiết lập thinking thấp nhất mới, được chấp nhận ở mức low, medium và high và bị từ chối ở xhigh hoặc max. Việc buộc sử dụng công cụ — tool_choice là "any" hoặc một công cụ được đặt tên — trả về 400 ngay lập tức. Công cụ computer-use cũ hơn computer_20251124 bị từ chối trên Claude API và Google Cloud. Và các khối thinking bị ràng buộc với mô hình và tài khoản đã tạo ra chúng, nên suy luận có thể được mang tiếp từ Claude Sonnet 5 nhưng không thể mang sang một họ khác, và một tiền tố hội thoại đã chỉnh sửa có thể biến một lần phát lại thành lỗi.
Qwen3.8 Max không đòi hỏi bất kỳ điều nào trong số đó. Đây là một mô hình theo định dạng OpenAI với bề mặt yêu cầu thông thường, và việc chuyển sang nó từ một bậc Qwen khác chỉ là một thay đổi chuỗi mô hình.
Hãy cân nhắc hai cái giá này một cách trung thực. Chọn mô hình Qwen khiến bạn phải chịu khoảng cách tổng hợp mười một điểm và những con số từ nhà cung cấp Anthropic mà dù sao bạn cũng không thể tự mình xác minh. Chọn mô hình Anthropic khiến bạn phải chịu đầu vào video và một danh sách bốn thay đổi API, mỗi thay đổi sẽ thất bại ầm ĩ với lỗi 400 ngay lần đầu bị chạm tới — đó là kiểu thất bại tốt, nhưng dù sao cũng tốn một ngày công.
OrcaRouter phù hợp ở đâu
Lý do nên định tuyến thay vì chọn là con số mang tính quyết định — chi phí cho mỗi tác vụ trên lưu lượng của bạn — không thể được tính ra từ tài liệu của bất kỳ nhà cung cấp nào trong hai bên.
OrcaRouter là một endpoint duy nhất tương thích OpenAI, phủ hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển thẳng không cộng thêm markup, nên một đợt giảm giá hay thay đổi hạng dịch vụ ở bất kỳ bên nào cũng có hiệu lực ngay trong ngày được công bố. Cả hai bản dựng Qwen3.8 Max đều có trong danh mục với đúng mức 2 USD / 6 USD của Alibaba — bản ra mắt tháng Tám và bản làm mới (0902) — cùng với Claude Sonnet 5, mô hình mà phần lớn lưu lượng Claude API vẫn đang chạy, có thể định tuyến từ ngày 30 tháng 6 với mức 2 USD / 10 USD của Anthropic cùng tốc độ đo được 150 token đầu ra mỗi giây. Bản thân Claude Sonnet 5.5 vẫn chưa có trong danh mục của chúng tôi; trong khi điều đó còn đúng, con đường trung thực để tiếp cận nó là API của chính nhà cung cấp và ba nền tảng đám mây mà Anthropic liệt kê, và cách để dùng thử mà không phải di chuyển khối lượng công việc là một phần lưu lượng đặt sau cơ chế chuyển đổi dự phòng tự động sang Claude Sonnet 5 hoặc Qwen3.8 Max.
Cái nào, cho công việc nào?
Qwen3.8 Max giành ưu thế ở đầu vào video, ở tốc độ đầu ra, ở chi phí đo được cho mỗi tác vụ chỉ mục và ở nỗ lực tích hợp. Nó là lựa chọn mặc định đúng đắn cho khối lượng công việc lớn, được đặc tả rõ ràng, nơi khoảng cách tổng hợp mười hai điểm không thể hiện ra trong chất lượng đầu ra.
Claude Sonnet 5.5 thắng ở chỉ số tổng hợp độc lập, ở các đánh giá lập trình agentic nơi số liệu nhà cung cấp của Anthropic cho thấy mức tăng 60 điểm so với chính phiên bản tiền nhiệm trên Terminal-Bench 4.0, ở mức trần đầu ra theo lô 300K, và ở một quyết định định hình theo công việc mà bảng giá không thể đưa ra: đây là mô hình nên chọn khi nhiệm vụ đủ khó đến mức việc đúng quan trọng hơn việc rẻ.
Điều sẽ thay đổi câu trả lời cho dù là bên nào trong hai thì cũng là cùng một thứ, và đó không phải là một bản phát hành benchmark mới. Đó là số lượng token trên mỗi tác vụ trên chính các prompt của bạn, ở các thiết lập effort của chính bạn, cho cả hai mô hình. Tham số effort của Anthropic và giới hạn đầu ra của Qwen đều là những đòn bẩy tác động lên con số đó, và cả hai đều do bạn đặt ra chứ không phải bởi bảng giá của nhà cung cấp.
Điều duy nhất mà so sánh này thực sự làm rõ: ở mức 2 USD cho mỗi triệu token đầu vào, phía đầu vào của hóa đơn không còn là yếu tố tạo khác biệt giữa một mô hình chủ lực Trung Quốc và mô hình tầm trung của Anthropic. Cuộc đua đó đã chuyển sang phía đầu ra và sang số lượng token từ nhiều tháng trước.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
