
Claude Sonnet 5.5 vs Tencent HY4 Preview: Cả hai phòng thí nghiệm đều đang bán hóa đơn token
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 931 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 192 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Hai lần ra mắt, cách nhau sáu tuần, đưa ra cùng một lời hứa bằng những từ ngữ khác nhau. Tuyên bố của nhà cung cấp là Claude Sonnet 5.5, được phát hành ngày 28 tháng 9 năm 2026, có chi phí "thấp hơn tới 30% cho mỗi tác vụ" so với Claude Sonnet 5 với mức giá trên mỗi token không đổi. Tuyên bố thứ hai là bản tối ưu hóa ngày 7 tháng 9 cho bản dựng được host của Tencent HY4 Preview, được phát hành lần đầu và mở mã nguồn vào ngày 28 tháng 8 năm 2026, cắt giảm số lượt suy luận và mức tiêu thụ token trên mỗi tác vụ mà vẫn giữ nguyên chất lượng tác vụ. Không nhà cung cấp nào tăng hay giảm giá để đưa ra tuyên bố đó. Cả hai đều đang nói với bạn rằng token giờ chính là sản phẩm, và phần thú vị của cuộc đối đầu này là chỉ một trong hai tuyên bố có thể được đối chiếu với một con số trên mỗi tác vụ đã được công bố — vì chỉ một trong hai mô hình này có một phép đo độc lập để đối chiếu.
Sự bất đối xứng đó không phải là lời chê bai nhắm vào Tencent. HY4 Preview không có trang mô hình trên Artificial Analysis, không có điểm Intelligence Index độc lập và không có con số chi phí trên mỗi tác vụ từ bất kỳ bên thứ ba nào. Thứ nó có là một bảng benchmark do nhà cung cấp công bố — Terminal-Bench 2.0 ở 85.4, DeepSWE 64.3, một đánh giá mù nội bộ trên 203 tác vụ kỹ thuật, trong đó nó đạt trung bình 2.99 so với GLM-5.3 ở 2.92 và Kimi K3 ở 2.94 — cùng màn ra mắt đầu tiên do cộng đồng bình chọn công khai trên bảng xếp hạng WebDev Arena, nơi Tencent báo cáo rằng nó đứng khoảng thứ năm chung cuộc và thứ ba trong số các mô hình open-weight. Tất cả những điều đó đều là tín hiệu thực. Không điều nào trong số đó là chi phí trên mỗi tác vụ, nghĩa là con số chính xác mà cả hai nhà cung cấp đang cạnh tranh, đối với HY4 Preview, là không có sẵn.
Mỗi bên thực sự đã tung ra những gì
Tencent HY4 Preview là một mô hình hỗn hợp chuyên gia 770 tỷ tham số với 49 tỷ tham số hoạt động mỗi token, 78 lớp, 256 chuyên gia định tuyến cộng thêm một chuyên gia chia sẻ, một lớp MTP nguyên bản cho giải mã suy đoán, và cửa sổ ngữ cảnh vượt qua một triệu token. Nó chỉ xử lý văn bản theo thiết kế — Tencent xây dựng nó cho các tác nhân lập trình, sử dụng công cụ phức tạp và công việc năng suất, chứ không phải cho hình ảnh — và nó mặc định chạy ở chế độ suy luận nặng, với ba mức có thể cấu hình (cao, thấp, không) và cài đặt lấy mẫu được nhà cung cấp khuyến nghị là temperature 0.9 và top_p 1.0. Trọng số theo giấy phép Apache 2.0 và có thể tải xuống từ Hugging Face, GitHub, ModelScope và GitCode. Tencent ban đầu đã chỉ ra hai điểm chưa hoàn thiện trong bản xem trước, đó là việc dành nhiều thời gian hơn mức cần thiết để suy nghĩ và tự kiểm tra quá mức công việc của chính nó, và bản cập nhật ngày 7 tháng 9 nhắm chính xác vào những điểm đó.
Claude Sonnet 5.5 là mô hình thế hệ 5.5 thứ hai của Anthropic và là mô hình mà hãng định vị là sự kết hợp tốt nhất giữa tốc độ và trí tuệ trong dòng sản phẩm. Một triệu token ngữ cảnh, 128.000 token đầu ra ở chế độ đồng bộ và 300.000 trên Message Batches API, đầu vào văn bản, hình ảnh và tệp, tư duy thích ứng với mức nỗ lực có thể chọn, mốc kiến thức tháng 6 năm 2026, khả năng không lưu giữ dữ liệu có sẵn ngay từ khi ra mắt, và mốc ngừng hỗ trợ sớm nhất là ngày 28 tháng 9 năm 2027. Bảng giá không thay đổi so với Claude Sonnet 5: 2,00 USD cho mỗi triệu token đầu vào, 10,00 USD cho mỗi triệu token đầu ra, 0,20 USD cho lượt đọc bộ nhớ đệm và 2,50 USD cho lượt ghi bộ nhớ đệm. Trọng số đóng, Anthropic API cùng Bedrock, Google Cloud và Microsoft Foundry.
Đặt hai thứ cạnh nhau và các vị trí gần như đối xứng:
• Giá — Claude Sonnet 5.5 $2.00 đầu vào / $10.00 đầu ra mỗi triệu so với Tencent HY4 Preview $0.83 đầu vào / $2.50 đầu ra trên danh mục của chúng tôi, từ danh sách nhà cung cấp ¥6 / ¥18
• Đọc bộ nhớ đệm — Claude Sonnet 5.5 0,20 USD mỗi triệu so với Tencent HY4 Preview 0,042 USD mỗi triệu trong danh mục của chúng tôi
• Trọng số — Claude Sonnet 5.5 đóng vs Tencent HY4 Preview Apache 2.0, có thể tải xuống
• Ngữ cảnh — Claude Sonnet 5.5 1.000.000 token so với Tencent HY4 Preview 1.048.576 token, thực tế là giống hệt nhau
• Sản lượng đầu ra tối đa — Claude Sonnet 5.5 128.000 ở chế độ đồng bộ, 300.000 trên Batches, so với Tencent HY4 Preview 64.000 trong danh mục của chúng tôi
• Phương thức đầu vào — Claude Sonnet 5.5: văn bản, hình ảnh và tệp so với Tencent HY4 Preview: chỉ văn bản
• Điểm số độc lập — Claude Sonnet 5.5 Intelligence Index 56 với $7.60 mỗi tác vụ, bản sửa đổi v4.3.2 so với Tencent HY4 Preview không có công bố nào
• Tốc độ đầu ra đo được — Claude Sonnet 5.5 138,7 token/giây so với Tencent HY4 Preview 22,3 token/giây trên lưu lượng của chính chúng tôi

Tuyên bố mà cả hai phòng thí nghiệm đang đưa ra, và lý do vì sao một trong hai có thể kiểm chứng được
“Giảm 30% mỗi tác vụ” của Anthropic và “ít lượt suy luận hơn, tiêu thụ token thấp hơn” của Tencent là cùng một dự án kỹ thuật được mô tả từ hai hướng: khiến mô hình dùng ít token hơn để đi đến cùng một câu trả lời. Anthropic nói rõ rằng mức giá không thay đổi, nghĩa là mọi khoản tiết kiệm trên mỗi tác vụ đều phải đến từ số lượng token — và bảng đánh giá độc lập cho bạn thấy hình dạng của vấn đề chứ không phải quy mô của giải pháp. Claude Sonnet 5.5 tạo ra 410 triệu token đầu ra trong toàn bộ đánh giá Intelligence Index, so với 117 triệu của MiniMax M3 và 77 triệu của Grok 4.5. Đó là một mô hình dài dòng, được đo lường, trên một bảng đánh giá công bố con số đó. Cho dù mức cải thiện 30% so với Claude Sonnet 5 thực chất là bao nhiêu, nó đang được áp dụng lên một cơ sở rất lớn.
Đối với HY4 Preview, con số tương đương không tồn tại công khai. Ghi chú tối ưu hóa của chính Tencent là tài liệu duy nhất về nó, và ghi chú này nêu kết quả mà không có con số: ít lượt hơn, token đầu vào và đầu ra thấp hơn, chất lượng như nhau, được xác thực bằng các chỉ số benchmark và đánh giá của con người qua hai lượt. Đó là tuyên bố của nhà cung cấp theo đúng nghĩa — được nêu ra, có vẻ hợp lý, chưa được tái lập — và ở đây nó được ghi nhãn như vậy. Việc áp dụng một mô hình preview dựa trên tuyên bố tiết kiệm token của nhà cung cấp, trong khi mức tiết kiệm token lại chính là thứ bạn không thể đo lường từ bên ngoài, chính xác là canh bạc mà một bản phát hành preview đang yêu cầu bạn thực hiện.
Một điểm rắc rối nữa đáng để biết trước khi bất kỳ ai lên kế hoạch triển khai tự lưu trữ dựa trên tối ưu hoá đó. Thay đổi ngày 7 tháng 9 của Tencent áp dụng cho bản dựng mà Tencent phục vụ trên các endpoint do chính họ vận hành. Bản snapshot trọng số mở đã không được làm mới — ngày sửa đổi cuối cùng của kho Hugging Face vẫn là ngày 28 tháng 8 — vì vậy một bản sao trọng số tự lưu trữ sẽ chạy hành vi suy luận dài hơn, nguyên bản mà các ghi chú xem trước đã nêu ra. Phiên bản tối ưu hoá và phiên bản có thể tải xuống không phải là cùng một sản phẩm.
Nơi trọng số mở thực sự phát huy tác dụng cũng chính là nơi chúng luôn phát huy tác dụng: một triển khai không thể gọi API. Một mô hình 770B tham số với 49B hoạt động là một quyết định ở cấp trung tâm dữ liệu chứ không phải cấp máy trạm, vì vậy đây không phải là câu chuyện hạng laptop mà một mô hình 30B kể — nhưng đối với một người mua cần mô hình bên trong vành đai của riêng họ, Apache 2.0 ở quy mô đó là một lựa chọn mà Claude Sonnet 5.5 không cung cấp ở bất kỳ mức giá nào.
Dùng thử bản xem trước mà không đặt cược lộ trình production vào đó
Các mô hình preview là trường hợp mà định tuyến không còn là tối ưu hóa chi phí nữa mà trở thành kiểm soát rủi ro. Lý do để đặt một bản dựng preview phía sau một router thay vì gọi trực tiếp nó là vì một bản preview được định nghĩa bởi khả năng thay đổi ngay dưới chân bạn, và hai thứ bạn muốn từ lớp phía trước nó là một tỷ lệ chia phần trăm và một thứ gì đó để bắt các lỗi.
Đó chính là hình hài mà OrcaRouter mang lại: một endpoint tương thích OpenAI bao phủ hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, không cộng thêm phụ phí, tự động chuyển đổi dự phòng giữa các nhà cung cấp thượng nguồn, cùng một DSL định tuyến để tổ hợp các lệnh gọi từ nhiều mô hình. Tencent HY4 Preview hiện đã có thể định tuyến tại đây với mã tencent/hy4-preview ở mức 0,83 USD cho đầu vào và 2,50 USD cho đầu ra trên mỗi triệu token, với 0,042 USD cho mỗi lần đọc bộ nhớ đệm trên cửa sổ 1.048.576 token — cùng một bản dựng, đúng mức giá của nhà cung cấp, có thể truy cập bằng chính chiếc khóa bạn vẫn dùng cho mọi thứ khác trong danh mục. Claude Sonnet 5 cũng định tuyến được tại đây, với mức 2,00 USD và 10,00 USD của Anthropic, và đã như vậy kể từ ngày 30 tháng 6; đây rõ ràng là một đối tác dự phòng lý tưởng trong khi một mô hình mới ra đời một ngày vẫn đang tích lũy bằng chứng từ môi trường thực tế.

Bản thân Claude Sonnet 5.5 không nằm trong danh mục của chúng tôi. Nó ra mắt ngày hôm qua, con đường đến với nó là API riêng của Anthropic, và trang này sẽ không gợi ý điều gì khác — mục đích của lời khuyên định tuyến là cách an toàn để chạy một tầng hoàn toàn mới trong môi trường production là chia cho nó một phần lưu lượng với thứ gì đó đã được chứng minh đứng đằng sau, và điều đó chỉ hiệu quả khi cả hai đầu của sự sắp đặt đều nằm ở nơi bạn có thể tiếp cận từ một điểm. HY4 Preview đang gánh 372 nghìn token lưu lượng mỗi tuần ở đây, đó là hình ảnh của một bản xem trước hai ngày tuổi trước khi bất kỳ ai cam kết với nó; Claude Sonnet 5 đã gánh 7,9 triệu mỗi tuần kể từ ngày 30 tháng 6, và đó là sự khác biệt giữa một ứng viên và một mức sàn.

Tiền thực sự đi đâu
Chỉ xét về mức giá, HY4 Preview rẻ hơn bốn lần ở đầu ra so với Claude Sonnet 5.5 và rẻ hơn gần năm lần ở lượt đọc từ bộ đệm, đồng thời tương đương về cửa sổ. Về mặt đo lường thực tế, Claude Sonnet 5.5 tạo đầu ra nhanh hơn sáu lần trên lưu lượng của chính chúng tôi — 138,7 token mỗi giây so với 22,3 — một khoảng cách kiểu như vậy biến lợi thế về mức giá gấp bốn lần thành lợi thế thời gian thực nhỏ hơn nhiều, và đôi khi thành thua lỗ, khi tính đến hàng đợi.
Giữa hai sự thật đó, quyết định dựa trên bốn câu hỏi mà chỉ người đọc mới có thể trả lời. Công việc có cần một hình ảnh hay một tệp trong lời nhắc không? HY4 Preview chỉ hỗ trợ văn bản và điều đó khép lại cuộc thảo luận. Liệu nó có cần hoàn thành một tác vụ phần mềm gồm nhiều bước, nơi điểm Terminal-Bench 2.1 của HY4 Preview là 85.4, là con số do chính Tencent đưa ra và chưa được tái lập? Vậy thì trạng thái bản xem trước chính là rủi ro mà bạn đang chấp nhận, và bản tối ưu hóa ngày 7 tháng 9 đáng để kiểm chứng lại thay vì tin tưởng. Khối lượng công việc có phải chạy bên trong vành đai của riêng bạn không? Vậy thì trọng số Apache 2.0 là sự thật quyết định. Và liệu mức năng lực tổng hợp có quan trọng hơn mức giá không? Vậy thì con số 56 được đo lường độc lập của Claude Sonnet 5.5 là con số cần cân nhắc, ở mức $7.60 cho mỗi tác vụ Index, với lưu ý rằng không có con số tương đương nào ở phía Tencent để so sánh với nó.
Điều mà cả hai lần ra mắt thực sự chứng minh là biên giới đã vượt qua các bảng giá. Hai phòng thí nghiệm, cách nhau sáu tuần, đã tung ra các mô hình và đi đầu bằng mức tiêu thụ token theo từng tác vụ thay vì giá trên mỗi triệu, và hệ quả thực tế đối với người mua là con số hữu ích không còn nằm trên trang giá của nhà cung cấp nào trong hai nữa. Đó là số lượng token mà chính khối lượng công việc của bạn tạo ra, được đo trên cả hai mô hình, và đó là con số duy nhất trong bài viết này mà không nhà cung cấp nào trong hai có thể đưa cho bạn.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
