
GPT-6 Sol vs Tencent HY4 Preview: Mô hình rẻ hơn đang gánh lưu lượng gấp sáu trăm lần
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Comparisons between a frontier model and a cheap one usually end at the price table, and this one has a better ending available. Tencent HY4 Preview and GPT-6 Sol are both routed by OrcaRouter, which means the same telemetry covers both, and over the same rolling seven-day window the HY4 Preview model moved roughly 2.4 billion tokens against GPT-6 Sol's roughly 3.9 million. That is not a benchmark and it is not a verdict; it is a rolling window on one platform's traffic and it will read differently next week. But it is a real signal about what people building things actually reach for when a strong open-weight model costs a quarter of the closed one, and it is the kind of number a spec sheet cannot produce.
Hai mô hình này cũng là một minh chứng cho việc một benchmark có thể và không thể cho bạn biết điều gì. GPT-7 Sol, ra mắt ngày 22 tháng 9 năm 2026 với tư cách là bậc trung trong thế hệ GPT-6 của OpenAI, có điểm Intelligence Index độc lập. HY4 Preview, được Tencent phát hành và mở mã nguồn vào ngày 28 tháng 8 năm 2026, không có trang mô hình trên Artificial Analysis, không có chỉ số của bên thứ ba và hoàn toàn không có con số chi phí độc lập cho từng tác vụ. Mọi thông tin được công bố về việc nó hoạt động tốt đến đâu đều là đo lường của chính Tencent. Sự bất đối xứng đó không khiến HY4 Preview trở thành mô hình yếu hơn. Nó khiến mô hình này trở thành mô hình ít được kiểm chứng hơn, và đó là những khẳng định.
Các thông số kỹ thuật, bao gồm hai thông số quyết định phần lớn các triển khai
• Giá đầu ra — GPT-6 Sol $10,00 mỗi triệu so với Tencent HY4 Preview $2,50 mỗi triệu
• Giá đầu vào — GPT-6 Sol $2,00 mỗi triệu so với Tencent HY4 Preview $0,83 mỗi triệu
• Đầu vào được lưu đệm — GPT-6 Sol $0,20 mỗi triệu so với Tencent HY4 Preview $0,04 mỗi triệu
• Trọng số — GPT-6 Sol đóng, chỉ có API so với HY4 Preview mã nguồn mở theo Apache 2.0
• Phương thức đầu vào — GPT-6 Sol văn bản, hình ảnh và tệp so với HY4 Preview chỉ văn bản
• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với HY4 Preview 1.048.576 token
• Đầu ra tối đa — GPT-6 Sol 128.000 token so với HY4 Preview 64.000 token
• Bước giá cho yêu cầu dài — GPT-6 Sol định giá lại toàn bộ yêu cầu trên 272.000 token đầu vào thành $4,00 / $15,00 so với HY4 Preview không có bước nào trên thẻ của nó
• Kiến trúc — GPT-6 Sol không được tiết lộ so với HY4 Preview 770B tổng tham số, 49B hoạt động, 78 lớp, 256 chuyên gia định tuyến cộng một chuyên gia chia sẻ, lớp dự đoán đa token gốc
• Điểm độc lập — GPT-6 Sol 47,6 Intelligence Index so với HY4 Preview không có công bố nào
• Tốc độ đầu ra đo được — GPT-6 Sol khoảng 244 token mỗi giây so với HY4 Preview khoảng 54, cả hai đều là số liệu bảy ngày cuộn
Hai dòng quyết định phần lớn các triển khai thực tế lại là những dòng nằm ở tận dưới cùng. Dòng đầu tiên là việc HY4 Preview không nhận đầu vào hình ảnh hay tệp, điều này loại nó khỏi bất kỳ pipeline nào cần nhìn vào một thứ gì đó. Dòng thứ hai là mức trần đầu ra: 64.000 token chỉ bằng một nửa so với 128.000 của GPT-6 Sol, và trên một mô hình có mục đích được công bố là dành cho các tác nhân lập trình và chuỗi sử dụng công cụ dài, đó chính là ràng buộc mà một nhóm gặp phải đầu tiên — không phải chất lượng, mà là thời điểm một tệp được tạo ra không còn vừa trong một phản hồi.
Đổi lại, chỉ với một phần tư giá đầu ra và một phần năm giá đầu vào được lưu đệm, ta có được rất nhiều lần thử lại. Và kiến trúc của HY4 Preview được ghi chép tài liệu theo cách mà kiến trúc của GPT-6 Sol không có: Tencent đã công bố số lượng tham số, số lớp, bố cục chuyên gia và lớp giải mã suy đoán, nghĩa là các đặc tính phục vụ ít nhất có thể dự đoán được một phần từ bài báo thay vì chỉ có thể quan sát qua API.

Bảng benchmark của HY4 Preview thực chất là gì
Các con số được Tencent công bố đều rất mạnh, và tất cả đều do chính nhà cung cấp thực hiện. Trên Terminal-Bench 2.1, mô hình đạt 85,4; trên DeepSWE, 64,3; và trong một đánh giá mù nội bộ trên 203 tác vụ kỹ thuật, nó đạt trung bình 2,99, so với GLM-5.3 ở mức 2,92 và Kimi K3 ở mức 2,94 — một khoảng dẫn trước bảy phần trăm điểm trên thang mười điểm, trong một nghiên cứu do Tencent thiết kế. Nó cũng ra mắt trên bảng xếp hạng WebDev Arena, nơi Tencent báo cáo rằng nó đứng khoảng thứ năm chung cuộc và thứ ba trong số các mô hình trọng số mở. Kết quả trên arena là do cộng đồng bình chọn chứ không phải do nhà cung cấp chấm điểm, và là bằng chứng độc lập nhất trong bộ dữ liệu này; phần còn lại chỉ là một tuyên bố, và một tuyên bố vẫn đáng để đọc miễn là nó được dán nhãn đúng như vậy.
Khoảng trống đáng lưu tâm không nằm ở việc những con số này có thể được đưa ra một cách dễ dãi — các khung đánh giá của nhà cung cấp thường như vậy, theo cả hai chiều. Mà nằm ở việc không có phép đo thứ hai để đối chiếu chúng. Một mô hình có trang Artificial Analysis thì có thể được kiểm chứng; một mô hình không có thì không, và sự khác biệt lộ ra vài tháng sau, khi ai đó phát hiện rằng một con số được nhấn mạnh đã được đo trên một khung đánh giá mà không ai khác có thể tái tạo. Ở đây không có gì cho thấy điều đó đã xảy ra với HY4 Preview. Nó chỉ có nghĩa là một quyết định áp dụng dựa trên con số 85.4 đang chỉ dựa trên một nguồn duy nhất.
Cách hiểu thực tế là HY4 Preview nên được đánh giá trên chính lưu lượng của bạn chứ không phải trên bảng so sánh, và mức chi phí khiến việc đó trở nên rẻ — chỉ bằng một phần tư mức giá của GPT-6 Sol, một tuần chạy lưu lượng ngầm với chính những prompt thật của bạn tốn ít hơn một lần đánh giá gói API. Đó mới là cách làm đúng đắn đối với một mô hình chưa được đo lường đầy đủ, và cũng là cách mà gần như không ai thực sự làm.
Câu hỏi về trọng số mở, thứ thực sự là ranh giới chia rẽ
HY4 Preview được mã nguồn mở theo Apache 2.0 với bản dựng FP8 được cấp phép thông thoáng cùng với checkpoint cơ sở. GPT-6 Sol là đóng và không có tệp giấy phép vì không có gì để cấp phép. Mọi thứ khác trong so sánh này đều là một sự đánh đổi; còn điều này là một sự khác biệt về phạm trù.
Điều mà nó mang lại cho bạn không chủ yếu là một hóa đơn rẻ hơn — ở mức $2.50 mỗi triệu đầu ra, API được host vốn đã thấp hơn chi phí vận hành một mô hình 770 tỷ tham số của hầu hết các đội, và nếu chi phí là toàn bộ lý lẽ thì giấy phép thông thoáng cũng chẳng còn đáng bàn. Điều nó mang lại là một cách triển khai không phụ thuộc vào endpoint của bất kỳ ai: trọng số không thể bị rate-limit, một checkpoint có thể được lượng tử hóa để vừa với phần cứng bạn đang có, một mô hình có thể được tinh chỉnh, và lưu lượng có thể nằm gọn trong ranh giới mạng. Câu trả lời của GPT-6 Sol cho cả bốn điều đó là bạn không nên cần bất kỳ điều nào trong số chúng, một lập luận thực sự có giá trị với một nhóm đội ngũ thực sự và không liên quan với những đội ngũ thực sự cần chúng.
Sự phân tách phương thức và dòng giấy phép cùng chỉ về một hướng, điều này đáng để lưu ý. Một mô hình chỉ đọc văn bản và được phát hành theo Apache 2.0 được tạo ra để làm một thành phần — thứ bạn đặt bên trong một pipeline do bạn kiểm soát, nạp vào đó văn bản mà bạn đã xử lý hòa giải sẵn. Một mô hình đọc văn bản, hình ảnh và tệp, và chỉ có thể truy cập qua API, được tạo ra để làm điểm vào, nhận trực tiếp dữ liệu đầu vào lộn xộn. Đó là những công việc khác nhau, và một so sánh xếp chúng trên cùng một chỉ số là đang trả lời một câu hỏi mà cả hai nhà cung cấp đều không hỏi.

Phục vụ chúng cùng nhau, và con số lưu lượng truy cập ngụ ý điều gì
Cả hai mô hình đều nằm sau một khóa OrcaRouter cùng với hơn 200 mô hình khác, và cấu trúc định tuyến mà sự ghép cặp này gợi ý là nghịch đảo của cấu trúc hiển nhiên. Hãy đặt HY4 Preview lên trước — nó là mô hình rẻ hơn bốn lần về đầu ra, là mô hình có kiến trúc đã được tài liệu hóa, và trên các tuyến của chúng ta, nó là mô hình gánh tải — và giữ GPT-6 Sol ở phía sau cho những yêu cầu cần đọc hình ảnh, hoặc cần xuất ra hơn 64,000 token, hoặc không vượt qua kiểm tra chất lượng. Sự tổ hợp được thể hiện trong DSL định tuyến thay vì trong mã ứng dụng, nên ranh giới giữa hai mô hình là một quy tắc bạn có thể chỉnh sửa mà không cần triển khai.
Các số liệu về tốc độ cần một lưu ý và sau đó là một kết luận. HY4 Preview được đo ở mức khoảng 54 token đầu ra mỗi giây trong cửa sổ trượt của chúng tôi, so với khoảng 244 của GPT-6 Sol, và cả hai đều là quan sát trên hạ tầng dùng chung chứ không phải một phép đánh giá chuẩn có kiểm soát — đặc biệt, con số của Tencent phản ánh một mô hình có số tham số hoạt động rất lớn, và 49 tham số hoạt động mỗi token là rất nhiều phép tính cho mỗi token đầu ra. Vậy nên mô hình rẻ hơn lại chậm hơn với khoảng cách lớn, đó là sự đánh đổi mà một pipeline theo lô sẵn lòng thực hiện còn một pipeline tương tác thì không. Bản dựng được host của Tencent cũng nhận được một bản tối ưu hóa hiệu năng vào ngày 7 tháng 9 năm 2026 mà nhà cung cấp nói rằng giúp giảm số lượt suy luận và mức tiêu thụ token trên mỗi tác vụ mà vẫn giữ nguyên chất lượng tác vụ — lại là một con số do nhà cung cấp đưa ra, nhưng là con số dự báo hóa đơn thấp hơn chứ không phải một luồng nhanh hơn.
Chuyển đổi dự phòng là điều khiến việc ghép cặp an toàn theo cả hai thứ tự. Một mô hình trọng số mở 770 tỷ tham số được phục vụ bởi nhiều hơn một nhà cung cấp hạ tầng, và một tuyến có thể dự phòng nghĩa là một máy chủ bị suy giảm chỉ là một lần thử lại thay vì một sự cố ngừng dịch vụ. Danh mục của chúng tôi chuyển nguyên giá niêm yết của nhà cung cấp mà không tăng thêm, điều này cũng có nghĩa là mức giá nhà cung cấp báo theo đơn vị tiền tệ không phải là thứ bạn phải chờ đợi: Tencent niêm yết HY4 Preview ở mức 6 nhân dân tệ đầu vào và 18 nhân dân tệ đầu ra cho mỗi triệu, và con số đô la mà trang của chúng tôi hiển thị là mức giá đó được quy đổi, không phải phần chênh lệch của nhà bán lại.

Cặp này thực sự dùng để làm gì
Hãy chọn Tencent HY4 Preview cho khối lượng lớn, cho các pipeline chỉ văn bản do bạn kiểm soát, cho bất cứ thứ gì cần chạy trên phần cứng của riêng bạn, và cho bất kỳ khối lượng công việc nào mà câu trả lời sai có thể bị phát hiện và thử lại — mức giá khiến việc thử lại trở thành đòn bẩy chất lượng rẻ nhất mà bạn có. Hãy chọn GPT-6 Sol khi đầu vào là hình ảnh hoặc tệp, khi một phản hồi phải mang hơn 64.000 token, hoặc khi câu trả lời sẽ đến tay một người sẽ hành động dựa trên đó mà không kiểm tra lại. Hãy dùng cả hai nếu lưu lượng của bạn chứa một ít mỗi loại, điều mà gần như chắc chắn là có.
Hai bước kiểm tra cuối. HY4 Preview vẫn được dán nhãn là bản xem trước và vẫn là mô hình Tencent mới nhất trong danh mục của chúng tôi, nên tên gọi này là chính xác chứ không lỗi thời — nhưng một bản xem trước có thể thay đổi ngay bên dưới bạn, và một checkpoint được cấp phép thoáng có thể bị bản phát hành chính thức của chính nó thay thế mà không báo trước. Và GPT-6 Sol đã bị GPT-6.1 Sol thay thế ở mức giá ngữ cảnh ngắn y hệt, với đầu vào được cache giảm một nửa từ $0.20 xuống $0.10, trong khi trang mô hình của chính OpenAI hiện đang hướng người đọc đến đó. Nếu lý do bạn đang cân nhắc Sol thay vì mô hình Tencent là tích hợp đã tám ngày tuổi, thì điều đó vẫn đúng. Nếu là năng lực, thì bản kế nhiệm là thứ bạn nên định giá.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
