
GPT-6 Astra vs Tencent HY4 Preview: Một mô hình có dấu vết kiểm toán và mô hình kia có bảng điểm chuẩn
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Tencent HY4 Preview và GPT-6 Astralà hai con đường rẻ nhất để tiếp cận khả năng lập trình dạng tác tử ở mức gần tiên tiến nhất hiện có, nếu bạn đọc chính những con số do nhà cung cấp công bố, và cũng là hai mô hình khó so sánh nhất trong phân khúc đó nếu bạn đọc số liệu của bất kỳ ai khác. Tencent HY4 Preview được phát hành và mở mã nguồn vào ngày 28 tháng 8 năm 2026 theo giấy phép Apache 2.0, với mức giá $0.834 cho mỗi triệu token đầu vào và $2.501 cho mỗi triệu token đầu ra, kiến trúc mixture-of-experts 770 tỷ tham số, cửa sổ ngữ cảnh vượt mốc một triệu token và giới hạn đầu ra 64.000 token. GPT-6 Astra đã được cung cấp rộng rãi từ ngày 3 tháng 9 năm 2026 với mức giá $10.00 và $50.00, cửa sổ 1.050.000 token và đầu ra tối đa 128.000 token. Những điểm mạnh của Astra được hậu thuẫn bởi tám đánh giá độc lập đã công bố; còn điểm mạnh của HY4 Preview chỉ được hậu thuẫn bởi các lượt chạy thử terminal, gọi công cụ và đánh giá mù của chính Tencent, và không có gì khác. Sự bất đối xứng đó không có nghĩa là mô hình rẻ hơn yếu hơn. Nó có nghĩa là một trong hai phép so sánh này có thể kiểm chứng được, còn phép còn lại thì phải tin, và các quyết định thực tế vì thế cũng khác nhau.
Bản phát hành Apache 2.0 thực sự mang lại cho bạn điều gì
Giấy phép là phần của cuộc so tài này mà một bảng giá không thể diễn đạt được. Tencent HY4 Preview không phải là một bản giới thiệu được lưu trữ với thương hiệu trọng số mở — các trọng số có thể tải xuống từ Hugging Face, GitHub, ModelScope và GitCode, nghĩa là mô hình vẫn tồn tại bất chấp mọi quyết định của Tencent về mức giá của chính mình, endpoint của chính mình, hay sự quan tâm tiếp tục phục vụ nó.
• Kiến trúc — tổng cộng 770B tham số, 49B hoạt động trên mỗi token, 78 lớp, 256 chuyên gia định tuyến cùng một chuyên gia chia sẻ, và một lớp dự đoán đa token gốc dùng cho giải mã suy đoánbr /> • Đặc điểm phục vụ — 54,6 token đầu ra mỗi giây và thời gian trung vị đến token đầu tiên là 6,26 giây, được đo trên các tuyến của OrcaRouter trong cửa sổ bảy ngày trượtbr /> • Ngữ cảnh và giới hạn trần — cửa sổ 1.048.576 token so với mức đầu ra tối đa 64.000 tokenbr /> • Bề mặt đầu vào — chỉ văn bản; không hình ảnh, không tệp, không âm thanhbr /> • Kiểm soát suy luận — ba mức: cao, thấp và không, với mức cao là mặc định, kèm khuyến nghị lấy mẫu được ghi rõ là temperature 0,9 và top_p 1,0br /> • Độ tin cậy — tỉ lệ lỗi 2,8% trong cùng cửa sổ bảy ngày, so với 10,3% trên tuyến Astra
Cặp số cuối cùng đó là thứ có tính hành động cao nhất trên trang này, và đó là kiểu số liệu mà không nhà cung cấp nào công bố về mô hình của chính họ. Điểm benchmark độc lập của Astra cao hơn và tuyến của nó đã lỗi với khoảng một trong mười yêu cầu trong tuần qua, trong khi một mô hình không có điểm độc lập nào lại đang lỗi một trong ba mươi lăm yêu cầu. Không con số nào trong hai con số đó là phát biểu về chính các mô hình — tỷ lệ lỗi đo tuyến, các rate limit và hệ thống thượng nguồn, chứ không đo trọng số — nhưng chúng là những con số mà một hệ thống production thực sự trải nghiệm.

Nơi có thể đối chiếu số liệu của Tencent với số liệu của người khác
Xét theo những bằng chứng đã công bố, đây là một cơ hội thực sự khác thường: Astra và HY4 Preview đều có một con số Terminal-Bench 2.1, và chỉ một trong hai là do nhà cung cấp báo cáo.
• Terminal-Bench 2.1, vận hành một terminal thực — GPT-6 Astra 88.4, được đánh giá độc lập; Tencent HY4 Preview 85.4, do nhà cung cấp báo cáobr /> • Gọi công cụ — Astra 41.4 trên τ²-Banking, được đánh giá độc lập; HY4 Preview 74.1 trên Toolathlon-Verified, do nhà cung cấp báo cáo, trên một bài kiểm tra khácbr /> • Kỹ thuật phần mềm — HY4 Preview 64.3 trên DeepSWE, tăng từ 28.0 trên mô hình tiền nhiệm Hy3, do nhà cung cấp báo cáobr /> • Tác vụ agent — HY4 Preview 37.1 pass@1 trên APEX-Agents, do nhà cung cấp báo cáobr /> • Sở thích của con người — trung bình 2.99 trên 4.00 qua 203 tác vụ kỹ thuật được 163 chuyên gia chấm điểm, do nhà cung cấp thực hiện, so với GLM-5.3 ở mức 2.92 và Kimi K3 ở mức 2.94br /> • Chỉ số độc lập — GPT-6 Astra 54.7 trên Intelligence Index và 96.1 trên GPQA Diamond, do bên thứ ba; không có chỉ số tương đương cho HY4 Preview
Dòng Terminal-Bench là dòng đáng để bàn kỹ. Khoảng cách 3 điểm giữa một kết quả độc lập 88,4 và mức 85,4 do nhà cung cấp báo cáo nằm gọn trong phạm vi mà một harness khác, một scaffold khác hoặc một nhiệt độ lấy mẫu khác có thể tạo ra, nghĩa là cách đọc trung thực không phải là “Astra tốt hơn ba điểm” mà là “mô hình mở trọng số rẻ nhất trong phân khúc này đang tuyên bố ngang bằng, và tuyên bố đó ít nhất cũng có khả năng đúng.” Cách diễn đạt của chính Tencent là thận trọng ở điểm này: họ mô tả DeepSWE là “đang dần thu hẹp khoảng cách” thay vì đã khép lại nó, và tuyên bố ngang bằng rõ ràng duy nhất của họ — thế hòa ở Terminal-Bench với một mô hình đóng hàng đầu từ một nhà cung cấp khác — lại đúng là tuyên bố cần được đo lường lần thứ hai nhất.
Cũng có một thay đổi đáng biết, vì nó làm thay đổi bài toán kinh tế chứ không phải điểm số. Vào ngày 7 tháng 9 năm 2026, Tencent đã đưa một tối ưu hóa vào bản dựng xem trước trực tiếp, mà hãng cho biết sẽ cắt giảm số lượt suy luận và mức tiêu thụ token trên mỗi tác vụ đối với công việc phức tạp. Vì mô hình tính phí theo token, việc mỗi tác vụ hoàn thành tốn ít token hơn sẽ làm giảm chi phí của tác vụ đó, dù mức giá trên mỗi token không thay đổi. Quy mô của khoản tiết kiệm đó là kết quả đo lường của chính Tencent và chưa có ai ngoài Tencent tái lập được — nhưng cơ chế này là thật, và đó là lý do một bản xem trước phát hành hồi tháng 8 có thể rẻ hơn đáng kể khi vận hành vào tháng 10 so với những gì bài viết công bố ra mắt của nó gợi ý.
Mức trần 64.000 token là thông số quyết định việc triển khai
Nằm ở giữa bảng thông số kỹ thuật là ràng buộc gây ảnh hưởng đầu tiên, và đó không phải là chất lượng. {{1}}Đầu ra tối đa của HY4 Preview là 64.000 token so với 128.000 của Astra, trên một mô hình có mục đích được nêu rõ là agent lập trình và các chuỗi sử dụng công cụ dài.{{/1}} {{2}}Một tệp được tạo, một bản vá nhiều tệp, một báo cáo có cấu trúc dài — đây là những đầu ra chạm trần, và trong một lần chạy agent, thất bại không phải là một câu trả lời tệ hơn một chút, mà là một câu trả lời bị cắt cụt mà pipeline xung quanh phải phát hiện và xử lý.{{/2}}
Cả hai mô hình đều nhận đầu vào khoảng một triệu token, nên trường hợp đọc tài liệu thực sự là hòa. Khác biệt nằm hoàn toàn ở phía sinh, và đó là hệ số hai chứ không phải sai số làm tròn. Thêm vào đó là khác biệt về bề mặt đầu vào — Astra chấp nhận ảnh và tệp, HY4 Preview chỉ có văn bản — và bức tranh hiện ra là sự phân công lao động rõ ràng chứ không phải một bảng xếp hạng: mô hình trọng số mở dùng cho các vòng lặp agent nhận văn bản, xuất văn bản, nơi sản phẩm bàn giao là một lời gọi công cụ hoặc một diff, còn mô hình đóng dùng cho bất cứ việc gì phải nhìn vào thứ gì đó hoặc viết thứ gì đó dài.
Tốc độ đầu ra gấp 20× mang lại được những gì, từng dòng một
• Giá đầu vào — Tencent HY4 Preview $0,834 mỗi 1M so với GPT-6 Astra $10,00, khoảng 12×br /> • Giá đầu ra — HY4 Preview $2,501 mỗi 1M so với Astra $50,00, khoảng 20×br /> • Đầu vào đã cache — HY4 Preview $0,042 mỗi 1M so với Astra $1,00, khoảng 24×br /> • Mức giá cho yêu cầu dài — Astra định giá lại toàn bộ yêu cầu trên 272.000 token đầu vào thành $20,00 và $75,00; bảng giá của HY4 Preview không có mức tương đươngbr /> • Mức giá đầu vào thực tế trên một prompt 400.000 token — HY4 Preview không đổi ở mức $0,834 so với Astra $20,00, khoảng 24×br /> • Chi phí cho mỗi triệu token của vòng lặp agent thông thường, tỷ lệ đầu vào:đầu ra là 4:1 — HY4 Preview khoảng $1,17 so với Astra khoảng $18,00br /> • Chi phí cho một tháng 100 triệu token ở cùng tỷ lệ — HY4 Preview khoảng $117 so với Astra khoảng $1.800
Dòng đầu vào được lưu đệm là dòng có khả năng mở rộng kém nhất đối với phía đắt đỏ, bởi vì các vòng lặp agent gửi lại cùng một lời nhắc hệ thống và tiền tố hội thoại trong mỗi lượt. Ở mức $0.042 so với $1.00, các token rẻ nhất của một vòng lặp dài rẻ hơn 24 lần trên mô hình Tencent, và đây chính xác là loại khối lượng công việc mà một khác biệt nhỏ trên mỗi token cộng dồn nhanh nhất. Chi phí trên mỗi tác vụ, chỉ số có thể giải quyết dứt điểm chuyện này, hoàn toàn không được Tencent công bố — vì vậy cách duy nhất để có được con số thực sự quan trọng là chạy cả hai mô hình qua bộ tác vụ của riêng bạn và đọc đối tượng usage.

Những gì một router thêm vào ở đây, khi đã có các tỷ lệ lỗi trong tay
Cả hai mô hình đều có trong danh mục OrcaRouter — tencent/hy4-preview và openai/gpt-6-astra — phía sau một endpoint tương thích OpenAI, mỗi mô hình ở đúng mức giá niêm yết của nhà cung cấp, chuyển thẳng qua với 0% markup. Chi tiết cuối cùng đó quan trọng hơn ở cặp này so với hầu hết các cặp khác, bởi vì giá niêm yết của mô hình Tencent được công bố bằng nhân dân tệ: các con số đô la ở trên là mức giá đã quy đổi mà bạn thực sự thấy, không phải mức chênh lệch của nhà bán lại, và nếu Tencent thay đổi giá, thay đổi đó sẽ có hiệu lực ở đây ngay trong cùng ngày thay vì vào lần gia hạn hợp đồng tiếp theo.
DSL định tuyến chính là nơi hai mô hình không còn là những phương án thay thế cho nhau nữa. Quy tắc tự nhiên cho cặp này là leo thang theo đầu ra: gửi vòng lặp đến mô hình rẻ, và khi phản hồi trả về bị cắt cụt so với trần 64.000 token hoặc không vượt qua được bước kiểm tra schema của bạn, hãy thử lại bước đó với openai/gpt-6-astra, mô hình có dung lượng đầu ra gấp đôi. Chuyển đổi dự phòng tự động là nửa còn lại của lập luận, và điều đó chẳng hề mang tính lý thuyết khi một trong hai tuyến đường đã liên tục lỗi ở một trong mười yêu cầu suốt tuần qua — một phiên chạy agent dài bị ghim vào một mô hình duy nhất sẽ chết cùng toàn bộ ngữ cảnh tích lũy của nó, và cả hai mô hình này đều không đủ rẻ để bạn vô tình chạy lại từ đầu.

Điều gì sẽ thay đổi sự so sánh này?
Ba điều, theo thứ tự mức độ chúng sẽ làm thay đổi nó. Một đánh giá độc lập về HY4 — mô hình này đã công khai được sáu tuần, không có chỉ số của bên thứ ba, không có số liệu Terminal-Bench nào được tái lập và không có con số chi phí trên mỗi tác vụ, và đánh giá mù duy nhất do nhà cung cấp thực hiện là dữ liệu duy nhất về sở thích con người đang tồn tại. Một mức chi phí được công bố cho mỗi tác vụ đã hoàn thành đối với cả hai mô hình, thứ sẽ thay thế mọi tỷ lệ trong bài viết này bằng một con số. Và một quyết định của Tencent về suy luận của bên thứ ba, bởi vì trọng số Apache 2.0 có thể được bất kỳ ai phục vụ, và ngay khi các nhà cung cấp cạnh tranh triển khai HY4 Preview, mức giá ở phía rẻ hơn của so sánh này sẽ trở thành giá thị trường thay vì giá niêm yết.
Cho đến lúc đó, bản tóm tắt hữu dụng hẹp hơn bài đăng ra mắt của cả hai nhà cung cấp và trung thực hơn một bảng điểm: GPT-6 Astra là mô hình có các tuyên bố về năng lực đã được kiểm chứng, với trần đầu ra gấp đôi và một tuyến đã thất bại một trong mười yêu cầu. Tencent HY4 Preview là mô hình có các tuyên bố về năng lực chưa được kiểm chứng, với kiến trúc được công bố, giấy phép mở, giá bằng một phần ba và tỷ lệ lỗi thấp hơn nhiều trong cùng khoảng thời gian. Nếu công việc của bạn là đầu vào văn bản, đầu ra văn bản và nằm trong 64.000 token được tạo, thì mô hình rẻ hơn không phải là một sự thỏa hiệp — nó là câu trả lời đúng, và dấu vết kiểm toán là thứ duy nhất bạn đang đánh đổi.
Quy tắc tự nhiên cho cặp này là leo thang ở đầu ra: gửi vòng lặp tới model rẻ, và khi phản hồi trả về bị cắt cụt so với trần 64.000 token hoặc không vượt qua kiểm tra schema của bạn, hãy thử lại bước đó với openai/gpt-6-astra , model có dung lượng đầu ra gấp đôi.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
