
GPT-6 Astra vs Qwen3.8-Max: Hai mô hình chủ lực tác nhân và các điều khoản nhỏ kèm theo mỗi mô hình.
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Tháng 9 năm 2026 có hai câu chuyện về các “mô hình chủ lực tác nhân”, và GPT-6 Astra cùng Qwen3.8-Max đều là nhân vật chính trong cả hai. OpenAI phát hành GPT-6 Astra vào ngày 3 tháng 9, coi đây là mô hình tốt nhất thế giới cho việc sử dụng máy tính, kỹ thuật phần mềm, khoa học và an ninh mạng; còn Qwen3.8-Max của Alibaba, ra mắt từ ngày 3 tháng 8, là mô hình chủ lực tác nhân của phòng thí nghiệm Trung Quốc mạnh nhất — mô hình mà Artificial Analysis xếp vào nhóm dẫn đầu ngành trên chỉ số tác nhân của họ và là đối thủ gần nhất từ hệ sinh thái mở trước những tuyên bố về khả năng làm việc tự chủ của các mô hình tiên phong. Cả hai đều thực sự mạnh, và cả hai đều được tiếp thị với những con số nổi bật nhưng teo lại khi bị soi kỹ: kết quả ARC-AGI-3 99,9% của OpenAI tụt xuống còn 62,7% khi ARC Prize chạy bộ kiểm thử trung lập của riêng họ, còn sự xuất sắc về mặt tác nhân của Qwen3.8-Max đi kèm với một sự suy giảm về khả năng chống ảo giác được đo lường độc lập và thói quen tiêu tốn 64 lượt và hơn một đô la cho những tác vụ mà phiên bản tiền nhiệm hoàn thành trong 14 lượt. Đây là một sự so sánh giữa hai mô hình — và giữa hai cách đọc một benchmark.
Hai tiêu đề
Lời giới thiệu của OpenAI cho GPT-6 Astra là chiều rộng cộng với tính tự chủ: một mô hình duy nhất điều khiển trình duyệt, viết và sửa mã, chạy phân tích khoa học, và — điểm độc đáo — tìm ra các lỗ hổng bảo mật mới đủ tốt đến mức OpenAI xếp toàn bộ mô hình ở mức "nghiêm trọng" theo Khung Chuẩn bị Sẵn sàng của họ và giới hạn các thiết lập mạnh nhất cho các đối tác đã được thẩm định. Tài liệu ra mắt công bố điểm tuyệt đối 100% trên ExploitBench, 97,6% trên FrontierMath Tier 4, 96,0% trên GPQA Diamond, và điểm bão hòa ARC-AGI-3. Lời giới thiệu của Alibaba cho Qwen3.8-Max hẹp hơn nhưng sắc bén: một cỗ máy tác tử (agentic) hoạt động hiệu quả với giá $2/$6, đạt điểm số ở mức hoặc gần mức cao nhất trong các bài đánh giá tác tử độc lập, với trọng số nền tảng được công bố (theo một giấy phép tùy chỉnh) thay vì bị khóa trong một hộp đen.
Bảng điểm độc lập nói gì
Artificial Analysis hiện chấm GPT-6 Astra (max) đạt Intelligence 61 — xếp hạng 8 trong số 202 mô hình mà nền tảng này theo dõi — còn Qwen3.8-Max đạt Intelligence 58, xếp hạng 24. Khoảng cách ba điểm đó nhỏ hơn khoảng cách về giá và nhỏ hơn cả những lời tiếp thị của từng nhà cung cấp; trên chỉ số agentic riêng của AA, Qwen3.8-Max đạt 58, ngang hàng với các mô hình độc quyền tốt nhất, trong khi AA vẫn chưa công bố chỉ số agentic nào cho GPT-6 Astra. Cách đọc trung thực: xét riêng về trí thông minh đo lường thuần túy, hai mô hình này rất sát nhau, và cách gọi "mô hình thông minh nhất thế giới" trong tài liệu ra mắt của OpenAI không phản ánh những gì đánh giá độc lập của AA cho thấy.
• Trí tuệ — GPT-6 Astra (max): AA Intelligence 61, xếp hạng #8/202. Qwen3.8-Max: AA Intelligence 58, xếp hạng #24/202; AA Agentic 58.
• Giá niêm yết — GPT-6 Astra: $10.00 / $50.00 trên 1M, $1.00 đọc cache, gấp 2 lần cho phần đầu vào vượt quá 272K token. Qwen3.8-Max: $2.00 / $6.00 trên 1M, $0.25 đọc cache.
• Ngữ cảnh / đầu ra — GPT-6 Astra: 1.05M vào / 128K ra. Qwen3.8-Max: 1M vào / ~128K ra.
• Bằng chứng tác nhân — GPT-6 Astra: ARC-AGI-3 99.9% (bộ kiểm thử OpenAI) so với 62.7% (bộ kiểm thử tiêu chuẩn ARC Prize); WANDR 0.682 @ $11.98/nhiệm vụ (theo báo cáo của Perplexity). Qwen3.8-Max: AA GDPval 1,739 Elo ở 64 lượt/nhiệm vụ (~$1.14/nhiệm vụ); Code Arena WebDev #1 với 1,691 Elo.
• Các dấu hiệu cảnh báo độc lập — GPT-6 Astra: chưa có trong bộ chọn của ChatGPT, API triển khai theo giai đoạn, nhượng bộ về khả năng giám sát. Qwen3.8-Max: thoái lui về chỉ số ảo giác AA-Omniscience từ 23% lên 40% so với thế hệ trước.
• Trọng số — GPT-6 Astra: độc quyền. Qwen3.8-Max: checkpoint hạng Max (Qwen3.8-2.4T-A95B) được công khai theo giấy phép tùy chỉnh kể từ ngày 12 tháng 8; AA vẫn liệt kê mô hình flagship được lưu trữ là thuộc sở hữu độc quyền.

Chữ in nhỏ, có chú giải
Trước tiên, hãy xem con số ARC-AGI-3, vì đây là ví dụ rõ ràng nhất về việc một con số có thể vừa đúng vừa gây hiểu lầm. OpenAI báo cáo 99.9% cho GPT-6 Astra trên bộ khung đánh giá với bộ điều hợp riêng của nhà cung cấp — một thiết lập được tinh chỉnh cho mô hình. ARC Prize, tổ chức duy trì chuẩn đánh giá này, đã chạy GPT-6 Astra trên bộ khung chuẩn trung lập với nhà cung cấp và đo được 62.7%. Cả hai đều là thành tựu hiện đại nhất; nhưng không con số nào đạt 99.9% trên một bộ khung mà nhà sản xuất mô hình không kiểm soát. Lưu ý tương tự cũng áp dụng cho điểm WANDR 0.682 của Perplexity — mức cao nhất Perplexity từng ghi nhận, nhưng được đo bởi một công ty đồng thời đang tích hợp GPT-6 Astra vào sản phẩm của chính mình, nên nó mang theo lợi ích thương mại. Hình mẫu này đáng được nêu tên: những con số ngoạn mục nhất của OpenAI đều đến từ các bộ khung đánh giá do OpenAI hoặc các đối tác của họ kiểm soát, và con số hoàn toàn độc lập duy nhất — điểm Intelligence 61 của AA — chỉ đơn giản là xuất sắc.
Phần chữ in nhỏ của Qwen3.8-Max lại đi theo hướng ngược lại: điểm mạnh của nó được đo lường độc lập, và điểm yếu của nó cũng được đo lường độc lập. Điểm GDPval 1.739 Elo là xác thực — nhưng các lần chạy của Artificial Analysis cho thấy Qwen3.8-Max đạt được nó bằng cách tiêu tốn 64 lượt và khoảng 1,14 USD mỗi tác vụ, so với 14 lượt và 0,53 USD của thế hệ trước. Đó là một khoản thuế nỗ lực: mô hình mua trần năng lực tác nhân của mình bằng token suy luận, điều này có ý nghĩa với bất kỳ ai trả phí theo token. Còn đánh giá Omniscience của AA đo được mức suy thoái ảo giác từ 23% lên 40% so với thế hệ Qwen trước — một dấu hiệu cảnh báo độc lập thực sự nhắm đúng vào những tác vụ tự động, đa bước mà ở đó một câu trả lời sai nhưng đầy tự tin là đắt giá nhất. Một mô hình tự thuyết phục mình đi vào sai lầm trong suốt 64 lượt thì không hẳn an toàn hơn để thả ra so với một mô hình mà nhà sản xuất của nó thừa nhận khả năng giám sát đã suy giảm.

Giá cả, triển khai, và cách lựa chọn trung thực
Về giá, không có gì phải bàn cãi: Qwen3.8-Max với giá $2.00 / $6.00 mỗi triệu token có giá đầu vào chỉ bằng một phần năm giá đầu vào của GPT-6 Astra và giá đầu ra chỉ bằng một phần tám giá đầu ra của mô hình này, với ngữ cảnh 1 triệu token mà không phải chịu mức phụ phí prompt dài của Astra. Về khả năng triển khai, Qwen3.8-Max còn có thêm lợi thế trong tuần này — nó đã có thể gọi được ngay hôm nay, và đang hoạt động trên OrcaRouter với giá niêm yết của Alibaba, được chuyển qua với mức chênh lệch 0% và có cơ chế tự động chuyển đổi dự phòng. GPT-6 Astra, vẫn đang được triển khai dần và chưa thể lựa chọn trong ChatGPT đối với hầu hết người dùng tính đến ngày 4 tháng 9, có thể truy cập qua API riêng của OpenAI và các marketplace đám mây lớn trong khi quyền truy cập đang được mở rộng. Cách làm thực tế cho một nhóm xây dựng các pipeline agentic là đặt khối lượng công việc lên mô hình bạn có thể gọi hôm nay, và xem mô hình còn lại như một điểm chuẩn để theo dõi. Nếu bạn muốn đánh giá các tuyên bố "agentic" thay vì tin vào chúng, lớp định tuyến chính là công cụ: Qwen3.8-Max, Kimi K3, Grok 4.6 và hơn 200 mô hình khác đều có thể truy cập được qua một khóa API duy nhất trên OrcaRouter, và DSL định tuyến có thể kết hợp nhiều mô hình trong số đó thành một lời gọi duy nhất — nhờ đó bạn có thể chạy bộ tác vụ của riêng mình trên các mô hình cạnh tranh và tự mình đọc kết quả thay vì phải lựa chọn giữa phần chữ in nhỏ của hai nhà cung cấp.
Hai câu hỏi mà cuộc đối đầu này liên tục đặt ra
Tại sao OpenAI công bố 99,9% trên ARC-AGI-3 trong khi ARC Prize đo được 62,7%? Vì đây không phải cùng một bài kiểm tra. Bộ khung điều hợp nhà cung cấp của OpenAI là một phiên bản của benchmark được cấu hình theo cách GPT-6 Astra được gọi trong vận hành thực tế; bộ khung chuẩn của ARC Prize là cấu hình trung lập được thiết kế để so sánh mọi mô hình một cách công bằng. Kết quả 62,7% là con số phản ánh đúng "điều gì xảy ra nếu tôi tự gọi mô hình này", và đó vẫn là điểm số tốt nhất mà ARC Prize từng ghi nhận trên bộ khung đó.
Qwen3.8-Max có trọng số mở không? Một phần, kèm theo một điều khoản hạn chế về giấy phép. Alibaba đã công bố checkpoint hạng Max Qwen3.8-2.4T-A95B vào ngày 12 tháng 8 theo một giấy phép tùy chỉnh — các trọng số có thể tải xuống, nhưng không mang tính mở kiểu Apache-2.0 như bản nhỏ hơn Qwen3.8-27B, và Artificial Analysis vẫn xếp mô hình chủ lực được lưu trữ là độc quyền. Nếu yêu cầu của bạn là "tôi có thể chạy đúng mô hình mình trả tiền" thì sự khác biệt đó rất quan trọng; nếu yêu cầu của bạn là "tôi có thể kiểm tra kiến trúc và tự lưu trữ một biến thể gần tương đương" thì Qwen3.8-Max đáp ứng được, còn GPT-6 Astra thì không.
Bài học rút ra
Hãy chọn GPT-6 Astra nếu bạn cần những việc cụ thể mà hiện tại chỉ riêng nó làm được — công việc an ninh tấn công, suy luận khoa học tiên phong, các tác vụ sử dụng máy tính tự chủ khó nhất — và tổ chức của bạn có thể vượt qua cổng kiểm soát lẫn chi trả nổi mức giá của nó. Hãy chọn Qwen3.8-Max nếu bạn muốn một mô hình agentic đẳng cấp cao thực sự có thể triển khai trong tuần này với giá $2/$6, với bộ trọng số như một lối thoát và một hiện tượng ảo giác tái phát mà giờ bạn đã biết cần kiểm tra. Bài học lớn hơn nằm ngay ở phần chữ in nhỏ: vào tháng 9/2026, hai mẫu chủ lực "agentic" dẫn đầu được bán kèm những con số nổi bật mà không nhà sản xuất nào kiểm soát trọn vẹn, và người mua lý trí sẽ đọc kỹ khung đánh giá, đếm số lượt tương tác, rồi tự chạy các tác vụ của mình trước khi chọn phe.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
