Thẻ tiêu đề hero cho GPT-6 Astra so với Qwen3.8-Max, kèm phụ đề 'Hai flagship agentic và phần chữ in nhỏ bên dưới mỗi mẫu', các chip thống kê ghi 'AA Intelligence 61 so với 58', 'Giá niêm yết $10 / $50 so với $2 / $6' và 'ARC-AGI-3: 99.9% trên harness của nhà cung cấp so với 62.7% trên harness trung lập', chân trang ghi ngày ra mắt và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-6 Astra vs Qwen3.8-Max: Hai mô hình chủ lực tác nhân và các điều khoản nhỏ kèm theo mỗi mô hình.

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tháng 9 năm 2026 có hai câu chuyện về các “mô hình chủ lực tác nhân”, và GPT-6 Astra cùng Qwen3.8-Max đều là nhân vật chính trong cả hai. OpenAI phát hành GPT-6 Astra vào ngày 3 tháng 9, coi đây là mô hình tốt nhất thế giới cho việc sử dụng máy tính, kỹ thuật phần mềm, khoa học và an ninh mạng; còn Qwen3.8-Max của Alibaba, ra mắt từ ngày 3 tháng 8, là mô hình chủ lực tác nhân của phòng thí nghiệm Trung Quốc mạnh nhất — mô hình mà Artificial Analysis xếp vào nhóm dẫn đầu ngành trên chỉ số tác nhân của họ và là đối thủ gần nhất từ hệ sinh thái mở trước những tuyên bố về khả năng làm việc tự chủ của các mô hình tiên phong. Cả hai đều thực sự mạnh, và cả hai đều được tiếp thị với những con số nổi bật nhưng teo lại khi bị soi kỹ: kết quả ARC-AGI-3 99,9% của OpenAI tụt xuống còn 62,7% khi ARC Prize chạy bộ kiểm thử trung lập của riêng họ, còn sự xuất sắc về mặt tác nhân của Qwen3.8-Max đi kèm với một sự suy giảm về khả năng chống ảo giác được đo lường độc lập và thói quen tiêu tốn 64 lượt và hơn một đô la cho những tác vụ mà phiên bản tiền nhiệm hoàn thành trong 14 lượt. Đây là một sự so sánh giữa hai mô hình — và giữa hai cách đọc một benchmark.

Hai tiêu đề

Lời giới thiệu của OpenAI cho GPT-6 Astra là chiều rộng cộng với tính tự chủ: một mô hình duy nhất điều khiển trình duyệt, viết và sửa mã, chạy phân tích khoa học, và — điểm độc đáo — tìm ra các lỗ hổng bảo mật mới đủ tốt đến mức OpenAI xếp toàn bộ mô hình ở mức "nghiêm trọng" theo Khung Chuẩn bị Sẵn sàng của họ và giới hạn các thiết lập mạnh nhất cho các đối tác đã được thẩm định. Tài liệu ra mắt công bố điểm tuyệt đối 100% trên ExploitBench, 97,6% trên FrontierMath Tier 4, 96,0% trên GPQA Diamond, và điểm bão hòa ARC-AGI-3. Lời giới thiệu của Alibaba cho Qwen3.8-Max hẹp hơn nhưng sắc bén: một cỗ máy tác tử (agentic) hoạt động hiệu quả với giá $2/$6, đạt điểm số ở mức hoặc gần mức cao nhất trong các bài đánh giá tác tử độc lập, với trọng số nền tảng được công bố (theo một giấy phép tùy chỉnh) thay vì bị khóa trong một hộp đen.

Bảng điểm độc lập nói gì

Artificial Analysis hiện chấm GPT-6 Astra (max) đạt Intelligence 61 — xếp hạng 8 trong số 202 mô hình mà nền tảng này theo dõi — còn Qwen3.8-Max đạt Intelligence 58, xếp hạng 24. Khoảng cách ba điểm đó nhỏ hơn khoảng cách về giá và nhỏ hơn cả những lời tiếp thị của từng nhà cung cấp; trên chỉ số agentic riêng của AA, Qwen3.8-Max đạt 58, ngang hàng với các mô hình độc quyền tốt nhất, trong khi AA vẫn chưa công bố chỉ số agentic nào cho GPT-6 Astra. Cách đọc trung thực: xét riêng về trí thông minh đo lường thuần túy, hai mô hình này rất sát nhau, và cách gọi "mô hình thông minh nhất thế giới" trong tài liệu ra mắt của OpenAI không phản ánh những gì đánh giá độc lập của AA cho thấy.

Trí tuệ — GPT-6 Astra (max): AA Intelligence 61, xếp hạng #8/202. Qwen3.8-Max: AA Intelligence 58, xếp hạng #24/202; AA Agentic 58.

Giá niêm yết — GPT-6 Astra: $10.00 / $50.00 trên 1M, $1.00 đọc cache, gấp 2 lần cho phần đầu vào vượt quá 272K token. Qwen3.8-Max: $2.00 / $6.00 trên 1M, $0.25 đọc cache.

Ngữ cảnh / đầu ra — GPT-6 Astra: 1.05M vào / 128K ra. Qwen3.8-Max: 1M vào / ~128K ra.

Bằng chứng tác nhân — GPT-6 Astra: ARC-AGI-3 99.9% (bộ kiểm thử OpenAI) so với 62.7% (bộ kiểm thử tiêu chuẩn ARC Prize); WANDR 0.682 @ $11.98/nhiệm vụ (theo báo cáo của Perplexity). Qwen3.8-Max: AA GDPval 1,739 Elo ở 64 lượt/nhiệm vụ (~$1.14/nhiệm vụ); Code Arena WebDev #1 với 1,691 Elo.

Các dấu hiệu cảnh báo độc lập — GPT-6 Astra: chưa có trong bộ chọn của ChatGPT, API triển khai theo giai đoạn, nhượng bộ về khả năng giám sát. Qwen3.8-Max: thoái lui về chỉ số ảo giác AA-Omniscience từ 23% lên 40% so với thế hệ trước.

Trọng số — GPT-6 Astra: độc quyền. Qwen3.8-Max: checkpoint hạng Max (Qwen3.8-2.4T-A95B) được công khai theo giấy phép tùy chỉnh kể từ ngày 12 tháng 8; AA vẫn liệt kê mô hình flagship được lưu trữ là thuộc sở hữu độc quyền.

Two-column comparison scoreboard for GPT-6 Astra vs Qwen3.8-Max. GPT-6 Astra column: AA Intelligence 61 (#8 of 202), AA Agentic not yet published, list price $10.00/$50.00, context/output 1.05M/128K, headline score ARC-AGI-3 99.9% on OpenAI's provider-adapter harness, independent caveat 62.7% on ARC Prize's standard harness. Qwen3.8-Max column: AA Intelligence 58 (#24 of 202), AA Agentic 58, list price $2.00/$6.00, context/output 1M/~128K, headline score GDPval 1,739 Elo on Artificial Analysis runs, independent caveat hallucination regression from 23% to 40% per AA-Omniscience.

Chữ in nhỏ, có chú giải

Trước tiên, hãy xem con số ARC-AGI-3, vì đây là ví dụ rõ ràng nhất về việc một con số có thể vừa đúng vừa gây hiểu lầm. OpenAI báo cáo 99.9% cho GPT-6 Astra trên bộ khung đánh giá với bộ điều hợp riêng của nhà cung cấp — một thiết lập được tinh chỉnh cho mô hình. ARC Prize, tổ chức duy trì chuẩn đánh giá này, đã chạy GPT-6 Astra trên bộ khung chuẩn trung lập với nhà cung cấp và đo được 62.7%. Cả hai đều là thành tựu hiện đại nhất; nhưng không con số nào đạt 99.9% trên một bộ khung mà nhà sản xuất mô hình không kiểm soát. Lưu ý tương tự cũng áp dụng cho điểm WANDR 0.682 của Perplexity — mức cao nhất Perplexity từng ghi nhận, nhưng được đo bởi một công ty đồng thời đang tích hợp GPT-6 Astra vào sản phẩm của chính mình, nên nó mang theo lợi ích thương mại. Hình mẫu này đáng được nêu tên: những con số ngoạn mục nhất của OpenAI đều đến từ các bộ khung đánh giá do OpenAI hoặc các đối tác của họ kiểm soát, và con số hoàn toàn độc lập duy nhất — điểm Intelligence 61 của AA — chỉ đơn giản là xuất sắc.

Phần chữ in nhỏ của Qwen3.8-Max lại đi theo hướng ngược lại: điểm mạnh của nó được đo lường độc lập, và điểm yếu của nó cũng được đo lường độc lập. Điểm GDPval 1.739 Elo là xác thực — nhưng các lần chạy của Artificial Analysis cho thấy Qwen3.8-Max đạt được nó bằng cách tiêu tốn 64 lượt và khoảng 1,14 USD mỗi tác vụ, so với 14 lượt và 0,53 USD của thế hệ trước. Đó là một khoản thuế nỗ lực: mô hình mua trần năng lực tác nhân của mình bằng token suy luận, điều này có ý nghĩa với bất kỳ ai trả phí theo token. Còn đánh giá Omniscience của AA đo được mức suy thoái ảo giác từ 23% lên 40% so với thế hệ Qwen trước — một dấu hiệu cảnh báo độc lập thực sự nhắm đúng vào những tác vụ tự động, đa bước mà ở đó một câu trả lời sai nhưng đầy tự tin là đắt giá nhất. Một mô hình tự thuyết phục mình đi vào sai lầm trong suốt 64 lượt thì không hẳn an toàn hơn để thả ra so với một mô hình mà nhà sản xuất của nó thừa nhận khả năng giám sát đã suy giảm.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) showing an Intelligence Index of 61 ranked #8 of 202, Cost ranked #86 of 202 with $10.00 input and $50.00 output per million tokens and a 90% cache discount, a $1.67 cost per Intelligence Index task, and a summary describing the model as among the leaders in intelligence but expensive for its class.

Giá cả, triển khai, và cách lựa chọn trung thực

Về giá, không có gì phải bàn cãi: Qwen3.8-Max với giá $2.00 / $6.00 mỗi triệu token có giá đầu vào chỉ bằng một phần năm giá đầu vào của GPT-6 Astra và giá đầu ra chỉ bằng một phần tám giá đầu ra của mô hình này, với ngữ cảnh 1 triệu token mà không phải chịu mức phụ phí prompt dài của Astra. Về khả năng triển khai, Qwen3.8-Max còn có thêm lợi thế trong tuần này — nó đã có thể gọi được ngay hôm nay, và đang hoạt động trên OrcaRouter với giá niêm yết của Alibaba, được chuyển qua với mức chênh lệch 0% và có cơ chế tự động chuyển đổi dự phòng. GPT-6 Astra, vẫn đang được triển khai dần và chưa thể lựa chọn trong ChatGPT đối với hầu hết người dùng tính đến ngày 4 tháng 9, có thể truy cập qua API riêng của OpenAI và các marketplace đám mây lớn trong khi quyền truy cập đang được mở rộng. Cách làm thực tế cho một nhóm xây dựng các pipeline agentic là đặt khối lượng công việc lên mô hình bạn có thể gọi hôm nay, và xem mô hình còn lại như một điểm chuẩn để theo dõi. Nếu bạn muốn đánh giá các tuyên bố "agentic" thay vì tin vào chúng, lớp định tuyến chính là công cụ: Qwen3.8-Max, Kimi K3, Grok 4.6 và hơn 200 mô hình khác đều có thể truy cập được qua một khóa API duy nhất trên OrcaRouter, và DSL định tuyến có thể kết hợp nhiều mô hình trong số đó thành một lời gọi duy nhất — nhờ đó bạn có thể chạy bộ tác vụ của riêng mình trên các mô hình cạnh tranh và tự mình đọc kết quả thay vì phải lựa chọn giữa phần chữ in nhỏ của hai nhà cung cấp.

Hai câu hỏi mà cuộc đối đầu này liên tục đặt ra

Tại sao OpenAI công bố 99,9% trên ARC-AGI-3 trong khi ARC Prize đo được 62,7%? Vì đây không phải cùng một bài kiểm tra. Bộ khung điều hợp nhà cung cấp của OpenAI là một phiên bản của benchmark được cấu hình theo cách GPT-6 Astra được gọi trong vận hành thực tế; bộ khung chuẩn của ARC Prize là cấu hình trung lập được thiết kế để so sánh mọi mô hình một cách công bằng. Kết quả 62,7% là con số phản ánh đúng "điều gì xảy ra nếu tôi tự gọi mô hình này", và đó vẫn là điểm số tốt nhất mà ARC Prize từng ghi nhận trên bộ khung đó.

Qwen3.8-Max có trọng số mở không? Một phần, kèm theo một điều khoản hạn chế về giấy phép. Alibaba đã công bố checkpoint hạng Max Qwen3.8-2.4T-A95B vào ngày 12 tháng 8 theo một giấy phép tùy chỉnh — các trọng số có thể tải xuống, nhưng không mang tính mở kiểu Apache-2.0 như bản nhỏ hơn Qwen3.8-27B, và Artificial Analysis vẫn xếp mô hình chủ lực được lưu trữ là độc quyền. Nếu yêu cầu của bạn là "tôi có thể chạy đúng mô hình mình trả tiền" thì sự khác biệt đó rất quan trọng; nếu yêu cầu của bạn là "tôi có thể kiểm tra kiến trúc và tự lưu trữ một biến thể gần tương đương" thì Qwen3.8-Max đáp ứng được, còn GPT-6 Astra thì không.

Bài học rút ra

Hãy chọn GPT-6 Astra nếu bạn cần những việc cụ thể mà hiện tại chỉ riêng nó làm được — công việc an ninh tấn công, suy luận khoa học tiên phong, các tác vụ sử dụng máy tính tự chủ khó nhất — và tổ chức của bạn có thể vượt qua cổng kiểm soát lẫn chi trả nổi mức giá của nó. Hãy chọn Qwen3.8-Max nếu bạn muốn một mô hình agentic đẳng cấp cao thực sự có thể triển khai trong tuần này với giá $2/$6, với bộ trọng số như một lối thoát và một hiện tượng ảo giác tái phát mà giờ bạn đã biết cần kiểm tra. Bài học lớn hơn nằm ngay ở phần chữ in nhỏ: vào tháng 9/2026, hai mẫu chủ lực "agentic" dẫn đầu được bán kèm những con số nổi bật mà không nhà sản xuất nào kiểm soát trọn vẹn, và người mua lý trí sẽ đọc kỹ khung đánh giá, đếm số lượt tương tác, rồi tự chạy các tác vụ của mình trước khi chọn phe.

Screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing the $2.00 per 1M input and $6.00 per 1M output prices, and Alibaba listed as the provider with the model's flagship reasoning and agentic positioning.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày