
Đánh giá Qwen3.8-Max: Model đầu bảng 2,4 nghìn tỷ tham số của Alibaba với mức giá $2/$6 — Bản build 0902 đứng đầu Code Arena WebDev
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Alibaba Qwen đã giới thiệu trướcQwen3.8-Max tại Hội nghị AI Thế giới ở Thượng Hải vào ngày 19 tháng 7 năm 2026, và trong hai tuần, đây là mô hình được nhắc đến nhiều nhất mà không ai có thể thực sự định giá. Không có bảng giá, không có bảng benchmark, không có thẻ mô hình, không có giấy phép, và không có số lượng tham số hoạt động — chỉ có tiêu đề 2,4 nghìn tỷ tham số và tuyên bố rằng mô hình này "chỉ đứng sau Claude Fable 5."
Vào ngày 3 tháng 8 năm 2026, điều đó đã thay đổi. Qwen3.8-Max đã chính thức phát hành: bảng giá công bố ở mức 2 đô la mỗi triệu token đầu vào và 6 đô la mỗi triệu token đầu ra, một điểm cuối tương thích với OpenAI và DashScope, một bảng benchmark đầy đủ, và bộ trọng số mở được phát hành vào ngày 12 tháng 8. Một tuần sau, vào ngày 14 tháng 8, mô hình này đã hoạt động trên DigitalOcean Serverless Inference với tư cách là “đối tác ra mắt Ngày 0” của Alibaba — đám mây lớn đầu tiên của phương Tây phục vụ nó. Vào ngày 2 tháng 9, Alibaba đã phát hành một bản cập nhật có tên Qwen3.8-Max-0902, được tiếp tục hậu huấn luyện trên Coding và Cowork, mà Qwen cho biết giúp tăng cường hiệu suất cho các tác vụ doanh nghiệp và khoa học phức tạp. Bài đánh giá này được viết dựa trên các sự kiện GA, kết hợp cả buổi ra mắt ngày đầu tiên và bản dựng 0902, đồng thời trả lời câu hỏi mà các nhóm thực sự đặt ra khi mô hình đã có thể mua được: liệu Qwen3.8-Max đã sẵn sàng tiếp nhận lưu lượng sản xuất, hay vẫn chỉ là một mô hình để theo dõi?
Câu trả lời ngắn gọn là mô hình này đã tiến xa hơn nhiều so với hầu hết mọi người kỳ vọng — đặc biệt, mức giá rất quyết liệt theo cách định giá lại toàn bộ ranh giới công nghệ, và bản cập nhật ngày 2 tháng 9 nhấn mạnh gấp đôi vào hai điểm mà mô hình vốn đã rất mạnh — lập trình và làm việc cộng tác. Bảng đánh giá độc lập được công bố sau đó thực sự tốt, nhưng nó đi kèm một lưu ý đáng đọc trước khi bạn quyết định chuyển lưu lượng truy cập sang.
Tóm lại: Qwen3.8-Max đã chính thức phát hành (GA) với giá $2 / $6 cho mỗi 1 triệu token, đồng giá trên toàn bộ ngữ cảnh 1 triệu token và không tính phụ phí cho prompt dài — rẻ hơn Kimi K3 ($3/$15) và Claude Opus 5 ($5/$25) ở phần đầu ra, vốn là yếu tố quyết định chi phí cho các tác vụ suy luận. Alibaba công bố bảng benchmark rất ấn tượng (Terminal-Bench 2.1 86,6; GPQA Diamond 92,6; OSWorld-Verified 86,1), và mức tăng vọt về lập trình so với thế hệ trước thực sự đáng kể: FrontierSWE 73,5 so với 40,7. Nhưng bảng chất lượng đó là do chính Alibaba đưa ra, và trọng tài độc lập đầu tiên — Artificial Analysis Intelligence Index — đã lên tiếng: Qwen3.8-Max đạt 56 điểm với chi phí $1,14 mỗi tác vụ, ngang với Claude Opus 4.8 (56) và kém đúng 1 điểm so với Kimi K3 (57) — nhà dẫn đầu về mô hình open-weight — dù chi phí mỗi tác vụ cao hơn 25%. Số tham số kích hoạt không còn là ẩn số: 95B tham số được kích hoạt trong tổng số 2,4T, được xác nhận trên model card chính thức; điều này cuối cùng cho phép những người bên ngoài có thể tính toán được bài toán kinh tế vận hành (serving economics). Kể từ khi bài đánh giá này được đăng, một đường triển khai được quản lý thứ hai cũng đã mở ra: Qwen3.8-Max chính thức có mặt trên DigitalOcean Serverless Inference vào ngày 14 tháng 8 với vai trò đối tác Day 0 của Alibaba; số liệu vận hành do DigitalOcean công bố — prefill mở rộng tới ~16.000 token/giây và ~1.937 token đầu ra/giây ở 256 yêu cầu đồng thời mà không có lỗi nào — là dữ liệu độ trễ thực tế đầu tiên đến từ một nhà cung cấp không phải Alibaba. Ngày 2 tháng 9, Alibaba làm mới mô hình chủ lực thành Qwen3.8-Max-0902, tiếp tục được huấn luyện bổ sung (post-training) trên Coding và Cowork; Qwen cho biết bản mới mạnh hơn ở các khối lượng công việc doanh nghiệp và khoa học phức tạp — một tuyên bố từ phía nhà cung cấp, hiện chưa có số liệu độc lập nào cho mảng doanh nghiệp hay khoa học. Phần lập trình của bản 0902 giờ đã có kết quả từ một đấu trường độc lập của riêng mình: Qwen3.8-Max-0902 xuất hiện lần đầu ở vị trí #1 trên bảng xếp hạng Code Arena: WebDev với 1.691 điểm — cao hơn 22 điểm so với bản trước và vượt qua Claude Opus 5 lẫn Kimi K3 — theo Alibaba, dẫn nguồn từ bảng xếp hạng arena trực tuyến của bên thứ ba. Cũng trong tuần đó, câu chuyện thương mại agentic có thêm bảng điểm: trên CommerceAgentBench — benchmark mới của nhóm Accio thuộc Alibaba, được xây dựng dựa trên các bản sao có trạng thái (stateful) của phần mềm thương mại thực — Qwen3.8-Max đạt kết quả open-weight mạnh nhất: 156 lượt pass cộng dồn trên ba khung kiểm thử (harness), hơn DeepSeek V4 Pro 2 lượt — nhưng đây vẫn là bảng do chính nhà cung cấp vận hành, không phải trọng tài độc lập. Kết luận: đây thực sự là mô hình đáng mua ở thời điểm hiện tại, với mức giá đủ rẻ để xứng đáng được đánh giá thực tế — nhưng hãy định tuyến có chủ đích, chứ không dùng tràn lan.
Những điểm chính rút ra
• GA kể từ ngày 3 tháng 8 năm 2026. Kỷ nguyên chiến dịch xem trước và tín dụng đã kết thúc; có một bảng giá thực sự và một điểm cuối thực sự.
• $2 / $6 cho mỗi 1M token, một mức giá cố định duy nhất cho ngữ cảnh 1M. Hầu hết đối thủ tính phí thêm cho prompt dài. Alibaba thì không, điều này cực kỳ quan trọng cho công việc với tài liệu dài và kho mã nguồn lớn.
• Bảng benchmark của Alibaba rất mạnh nhưng chưa được kiểm toán: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.
• Bước nhảy vọt về thế hệ mã hóa chính là câu chuyện thực sự:FrontierSWE 73.5 (từ 40.7) và DeepSWE 1.1 56.6 (từ 21.6) — gần như tăng gấp đôi ở cả hai.
• Kết quả đánh giá độc lập đầu tiên đã có: Qwen3.8-Max đạt 56 điểm trên AA Intelligence Index với mức giá $1.14/tác vụ — cao hơn Qwen3.7-Max (46) tới 10 điểm, ngang bằng Claude Opus 4.8 (56) và kém Kimi K3 (57) đúng 1 điểm. Bảng xếp hạng chung của LMArena vẫn chưa có điểm số công khai.
Tham số kích hoạt được xác nhận ở mức 95B — thẻ mô hình chính thức ghi tổng 2.4T và 95B được kích hoạt, khép lại câu hỏi mở lớn nhất trong phép tính chi phí triển khai.
• {{1}}Trọng số mở đã ra mắt — Qwen3.8-2.4T-A95B (BF16) và Qwen3.8-2.4T-A95B-FP8 đã có mặt trên Hugging Face vào ngày 12 tháng 8{{/1}} {{2}}theo giấy phép Qwen3.8-Max tùy chỉnh, không phải Apache 2.0{{/2}}. {{3}}Phiên bản on-premise Qwen3.8-27B{{/3}} {{4}}được phát hành vào ngày 14 tháng 8{{/4}} {{5}}theo Apache 2.0{{/5}}.
• Một đường quản lý thứ hai đã được mở vào ngày 14 tháng 8.Qwen3.8-Max đã chính thức có mặt trên DigitalOcean Serverless Inference với vai trò "đối tác ra mắt ngay ngày đầu" của Alibaba — NVFP4 trên NVIDIA HGX B300, giá $2/$6 với $0.20 cho input được lưu cache, phục vụ ở ngữ cảnh 262K nguyên bản của checkpoint mở. Các số liệu đo được từ DigitalOcean (prefill ~16K token/giây, không có lỗi ở mức 256 luồng đồng thời) là dữ liệu hiệu suất phục vụ đầu tiên trên một nền tảng được quản lý bên ngoài Alibaba.
• Cập nhật ngày 2 tháng 9: Qwen3.8-Max-0902. Alibaba đã tiếp tục huấn luyện thêm mô hình chủ lực trên Coding và Cowork, đồng thời phục vụ nó trên QwenCloud với mức giá $2/$6 và ngữ cảnh 1M như trước. Qwen cho biết hiệu năng doanh nghiệp và khoa học mạnh hơn — vẫn là tuyên bố của nhà cung cấp — trong khi khía cạnh lập trình đã đạt được một kết quả arena độc lập cùng ngày: bản build ra mắt ở vị trí #1 trên Code Arena: WebDev với 1,691 (xem mục Code Arena bên dưới).
• CommerceAgentBench: mô hình trọng số mở dẫn đầu, do nhà cung cấp vận hành. Đội ngũ Accio của Alibaba đã phát hành CommerceAgentBench trong tuần này — 107 nhiệm vụ tầm xa trong các bản sao có trạng thái của phần mềm thương mại và doanh nghiệp thực, được chấm điểm dựa trên trạng thái trên các bộ khung Accio, OpenClaw và Pi. Qwen3.8-Max dẫn đầu các mô hình trọng số mở với 156 lượt vượt qua tổng hợp, hơn DeepSeek V4 Pro hai lượt; mô hình đóng Claude Opus 5 dẫn đầu toàn bộ với 191, và bảng xếp hạng là của riêng Alibaba, không phải một trọng tài độc lập.
• Code Arena: WebDev #1 — kết quả đấu trường độc lập của bản dựng 0902.Qwen3.8-Max-0902 ra mắt ở vị trí dẫn đầu bảng xếp hạng Code Arena: WebDev với 1.691 điểm — tăng 22 so với bản dựng trước và vượt qua Claude Opus 5 và Kimi K3 — đồng thời dẫn đầu đường biên Pareto về hiệu năng/chi phí của bảng xếp hạng này ở mức giá hỗn hợp ~$5/MToken, khoảng một phần tư mức giá hỗn hợp của Claude Opus 5. Tài khoản QwenCloud chính thức của Qwen xác nhận thứ hạng này. Không giống như CommerceAgentBench, bảng xếp hạng này do bên thứ ba vận hành: một đấu trường bỏ phiếu mù của con người, không phải bảng số liệu của Alibaba, mặc dù 'ra mắt ở vị trí #1' là thông báo của Alibaba về thứ hạng tại một thời điểm cụ thể.
Ghi chú về độ chính xác: bảng benchmark Qwen3.8-Max trong bài đánh giá này là số liệu do Alibaba công bố và chưa được tái lập một cách độc lập. Điểm Chỉ số Trí tuệ Artificial Analysis (56 ở mức $1.14/tác vụ) do AA đo lường độc lập trên API chính thức của Alibaba — đây là đơn vị thẩm định độc lập đầu tiên của mô hình. Giá được lấy từ biểu giá GA (General Availability) của Alibaba Model Studio. Các kho lưu trữ trọng số mở (Qwen3.8-2.4T-A95B và Qwen3.8-2.4T-A95B-FP8), con số 95B tham số hoạt động, và văn bản giấy phép đều là dữ liệu từ chính nhà cung cấp: chúng đến từ tổ chức Hugging Face của Qwen, được xác minh vào ngày 13 tháng 8 năm 2026. Tính khả dụng trên DigitalOcean, biểu giá của nền tảng này, các phép đo hiệu năng serving, và kết quả kiểm tra chọn lọc GPQA đạt 88 trên bản dựng lượng tử hóa đều đến từ tài liệu chính thức và bài hướng dẫn cộng đồng của DigitalOcean, được công bố cùng với thông báo ngày 14 tháng 8; cách gọi “Day 0 launch partner” là ngôn ngữ trong thông báo của Alibaba. Khi chúng tôi trích dẫn số liệu của đối thủ cạnh tranh, chúng đến từ Artificial Analysis hoặc từ nhà cung cấp được nêu tên trực tiếp trong bài. Bản cập nhật Qwen3.8-Max-0902 công bố ngày 2 tháng 9 hoàn toàn dựa trên thông tin do nhà cung cấp công bố: các thông số kỹ thuật, mô tả giai đoạn hậu huấn luyện Coding-and-Cowork, và các lợi ích về doanh nghiệp và khoa học được công bố đều đến từ thông báo của Qwen và trang mô hình QwenCloud của họ, và không con số nào trong số đó được tái lập một cách độc lập. Vị trí Code Arena: WebDev được đề cập trong phần benchmark là một ngoại lệ duy nhất: bảng xếp hạng đó là một đấu trường bỏ phiếu kín của bên thứ ba chứ không phải bảng xếp hạng của Alibaba — mặc dù việc “ra mắt ở vị trí #1 với 1.691 điểm” là thông báo của Alibaba về một danh sách tại một thời điểm cụ thể, và điểm số đấu trường vẫn tiếp tục thay đổi khi phiếu bầu tăng dần. Kết quả CommerceAgentBench được đề cập bên dưới cũng thuộc cùng hạng mục: benchmark này được xây dựng và công bố bởi Accio, nhóm của Alibaba International, vì vậy các bảng số liệu của nó là do Alibaba công bố — một benchmark mã nguồn mở, nhưng không phải là một đơn vị thẩm định độc lập theo cách Artificial Analysis đóng vai trò như vậy. Theo nguyên tắc chung, các bảng benchmark của nhà cung cấp thường có xu hướng lạc quan — hãy coi chúng là một giả thuyết cần kiểm chứng trên khối lượng công việc của riêng bạn, chứ không phải một thứ hạng đã ngã ngũ.

Qwen3.8-Max là gì?
Qwen3.8-Max là mẫu hàng đầu trong gia đình Qwen của Alibaba: một mô hình MoE (Mixture-of-Experts) thưa với tổng cộng 2,4 nghìn tỷ tham số, ngữ cảnh 1 triệu token và hỗ trợ đa phương thức gốc. Mô hình chấp nhận văn bản, hình ảnh và video, đồng thời trả về văn bản. Mô hình hỗ trợ chế độ suy luận (thinking mode), gọi hàm, công cụ tích hợp sẵn và đầu ra có cấu trúc, đồng thời được phục vụ qua endpoint tương thích OpenAI /v1/chat/completions, nghĩa là hầu hết các hệ thống tích hợp hiện có chỉ cần thay đổi base-URL chứ không cần viết lại. Bản snapshot sản xuất hiện tại, phát hành ngày 2 tháng 9, là Qwen3.8-Max-0902, được tiếp tục huấn luyện thêm trên Coding và Cowork.
Các số liệu ngữ cảnh thực tế cụ thể hơn một chút so với con số tiếp thị "1M." Siêu dữ liệu đám mây của Alibaba liệt kê một cửa sổ 983.616 token với chế độ suy luận được bật, đầu vào tối đa khoảng 991K token và một đầu ra tối đa 131.072 token. Mức trần đầu ra đó hào phóng một cách bất thường và quan trọng đối với các tác vụ như tạo mã toàn tệp hoặc soạn thảo báo cáo dài, nơi các mức trần thấp hơn buộc bạn phải chia nhỏ và nối lại. Checkpoint mở mà DigitalOcean hiện phục vụ là một cấu hình khác: thẻ mô hình của nó liệt kê 262.144 token gốc, có thể mở rộng tới khoảng 1.010.000, vì vậy dịch vụ bên thứ ba chạy nền tảng mở sẽ thường đạt ở con số gốc nhỏ hơn.
Số lượng tham số kích hoạt hiện đã được công khai, và con số đó được ghi ngay trong tên repository: A95B nghĩa là 95 tỷ tham số được kích hoạt. Thẻ mô hình chính thức của Qwen3.8-2.4T-A95B ghi rõ "tổng 2,4T và 95B kích hoạt" — một mô hình Mixture-of-Experts dạng hạt mịn với 512 expert, trong đó mỗi token kích hoạt 10 expert định tuyến cộng 1 expert dùng chung. Con số này quan trọng hơn con số 2,4T gây chú ý trên tiêu đề. Với mô hình dense, tổng tham số cho bạn biết gần đúng chi phí suy luận; còn với mô hình MoE, tổng tham số gần như không nói lên điều gì — chỉ số lượng kích hoạt mới có ý nghĩa, vì đó mới là phần thực sự chạy trên mỗi token. Mô hình 2,4T kích hoạt 30B sẽ hành xử hoàn toàn khác, cả về độ trễ lẫn chi phí phục vụ, so với mô hình kích hoạt 200B. Với 95B kích hoạt, chi phí tính toán mỗi token tương đương mô hình dense ở mốc 90B — chỉ là một phần nhỏ so với những gì mô hình dense 2,4T đòi hỏi — và chính con số này cuối cùng giúp câu hỏi về self-hosting bên dưới có thể được trả lời.
Bản cập nhật ngày 2 tháng 9: Qwen3.8-Max-0902
Ngày 2 tháng 9 năm 2026, Qwen đã phát hành bản refresh sản xuất chính thức đầu tiên có tên gọi riêng. Qwen3.8-Max-0902 giữ nguyên kiến trúc sparse-MoE 2,4 nghìn tỷ tham số, 95 tỷ tham số hoạt động và cửa sổ ngữ cảnh 1 triệu token, nhưng đã được post-training thêm trên hai năng lực — Coding và Cowork — và hiện có mặt trên API của QwenCloud với mã qwen3.8-max-0902 (cũng được liệt kê là qwen3.8-max-2026-09-02). Đây là bản build được khuyến nghị hiện tại chứ không phải một nhánh phụ: endpoint qwen3.8-max không ghi ngày của Alibaba hiện phục vụ snapshot 0902, nên gọi theo tên model chuẩn sẽ nhận về bản refresh, trong khi mã định danh có ghi ngày dành cho các đội cần cố định chính xác bản build. Từ ngày 3 tháng 9, snapshot này cũng được niêm yết dưới dạng một model id định tuyến riêng trên các API do bên thứ ba quản lý. Bảng giá không thay đổi: 2 USD cho mỗi 1 triệu token đầu vào, 6 USD cho mỗi 1 triệu token đầu ra, cùng các mức giá cache không đổi.
Các tuyên bố về hiệu suất là của Qwen. Thông báo và trang mô hình QwenCloud mô tả khả năng Coding "tạo ra bước đột phá" trên các dự án quy mô kỹ thuật và phát triển tự trị dài hạn, trải nghiệm tác tử cộng tác "được cải thiện đáng kể" trong khả năng điều phối đa công cụ và hoàn thành tác vụ từ đầu đến cuối, và — như công ty phát biểu — hiệu suất mạnh hơn trên các tác vụ doanh nghiệp phức tạp, nghiên cứu khoa học và quy trình làm việc vòng đời dài. Kiểm tra độc lập đầu tiên được công bố ngay trong ngày. Qwen3.8-Max-0902 ra mắt ở vị trí số 1 trên bảng xếp hạng Code Arena: WebDev — một đấu trường bỏ phiếu kín của bên thứ ba cho phát triển web dựa trên tác tử, dự án trước đây có tên WebDev Arena — với 1.691 điểm, tăng 22 điểm so với bản trước và vượt qua Claude Opus 5 và Kimi K3, theo Alibaba trích dẫn bảng xếp hạng trực tiếp — vị trí mà tài khoản chính thức của Qwen xác nhận cùng ngày, chỉ dẫn đến API QwenCloud. Những gì kết quả đó chứng minh và không chứng minh được sẽ được phân tích trong phần điểm chuẩn bên dưới. Các tuyên bố còn lại của bản cập nhật — lý luận doanh nghiệp, công việc khoa học và khả năng tự trị dài hạn nói chung — vẫn chỉ do nhà cung cấp công bố, vì vậy hãy giữ kỷ luật như đã áp dụng với bảng tháng Tám: coi những tuyên bố đó là giả thuyết cho đến khi một đợt đánh giá của Artificial Analysis hoặc một khối lượng công việc thực tế xác nhận chúng.
Điều khiến bản cập nhật lần này trở nên thú vị chính là ý nghĩa thực tiễn của {{1}}Cowork{{/1}}. Ngay từ thời GA, Qwen3.8-Max đã dựa nhiều vào khả năng tự chủ tầm xa — {{2}}quá trình xây dựng oh-my-cli trong 16 ngày{{/2}}, {{3}}phiên doanh nghiệp ảo hơn 2.000 vòng{{/3}} — còn {{4}}bản build 0902{{/4}} cho thấy Alibaba đang dồn thêm sức vào trục năng lực đó: các agent điều phối nhiều công cụ và hoàn thành trọn vẹn một tác vụ từ đầu đến cuối, thay vì chỉ đưa ra câu trả lời một lượt. Cùng tuần đó, nhóm Accio của Alibaba đã công bố {{5}}CommerceAgentBench{{/5}}, một bộ benchmark được thiết kế để đo trực tiếp trục năng lực này: {{6}}107 tác vụ tầm xa{{/6}} bên trong các bản sao có trạng thái của phần mềm thương mại và doanh nghiệp thực tế, nơi {{7}}Qwen3.8-Max{{/7}} dẫn đầu trong nhóm mô hình open-weight — chi tiết có trong phần benchmark bên dưới. Với những đội ngũ đang đánh giá mô hình này cho các ứng dụng doanh nghiệp, đó chính là tuyên bố cần kiểm chứng trước tiên, vì cũng là điều khó xác minh nhất chỉ từ một bảng benchmark.
Định giá: điều quyết liệt nhất trong đợt ra mắt này
Alibaba Model Studio niêm yết Qwen3.8-Max với mức giá $2.00 cho mỗi 1M token đầu vào và $6.00 cho mỗi 1M token đầu ra. Đầu ra bao gồm token tư duy, điều này quan trọng vì các cấu hình nặng về suy luận tính phí quá trình suy luận nội bộ của chúng theo mức giá đầu ra. Cơ chế giá cache: các lần truy cập trúng cache có giá $0.25 cho mỗi 1M, việc tạo cache tường minh có giá $2.50, và việc đọc cache tường minh có giá $0.17.
Phần đáng chú ý về mặt cấu trúc không phải là con số nổi bật, mà là mức giá phẳng. Alibaba tính phí cố định $2/$6 dù prompt của bạn là 5.000 token hay 900.000 token. Hầu hết các đối thủ đều áp dụng phụ phí cho ngữ cảnh dài chính xác vì việc phục vụ một prompt gần một triệu token rất tốn kém. Việc Alibaba tự hấp thụ chi phí đó là một động thái chiếm lĩnh thị trường có chủ đích, nhắm thẳng vào những khối lượng công việc mà ngữ cảnh dài là điểm cốt lõi: đánh giá mã nguồn toàn bộ kho, phân tích hợp đồng và hồ sơ, tổng hợp nghiên cứu đa tài liệu.
Ví dụ minh họa. Giả sử bạn chạy một tác nhân phân tích repo: 200.000 token đầu vào của ngữ cảnh mã và 8.000 token đầu ra cho mỗi lần gọi.
• Mỗi lần gọi: 0.2M × $2 = $0.40 đầu vào, cộng 0.008M × $6 = $0.048 đầu ra. ≈ $0.45 mỗi lần gọi.
• Với 1.000 cuộc gọi/ngày: ≈ $448/ngày, hoặc khoảng $13.400/tháng.
• Cùng một lệnh gọi với Claude Opus 5 ở mức $5/$25: $1.00 + $0.20 = $1.20 — đắt hơn khoảng 2.7 lần.
• Với prompt caching trong ngữ cảnh mã ổn định, đầu vào được lưu trong bộ nhớ đệm ở mức $0.25 làm giảm chi phí đầu vào từ $0.40 xuống $0.05, đưa chi phí cuộc gọi xuống còn ≈ $0.10 — mức giảm gần 4.5× đối với lưu lượng lặp lại.
Chênh lệch cache đó chính là nơi ngân sách thực sự nằm. Nếu agent của bạn đọc lại một ngữ cảnh gần như không thay đổi trong mỗi lượt — điều mô tả đúng hầu hết các agent lập trình và hỗ trợ — thì mức giá thực tế sẽ gần với $0.25/$6 hơn nhiều so với $2/$6. Các đội ngũ bỏ qua cấu hình cache thường trả cao hơn 3–4 lần cho mô hình này.
Để so sánh theo giá niêm yết: Qwen3.8-Max $2/$6; phiên bản tiền nhiệm của chính nó Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. Về đầu vào, Qwen chỉ ở mức cạnh tranh. Về đầu ra — phía chiếm phần lớn chi tiêu trong các tác vụ suy luận và tác nhân — nó là mô hình tự nhận là tiên phong rẻ nhất trong danh sách đó.
Phép đo độc lập của Artificial Analysis phơi bày mặt trái của những token giá rẻ đó. Trên Chỉ số Thông minh của mình, Qwen3.8-Max có giá $1.14 mỗi tác vụ — hơn gấp đôi mức $0.53 của phiên bản tiền nhiệm, và cao hơn 25% so với mức $0.86 của Kimi K3 mặc dù Kimi K3 niêm yết ở mức $3/$15 mỗi token. Khoảng cách này là về hành vi, không phải tăng giá: mô hình đạt trung bình 64 bước mỗi tác vụ GDPval-AA so với 14 của Qwen3.7-Max, và vì bộ khung thử nghiệm gửi lại toàn bộ hội thoại ở mỗi bước, số token đầu vào tăng gần 15 lần và đầu ra ~45%. Token giá rẻ không đồng nghĩa với agent giá rẻ — sự dài dòng mà những người thử nghiệm bản xem trước đã chỉ ra giờ đây có một mức giá được đo đếm. Bởi vì OrcaRouter chuyển tiếp giá niêm yết với mức phụ phí 0% thông qua một điểm cuối tương thích OpenAI, câu hỏi $1.14-so-với-$0.86 đó là thứ bạn có thể đo trên các prompt giống hệt nhau mà không cần một hợp đồng thứ hai.

Bảng benchmark và ý nghĩa thực tế của từng con số đo lường.
Tại GA, Alibaba đã công bố bảng số liệu mà họ đã giữ lại trong bản xem trước. Điểm số được báo cáo:
• Terminal-Bench 2.1 — 86.6. Đo lường liệu một mô hình có thể vận hành một shell thực sự đến khi hoàn thành: chạy lệnh, đọc đầu ra, phục hồi sau lỗi. Đây là thước đo gần nhất cho việc "liệu nó có thể hoạt động như một tác nhân lập trình thay vì một công cụ gợi ý mã hay không".
• GPQA Diamond — 92,6.Các câu hỏi vật lý, hóa học và sinh học ở cấp độ sau đại học được thiết kế để chống lại việc tra cứu thông tin. Điểm số cao cho thấy khả năng suy luận khoa học thực sự chứ không phải ghi nhớ. 92,6 đứng đầu trong lĩnh vực hiện tại.
• PaperBench — 93.0. Tái tạo kết quả từ các bài nghiên cứu — đọc phương pháp luận và triển khai lại. Thưởng cho khả năng hiểu sâu đa bước liên tục.
• IFBench — 82.8. Tuân thủ chỉ dẫn trong điều kiện ràng buộc: định dạng, độ dài và chỉ dẫn phủ định. Đáng chú ý, đây là điểm thấp nhất trong bảng của chính Alibaba, phù hợp với lời phàn nàn từ thời kỳ xem trước rằng mô hình kỹ lưỡng đến mức bỏ qua giới hạn phạm vi.
• OSWorld-Verified — 86.1. Sử dụng máy tính: điều khiển giao diện đồ họa (GUI) thực tế trên máy tính để bàn nhằm hoàn thành tác vụ. Điểm mạnh này củng cố định vị tác nhân.
• OmniDocBench 1.5 — 92.1.Phân tích tài liệu — bảng biểu, bố cục, văn bản và hình ảnh kết hợp. Kết hợp với ngữ cảnh 1M để tạo nên một trường hợp thực tế cho các quy trình xử lý tài liệu.
• FrontierSWE — 73.5, tăng so với 40.7 của phiên bản tiền nhiệm. DeepSWE 1.1 — 56.6, tăng so với 21.6.
Hai điểm cuối đó đáng được nhấn mạnh. Việc gần như tăng gấp đôi hiệu suất trên các chuẩn đánh giá kỹ thuật phần mềm khó chỉ trong một thế hệ không phải là những cải thiện gia tăng thông thường, và điều này nhất quán với quyết định của Alibaba khi tiếp thị mô hình này cho các nhà phát triển thay vì người dùng chat. Nếu con số FrontierSWE vượt qua được quá trình kiểm chứng độc lập, Qwen3.8-Max là một mô hình lập trình thực thụ chứ không chỉ đơn thuần là một mô hình lớn.
Lưu ý từ bản xem trước đã thu hẹp nhưng chưa biến mất. Bảng trên do Alibaba tạo ra, trên bộ khung đánh giá của riêng họ, trong những điều kiện mà không ai khác có thể kiểm tra. Các bảng số liệu của nhà cung cấp là do họ chọn chứ không phải lấy mẫu — các phòng thí nghiệm chỉ công bố những benchmark họ làm tốt. Nhưng tính đến ngày 6 tháng 8, giờ đã có một trọng tài độc lập thực thụ: Artificial Analysis đã chấm Qwen3.8-Max đạt 56 trên Intelligence Index với chi phí 1,14 USD mỗi tác vụ, được đo trên API chính thức của Alibaba — tăng 10 điểm so với mức 46 của phiên bản tiền nhiệm, ngang với Claude Opus 4.8 (56) và kém Kimi K3 (57) một điểm. Trên bảng xếp hạng GDPval-AA agentic của AA, mô hình đạt 1.739 Elo, vượt qua Kimi K3 (1.685) và GPT-5.6 Sol (1.730), chỉ còn Claude Opus 5 (1.852) xếp trên. Những lưu ý của riêng AA cũng đáng được coi trọng không kém: một lần chạy trước đó đạt 53 trước khi các vấn đề endpoint được giải quyết và lần kiểm tra lại trên API chính thức cho ra 56; AA-Omniscience tụt 10 điểm do tỷ lệ ảo giác tăng từ 23% lên 40%; và chi phí mỗi tác vụ cao chính là vì mô hình phải xử lý qua nhiều bước hơn hẳn. Bảng xếp hạng tổng của LMArena vẫn chưa có điểm công khai.
Việc ra mắt trên DigitalOcean đã bổ sung điểm dữ liệu thứ ba, lần này nằm ở bản lượng tử hóa thay vì bản chủ lực. Kiểm tra nội bộ của DigitalOcean với các trọng số NVFP4 mà họ phục vụ đạt 88 trên GPQA Diamond, so với mức 92.6 mà Alibaba công bố cho bản chủ lực chưa lượng tử hóa. Bản thân DigitalOcean cũng lưu ý rằng so sánh này chỉ là "một điểm dữ liệu mang tính tham khảo hơn là một so sánh có kiểm soát" — sự khác biệt nằm ở ba khía cạnh (bản gốc trọng số mở thay vì bản chủ lực được lưu trữ, NVFP4 thay vì BF16, và một bộ công cụ đánh giá khác) — nhưng đây là lần kiểm tra độc lập đầu tiên trên một hệ thống phục vụ thực tế các trọng số này, đồng thời là lời nhắc rằng checkpoint mở không trùng từng byte với con số trên bảng của Alibaba.
CommerceAgentBench: bảng xếp hạng thương mại agentic
Cùng với bản cập nhật, nhóm Accio của Alibaba International đã phát hành CommerceAgentBench, một benchmark được xây dựng để chấm điểm chính xác loại công việc tầm xa mà Qwen vẫn đang quảng bá. Một tác nhân bắt đầu mỗi tác vụ bên trong một container mới trong một trong 14 bản sao ngoại tuyến của phần mềm thương mại và kinh doanh thực tế — xuất bản sản phẩm, đặt chỗ vận chuyển, quản trị cửa hàng trực tuyến, vận hành thanh toán, phân tích nhà cung cấp — và việc chấm điểm dựa trên trạng thái: một tác vụ chỉ đạt khi các dịch vụ mô phỏng bên dưới và các tệp được tạo ra thực sự thay đổi, nên một tác nhân chỉ mô tả một quy trình làm việc hợp lý mà không làm thay đổi trạng thái sẽ không được điểm nào. Bộ thử nghiệm chạy 107 tác vụ trên các giao diện CLI, trình duyệt, tệp/tài liệu và API/MCP, được thực thi qua ba harness — Accio, OpenClaw và Pi — và mã harness (Apache 2.0) cùng dữ liệu tác vụ (CC BY 4.0) được mở công khai để kiểm tra hoặc chạy lại.
Trên các bảng kết quả đã công bố, Qwen3.8-Max ghi nhận kết quả mạnh nhất trong nhóm mô hình nguồn mở: đạt 56/107 tác vụ trên bộ đánh giá Accio, 47 trên OpenClaw và 53 trên Pi — tổng cộng 156 lần vượt qua, nhiều hơn DeepSeek V4 Pro hai lần (154). Toàn bộ lợi thế nguồn mở đến từ bộ đánh giá Accio; hai mô hình hòa nhau trên OpenClaw và Pi. Dẫn đầu nguồn mở không phải là dẫn đầu chung cuộc: mô hình đóng Claude Opus 5 bỏ xa phần còn lại với 191 lần vượt qua tổng cộng, hơn 35 lần. Và bảng trên là của chính Alibaba — Accio là nhóm của Alibaba — còn bản thân kho lưu trữ cũng nêu rõ các giới hạn kiểm toán: bộ đánh giá Accio chỉ để tham chiếu, không thể tái tạo từ một bản clone (OpenClaw mới là hướng chạy lại được), kết quả cấp tác vụ thiếu checksum công khai bất biến, và các hàng dữ liệu của Qwen dựa vào giao thức phát lại nội dung suy luận để duy trì tính so sánh. Hãy xem đây là một điểm dữ liệu do nhà cung cấp công bố trên cùng trục tác nhân mà OSWorld-Verified và phương pháp GDPval-AA của AA tiếp cận từ những góc độ khác nhau — đáng để kiểm chứng trên quy trình của riêng bạn, chứ không phải một thứ hạng đã an bài.
Code Arena WebDev: trọng tài độc lập của bản dựng 0902
Code Arena là mảnh bằng chứng độc lập mà đợt cập nhật còn thiếu. Đây là bảng xếp hạng bên thứ ba cho lĩnh vực phát triển web tác tử — dự án trước đây có tên WebDev Arena — nơi các phiếu bầu mù, theo cặp từ người dùng về kết quả của mô hình nào mà họ muốn đưa vào sản xuất sẽ được quy đổi thành thang điểm kiểu Elo. Trên bảng WebDev của nền tảng này, Qwen3.8-Max-0902 ra mắt ở vị trí dẫn đầu với 1.691 điểm, tăng 22 điểm so với bản trước và xếp trên Claude Opus 5 cùng Kimi K3. Vị trí này cũng mang lại lợi thế về chi phí-hiệu quả: ở mức phí tổng hợp khoảng 5 USD mỗi triệu token — mức giá niêm yết 2 USD/6 USD được tính theo tỷ trọng thiên về đầu ra mà quá trình tạo ứng dụng web thực tế tạo ra — bản 0902 là mô hình đạt điểm cao nhất trên đường biên Pareto của bảng xếp hạng, với chi phí chỉ bằng khoảng một phần tư mức giá tổng hợp ~20 USD/M của Claude Opus 5 và thấp hơn hẳn mức ~12 USD/M của Kimi K3; chính vì vậy hai mô hình này nằm ngoài đường biên dù xếp hạng #2 và #3 về điểm số. Alibaba đã công bố vị trí này vào ngày 2 tháng 9 và tài khoản chính thức của Qwen xác nhận, đồng thời hướng người dùng đến QwenCloud; phép đo này không phải của Alibaba: không giống như bảng benchmark ở trên hay lần chạy CommerceAgentBench ngay phía trên, điểm số này được tạo ra bởi một đấu trường bên thứ ba từ các phiếu bầu về sở thích của con người.
{{1}}Có hai lưu ý để giữ cho đánh giá được trung thực.{{/1}} {{2}}Thứ nhất, điểm số trên arena chỉ có giá trị tại một thời điểm: 1.691 là con số trên bảng xếp hạng khi Alibaba công bố màn trình làng, và con số này sẽ dịch chuyển khi phiếu bầu tích lũy thêm, vì vậy hãy coi đây là một tín hiệu mạnh về kỹ năng lập trình web thay vì một ngôi vương vĩnh viễn.{{/2}} {{3}}Thứ hai, nó chỉ bao trùm một khía cạnh duy nhất.{{/3}} {{4}}Những tuyên bố của bản cập nhật về năng lực doanh nghiệp, khoa học và tác vụ dài hạn nói chung vẫn chưa có trọng tài độc lập nào kiểm chứng, nên bảng số liệu của nhà cung cấp và chỉ số AA Index 56 trên mô hình cơ sở vẫn là điểm tham chiếu cho mọi thứ nằm ngoài công việc front-end agentic.{{/4}} {{5}}Thứ ba, mức giá frontier là một lựa chọn mô hình hóa, không phải một biểu giá mới:{{/5}} {{6}}con số ~5 USD/MToken là cách pha trộn giữa các mức giá niêm yết 2 USD/6 USD vốn không đổi với giả định sử dụng nghiêng về đầu ra, nên hãy coi đây là bảng xếp hạng hiệu quả chi phí theo tiêu chí riêng của arena, chứ không phải một đợt định giá lại của Alibaba.{{/6}}

Trọng số mở, Qwen3.8-27B và câu hỏi về triển khai tại chỗ
Alibaba đã giữ đúng lời hứa về trọng số mở (open-weight). Vào ngày 12 tháng 8 năm 2026, Qwen đã công bố hai kho lưu trữ trên Hugging Face — Qwen3.8-2.4T-A95B ở định dạng BF16 và Qwen3.8-2.4T-A95B-FP8 — mỗi kho gồm 213 tệp trọng số. Giấy phép là giấy phép Qwen3.8-Max tùy chỉnh, không phải Apache 2.0; trường giấy phép trên Hugging Face ghi là "other". Các điều khoản cho phép sử dụng, sửa đổi, phân phối và tinh chỉnh (fine-tuning), bao gồm cả sử dụng thương mại, với điều kiện ghi công, cùng với hai ngưỡng giới hạn theo quy mô: sản phẩm có trên 100 triệu người dùng hoạt động hằng tháng hoặc doanh thu hằng tháng trên 20 triệu USD phải hiển thị tên mô hình một cách nổi bật; còn các doanh nghiệp Model-as-a-Service hoặc AI-Work-Assistant có tổng doanh thu 12 tháng gần nhất trên 50 triệu USD cần có giấy phép riêng từ Qwen. Hầu hết các đội nhóm đều nằm dưới các ngưỡng này; nếu doanh nghiệp của bạn vượt qua, hãy đọc kỹ văn bản giấy phép trước khi xây dựng dựa trên nó. Số lượt tải xuống xác nhận tính mới của bản phát hành — 978 trên kho BF16 và 3.851 trên kho FP8 tính đến thời điểm viết bài, con số thấp đối với một bản phát hành tiên phong (frontier) và phù hợp với một kho được tạo ngày 8 tháng 8 và chỉ được chuyển sang công khai vào ngày 12 tháng 8, chứ không phải một kho đã hiển thị công khai suốt một tuần. Một lưu ý nữa để minh bạch: checkpoint mở là mô hình gốc, chỉ xử lý văn bản và luôn bật chế độ suy luận (thinking), trong khi API Qwen3.8-Max được lưu trữ bổ sung đầu vào hình ảnh, chế độ không suy luận tùy chọn và toàn bộ cửa sổ ngữ cảnh 1M — tải trọng số giúp bạn có được mô hình, chứ không phải mọi tính năng của API.
Tự lưu trữ mô hình chủ lực vẫn ngoài tầm với của hầu hết các nhóm, nhưng giờ đây chúng ta biết con số chính xác vì sao ngoài tầm với. Bộ tham số đầy đủ 2.4T nặng khoảng 4.9TB ở định dạng BF16 và khoảng 2.4TB ở FP8, bởi vì mọi expert phải được lưu trong bộ nhớ mặc dù chỉ có 95B tham số được kích hoạt cho mỗi token. Ở mức lượng tử hóa 4-bit, con số này vào khoảng 1.2TB so với khoảng 141GB trên mỗi H200, vì vậy bạn cần tám hoặc nhiều hơn các bộ tăng tốc cao cấp trước khi có thể phục vụ dù chỉ một token. Điều mà con số active count hiện được công bố bổ sung là khía cạnh thông lượng: với 95B tham số được kích hoạt cho mỗi token, chi phí tính toán mỗi token tương đương với một mô hình dense thuộc lớp ~90B — một phần nhỏ chi phí mà một mô hình dense 2.4T sẽ áp đặt — vì vậy khi các trọng số đã nằm trong bộ nhớ, chi phí mỗi token không phải là cơn ác mộng mà con số tổng tham số gợi ý. Sự kết hợp giữa bộ nhớ chiếm dụng lớn và chi phí tính toán mỗi token khiêm tốn chính là lý do Alibaba có thể định giá đầu ra ở mức $6/1M, và nó hướng các nhóm tự lưu trữ tới các nút đa GPU chạy các checkpoint FP8 thay vì bất kỳ thứ gì trên một GPU đơn lẻ.
Lựa chọn phục vụ của DigitalOcean là {{1}}một ví dụ thực tế về phép toán đó trong môi trường sản xuất{{/1}}. Họ chạy mô hình được lượng tử hóa NVFP4 trên GPU NVIDIA HGX B300 {{2}}cụ thể là để các trọng số 2,4T nằm vừa trên một nút duy nhất, tránh việc định tuyến chuyên gia giữa các nút{{/2}} — {{3}}một sự triển khai thực tế của tính kinh tế 4-bit mà phần này đã thực hiện trên giấy{{/3}}. Sự đánh đổi chính xác là {{4}}điều mà bài kiểm tra nhanh GPQA ở trên định lượng{{/4}}: {{5}}dung lượng chiếm dụng nhỏ hơn, với chi phí chất lượng có thể đo lường được so với mô hình chủ lực chưa lượng tử hóa{{/5}}.
Chính điều này khiến Qwen3.8-27B trở thành bản phát hành có tác động lớn hơn đối với hầu hết độc giả — và không giống như flagship, trọng số của nó đã ra mắt đúng tiến độ. Vào ngày 14 tháng 8 năm 2026, Qwen đã công bố Qwen/Qwen3.8-27B trên Hugging Face và ModelScope theo giấy phép Apache 2.0: một mô hình dense 27B, đa phương thức thuần gốc, với ngữ cảnh gốc 262K token có thể mở rộng lên 1M và chế độ reasoning_effort có thể tùy chỉnh. Daniel Han của Unsloth từng ước tính mô hình sẽ chạy được trong khoảng 17GB VRAM — chỉ cần một card prosumer — và điều đó giờ đã có thể kiểm chứng: repo chính thức phát hành các safetensors BF16 (khoảng 55.6GB trên 18 shard), còn các bản lượng tử GGUF sẽ xuất hiện trong các repo cộng đồng. Như vậy, tiến trình phát hành của thế hệ này đã hoàn tất: trọng số của flagship 2.4T ra mắt trước vào ngày 12 tháng 8, còn mô hình nhỏ theo hướng on-premise ra mắt hai ngày sau đó. Chúng tôi đã theo dõi đợt phát hành này trong bài viết về ngày phát hành Qwen3.8-27B của chúng tôi.
Qwen3.8-Max phù hợp ở đâu: bốn tình huống
1. Phân tích tài liệu dài và hợp đồng. Đây là sự phù hợp nhất. Mức giá cố định cho 1 triệu token cùng với điểm OmniDocBench 92.1 có nghĩa là bạn có thể xử lý một hồ sơ 400 trang trong một lần gọi mà không phải trả phụ phí và không cần chia nhỏ. Các đối thủ tính phụ phí cho ngữ cảnh dài khiến công việc tương tự trở nên đắt đỏ hơn đáng kể. Trên lộ trình DigitalOcean, hãy nhớ rằng lộ trình đó phục vụ mô hình cơ sở mở với ngữ cảnh 262K — vẫn là một hồ sơ lớn, nhưng không phải là đủ một triệu.
2. Các tác nhân mã hóa quy mô repo.Terminal-Bench 86.6 và FrontierSWE 73.5 xác nhận điều này, và mức giá cache làm cho việc lặp lại trên một codebase ổn định trở nên rẻ. Điều cần kiểm tra đầu tiên là độ trễ dưới mức đồng thời của riêng bạn, vì các nhà đánh giá thời kỳ xem trước nhận thấy mô hình kỹ lưỡng nhưng chậm trên các phiên chạy tác nhân dài, và phục vụ GA khác hẳn với phục vụ xem trước. Kết quả GDPval-AA của AA — mức 1.739 Elo dẫn đầu với chi phí 64 bước cho mỗi tác vụ — là sự xác nhận độc lập cho cả hai mặt của sự đánh đổi đó. Các phép đo ngày 12 tháng 8 của DigitalOcean — tổng thông lượng tăng gần như tuyến tính lên khoảng 1.937 token đầu ra/giây với 256 yêu cầu đồng thời, không có lỗi và không thấy bão hòa — là điểm dữ liệu nền tảng được quản lý đầu tiên về câu hỏi đó, mặc dù chúng là số liệu của chính DigitalOcean trên hệ thống phục vụ của họ, không phải là so sánh trực tiếp với Alibaba.
3. Quy trình xử lý tài liệu và ảnh chụp màn hình.Đầu vào video và hình ảnh cùng với OSWorld-Verified 86.1 khiến nó đáng tin cậy cho các quy trình làm việc đọc màn hình — tự động hóa QA, phân loại hỗ trợ từ ảnh chụp màn hình, các tác vụ liên quan đến RPA. Một lần nữa, đầu vào đa phương thức là tính năng API được lưu trữ; đường dẫn nền mở DigitalOcean chỉ hỗ trợ văn bản.
4. Nơi chúng tôi chưa đặt nó. UX tương tác quan trọng về độ trễ và bất kỳ tác vụ được quản lý nào yêu cầu đánh giá tái lập. Đối với loại thứ nhất, bạn muốn thông lượng đo được mà bạn kiểm soát. Đối với loại thứ hai, khả năng tái lập hiện có thẻ mô hình và giấy phép trích dẫn, nhưng bảng điểm chuẩn của Alibaba vẫn chưa được tái lập — và sự suy giảm Omniscience của AA (tỷ lệ ảo giác lên tới 40%) là lời nhắc rằng điểm số độc lập có tác động hai chiều.

Cách truy cập Qwen3.8-Max
Có một số con đường thực tế. Đi trực tiếp qua Alibaba Model Studio / DashScope — hoặc QwenCloud API của riêng Qwen — sẽ giúp bạn có được bảng giá nêu trên và quyền truy cập sớm nhất vào các snapshot mới có đánh dấu ngày tháng — bản dựng Qwen3.8-Max-0902 ngày 2 tháng 9 đã xuất hiện ở đó đầu tiên trước khi được triển khai rộng rãi qua các endpoint khác — nhưng phải đánh đổi bằng việc onboard thêm một nhà cung cấp mới và quản lý thêm một key. Qwen Chat và ứng dụng Qwen là cách nhanh nhất để quan sát hành vi trước khi viết code. Tải các trọng số mở từ Hugging Face là con đường thứ tư cho những đội muốn tự vận hành hạ tầng của riêng mình — với các lưu ý về kích thước và giấy phép nêu trên. Đi qua một router là lựa chọn mà hầu hết các đội sản xuất nên cân nhắc, vì nó tách quyết định di chuyển khỏi quyết định đánh giá.
Kể từ ngày 14 tháng 8 năm 2026, có một lựa chọn thực sự mới: Qwen3.8-Max đã có mặt trên DigitalOcean Serverless Inference, mà Alibaba công bố là "đối tác ra mắt Day 0" của họ — cách gọi của riêng Alibaba, mặc dù danh mục này thuộc về DigitalOcean và tự nó đứng vững. DigitalOcean phục vụ checkpoint trọng số mở (platform model id qwen3.8-max), được lượng tử hóa NVFP4 trên GPU NVIDIA HGX B300 trong hợp tác kỹ thuật với Inferact, dưới dạng API serverless được quản lý hoàn toàn: một endpoint, định giá theo mức sử dụng, không cần quản lý hạ tầng. Bảng giá của nó khớp với bảng giá niêm yết của Alibaba — $2.00 đầu vào / $6.00 đầu ra mỗi 1M, với đầu vào được lưu cache ở mức $0.20 — và nó phục vụ 262K context vốn có của mô hình mở với chế độ suy luận luôn bật, thay vì chế độ đa phương thức ~1 triệu token của phiên bản flagship được lưu trữ. Giới hạn context đó quan trọng nếu khối lượng công việc của bạn thiên về phía dài: chế độ triệu token đầy đủ vẫn chỉ có qua API của Alibaba.
Điều mà con đường DigitalOcean mang lại ngoài yếu tố địa lý là dữ liệu phục vụ thực tế đầu tiên từ một nhà cung cấp khác ngoài Alibaba. Các phép đo của chính DigitalOcean trên endpoint sản xuất của họ, được thực hiện vào ngày 12 tháng 8, cho thấy prefill mở rộng tuyến tính ở khoảng 16.000 token/giây — quy tắc ước lượng TTFT ≈ (input ÷ 16.000) + 0,7s, do đó ~1,1s ở ~1.080 token và ~15,8s ở ~254K — và tổng thông lượng đạt ~1.937 token đầu ra/giây với 256 yêu cầu đồng thời với không lỗi nào và không tìm thấy điểm bão hòa. Đó là số liệu của DigitalOcean trên hệ thống triển khai của chính họ, không phải một bài so sánh có kiểm soát, nhưng chúng là dữ liệu về độ trễ và độ đồng thời đầu tiên cho mô hình này bên ngoài đám mây của Alibaba, và chúng trực tiếp giải quyết nỗi lo “kỹ lưỡng nhưng chậm” từ thời kỳ xem trước.
Qwen3.8-Max đã có mặt trên OrcaRouter với định danh qwen/qwen3.8-max, và bản cập nhật ngày 2/9 có thể được định tuyến theo mã định danh gắn ngày riêng — qwen/qwen3.8-max-0902 — cả hai đều có cùng mức giá niêm yết $2.00 / $6.00. OrcaRouter áp dụng mức markup 0% và truyền thẳng giá từ nhà cung cấp, nên chi phí của cả hai tuyến đều tương đương với việc dùng trực tiếp. Số liệu telemetry phục vụ của chúng tôi hiện cho thấy p50 thời gian đến token đầu tiên là 1,64 giây trong cửa sổ 7 ngày. Đây là phép đo độ trễ nội bộ (first-party) chứ không phải tuyên bố từ nhà cung cấp, và nó đáng để đối chiếu với các báo cáo thời kỳ preview mang nhận định "mô hình chậm nhất tôi từng dùng": những báo cáo này đến từ một người đánh giá duy nhất chạy các bản dựng agentic kéo dài hàng giờ trên hạ tầng preview, và chúng nên được kiểm tra lại trên môi trường phục vụ GA (General Availability) thay vì được nhắc lại như một sự thật ở thời điểm hiện tại.
Giá trị thực tế của đường dẫn bộ định tuyến nằm ở chỗ Qwen3.8-Max đứng sau cùng một điểm cuối tương thích OpenAI như các mô hình bạn đang chạy, vì vậy một bài đánh giá chỉ là thay đổi chuỗi mô hình. Bạn có thể gửi 5% lưu lượng sản xuất đến nó, so sánh với mô hình hiện tại trên các prompt giống hệt nhau, và giữ một phương án dự phòng — đây chính xác là tư thế mà một mô hình có bảng nhà cung cấp chưa được sao chép xứng đáng có được. Cùng tư thế đó cũng là cách đúng đắn để kiểm thử triển khai DigitalOcean: chạy một phần lưu lượng trên đó với phương án dự phòng tại chỗ, thay vì đặt cược một đường dẫn sản xuất vào một bộ công nghệ phục vụ mới hai tuần tuổi.

Hạn chế và rủi ro trung thực
• Bảng nhà cung cấp vẫn chưa được kiểm toán. Điểm số độc lập đã có (AA Index 56), nhưng bảng điểm chuẩn của riêng Alibaba vẫn chưa được tái lập, và phép đo của AA chỉ ra một sự thoái lui về Omniscience với tỷ lệ ảo giác lên tới 40%. Điểm số độc lập giúp ích; nó không làm cho bảng nhà cung cấp trở nên có thể kiểm toán được.
• Con đường DigitalOcean là nền tảng mở, không phải sản phẩm chủ lực. Nó phục vụ checkpoint ở ngữ cảnh 262K, chỉ văn bản, luôn bật suy luận, lượng tử hóa NVFP4 — và điểm kiểm tra nhanh của riêng DigitalOcean đạt 88 trên GPQA Diamond so với 92.6 mà Alibaba công bố, một khoảng cách mà DigitalOcean gọi là mang tính chỉ dấu hơn là có kiểm soát. Nếu bạn cần API đa phương thức với đầy đủ triệu token, thì API đó vẫn do Alibaba lưu trữ.
• Qwen3.8-27B đã ra mắt, nhưng được đánh số theo nhà cung cấp. Các trọng số của 27B đã được công bố vào ngày 14 tháng 8 theo giấy phép Apache 2.0, lấp khoảng trống về triển khai tại chỗ — nhưng các tuyên bố điểm chuẩn chỉ do Alibaba báo cáo và chưa được tái lập, còn các bản lượng tử hóa từ cộng đồng vẫn đang được phát hành dần tính đến thời điểm cập nhật này.
• Giấy phép tùy chỉnh, không phải Apache 2.0. Giấy phép Qwen3.8-Max cho phép sử dụng thương mại với điều kiện ghi nhận nguồn, nhưng có hai ngưỡng quy mô — hiển thị tên mô hình nổi bật khi vượt trên 100 triệu MAU hoặc doanh thu hàng tháng 20 triệu USD, và một giấy phép riêng cho các doanh nghiệp MaaS/AI-Work-Assistant có doanh thu vượt 50 triệu USD trong 12 tháng gần nhất. Hãy đọc kỹ trước khi bạn mở rộng vượt qua các ngưỡng này.
• Sự dài dòng và trệch hướng chỉ dẫn. IFBench 82.8 là con số yếu nhất trong bảng kết quả của chính Alibaba, và những người thử nghiệm bản xem trước liên tục thấy mô hình vượt quá phạm vi — thêm các tính năng không được yêu cầu. Số liệu của chính AA giờ đã định lượng được điều đó: 64 bước cho mỗi tác vụ GDPval-AA chính là thứ đẩy chi phí lên $1.14, cao hơn 25% so với Kimi K3. Quyến rũ trong bản demo, đắt đỏ khi đầu ra được tính phí $6/1M và gây mất ổn định khi bạn cần định dạng chính xác.
• Rào cản nội dung. Giống như các mô hình tiên phong khác được lưu trữ tại Trung Quốc, các phản hồi về các chủ đề nhạy cảm về chính trị đều bị hạn chế. Có liên quan nếu sản phẩm của bạn phục vụ các truy vấn mở.
• Token suy nghĩ được tính phí như đầu ra. Khi bật suy luận, chi phí thực tế sẽ cao hơn so với ước tính đơn giản. Hãy đo lường với cấu hình suy luận giống như cách bạn sẽ thực sự triển khai.

Câu hỏi thường gặp
Qwen3.8-Max hiện có sẵn chưa?
Vâng. Sản phẩm đã chính thức khả dụng rộng rãi (GA) từ ngày 3 tháng 8 năm 2026, với bảng giá được công bố và API tương thích cả OpenAI lẫn DashScope. Bản snapshot sản xuất hiện tại — Qwen3.8-Max-0902, phát hành ngày 2 tháng 9 — đang hoạt động trên API của QwenCloud và chính là phiên bản mà endpoint qwen3.8-max chuẩn hiện đang phục vụ. Đây là sự thay đổi so với trạng thái xem trước ngày 19 tháng 7, khi quyền truy cập chỉ giới hạn trong Qwen Chat, ứng dụng Qwen và chiến dịch tín dụng của Qoder.
Qwen3.8-Max-0902 là gì?
Qwen3.8-Max-0902 là bản cập nhật production ngày 2 tháng 9 năm 2026 của Qwen3.8-Max: cùng mô hình chủ lực sparse-MoE 2.4T tham số và ngữ cảnh 1M token, tiếp tục được huấn luyện bổ sung trên Coding và Cowork, và đang hoạt động trên API của QwenCloud với cùng mức giá $2/$6. Qwen cho biết bản snapshot mới mạnh hơn ở các tác vụ doanh nghiệp và khoa học phức tạp — một tuyên bố của nhà cung cấp, chưa được kiểm chuẩn độc lập — trong khi ở mảng lập trình, bản này đã có một kết quả độc lập: đứng #1 trên bảng xếp hạng Code Arena: WebDev với 1.691 điểm và dẫn đầu đường biên Pareto về chi phí-hiệu suất với mức giá kết hợp ~$5/MToken, theo công bố của Alibaba về việc niêm yết trên bảng xếp hạng trực tiếp, được xác nhận bởi chính tài khoản QwenCloud của Qwen.
Qwen3.8-Max có giá bao nhiêu?
2,00 USD cho mỗi 1 triệu token đầu vào và 6,00 USD cho mỗi 1 triệu token đầu ra, mức giá cố định áp dụng cho toàn bộ ngữ cảnh 1 triệu token mà không có phụ phí cho prompt dài. Đầu vào trúng bộ nhớ đệm có giá 0,25 USD cho mỗi 1 triệu token, tạo bộ nhớ đệm tường minh có giá 2,50 USD và đọc bộ nhớ đệm có giá 0,17 USD. Token dùng để suy luận được tính theo mức giá đầu ra. Trên Chỉ số Trí tuệ của Artificial Analysis, chi phí đo được của mô hình là 1,14 USD cho mỗi tác vụ — xem phần định giá để biết lý do con số này cao hơn phép tính theo token. Nhánh serverless của DigitalOcean cũng niêm yết mức giá 2/6 USD tương tự với đầu vào trúng bộ nhớ đệm ở mức 0,20 USD.
Qwen3.8-Max có bao nhiêu tham số?
Tổng cộng 2,4 nghìn tỷ tham số, trong một cấu hình Mixture-of-Experts thưa. Số lượng tham số hoạt động — con số thực sự quyết định chi phí vận hành và độ trễ — hiện đã được xác nhận là 95 tỷ tham số được kích hoạt, theo thẻ mô hình chính thức của Qwen3.8-2.4T-A95B (512 expert; 10 expert được định tuyến cộng với một expert dùng chung được kích hoạt cho mỗi token).
Các trọng số của Qwen3.8-Max có mở không?
Đúng vậy — kể từ ngày 12 tháng 8 năm 2026. Qwen đã phát hành Qwen3.8-2.4T-A95B (BF16) và Qwen3.8-2.4T-A95B-FP8 trên Hugging Face, mỗi phiên bản có 213 tệp trọng số. Giấy phép là giấy phép Qwen3.8-Max tùy chỉnh (Hugging Face phân loại là "khác"), không phải Apache 2.0: giấy phép này cho phép sử dụng thương mại với điều kiện ghi công và đi kèm hai ngưỡng giới hạn theo quy mô. Bản checkpoint mở chỉ hỗ trợ văn bản với chế độ suy luận luôn bật; API được lưu trữ bổ sung khả năng thị giác, chế độ không suy luận tùy chọn và toàn bộ ngữ cảnh 1M.
Qwen3.8-Max đã được benchmark độc lập chưa?
Đúng vậy — tính đến ngày 6 tháng 8 năm 2026. Artificial Analysis chấm mô hình này 56 điểm trên Intelligence Index của mình, với chi phí 1,14 USD mỗi tác vụ, đo trên API chính thức của Alibaba: cao hơn Qwen3.7-Max (46) 10 điểm, ngang hàng với Claude Opus 4.8 (56) và thấp hơn Kimi K3 (57) đúng 1 điểm. Tuy nhiên, bảng điểm chuẩn ở trên vẫn do Alibaba công bố và chưa được tái lập, còn bảng xếp hạng tổng của LMArena vẫn chưa có điểm số công khai nào. Bức tranh ở đấu trường độc lập đã thay đổi vào ngày 2 tháng 9: bản cập nhật 0902 ra mắt ở vị trí #1 trên bảng Code Arena: WebDev của cùng nền tảng với 1.691 điểm — một kết quả bỏ phiếu kín từ bên thứ ba, không phải bảng điểm của Alibaba — và đường biên chi phí–hiệu năng của Code Arena liệt kê nó là phương án có điểm số cao nhất trên bảng với mức chi phí hỗn hợp khoảng 5 USD/triệu token. DigitalOcean đã kiểm tra thử phiên bản lượng tử hóa của mô hình (đạt 88 trên GPQA Diamond) — đây là lần kiểm chứng từ bên thứ ba đầu tiên trên một hệ thống triển khai phục vụ trực tiếp — và bài kiểm tra này được xác định rõ là chỉ mang tính tham khảo chứ không phải thử nghiệm có kiểm soát. Một lưu ý cho cột “độc lập”: CommerceAgentBench, nơi Qwen3.8-Max dẫn đầu các mô hình open-weight, không phải là trọng tài độc lập thứ hai — Accio, đơn vị xây dựng và công bố bài đánh giá này, chính là đội ngũ của Alibaba.
Qwen3.8-Max có tốt hơn Qwen3.7-Max không?
Theo số liệu của chính Alibaba, mức tăng là đáng kể — FrontierSWE 73.5 so với 40.7 và DeepSWE 1.1 56.6 so với 21.6 là gần như tăng gấp đôi trong các tác vụ kỹ thuật phần mềm khó. Sản phẩm này cũng rẻ hơn mức $2.50/$7.50 của phiên bản tiền nhiệm. Một cách độc lập, AA xếp bước nhảy thế hệ ở mức 10 điểm trên Chỉ số Thông minh của mình (56 so với 46). Cả hai tuyên bố của nhà cung cấp vẫn nên được xác minh trên khối lượng công việc của bạn.
Tôi có thể tự lưu trữ Qwen3.8-Max không?
Về mặt thực tế là không. Bộ trọng số 2.4T đầy đủ chiếm khoảng 4.9TB ở định dạng BF16, khoảng 2.4TB ở FP8 và khoảng 1.2TB ở 4-bit — so với khoảng 141GB trên mỗi H200, con số đó tương đương tám GPU cao cấp trở lên. Với 95B tham số hoạt động trên mỗi token, chi phí tính toán trên mỗi token tương đối khiêm tốn, nhưng diện tích chiếm dụng bộ nhớ mới là ràng buộc then chốt. Dịch vụ NVFP4 của DigitalOcean chạy trên B300 là minh chứng thực tế cho thấy định dạng 4-bit có thể đưa mô hình vừa vào một node duy nhất. Qwen3.8-27B — được báo cáo chiếm khoảng 17GB VRAM — là lựa chọn triển khai tại chỗ thực tế, và trọng số của nó đã được phát hành vào ngày 14 tháng 8 năm 2026 theo giấy phép Apache 2.0 — giờ đã có thể tải về chứ không còn chỉ là một lời hứa.
Qwen3.8-27B là gì?
Một mô hình nhỏ hơn nhiều được công bố cùng với mô hình chủ lực, được định vị là lựa chọn triển khai tại chỗ thực tế. Đây là mô hình dense 27B, đa phương thức nguyên bản, với ngữ cảnh gốc 262K token có thể mở rộng lên 1M, và được phát hành theo giấy phép Apache 2.0. Trọng số của nó đã được đăng tải lên Hugging Face và ModelScope vào ngày 14 tháng 8 năm 2026; Daniel Han của Unsloth báo cáo rằng mô hình này chạy trong khoảng 17GB VRAM — chỉ vỏn vẹn một chiếc card tiêu dùng cao cấp. Các tuyên bố về điểm chuẩn của nó do Alibaba công bố và chưa được xác minh độc lập.
Qwen3.8-Max có phải là mô hình đa phương thức không?
Có — nó chấp nhận đầu vào văn bản, hình ảnh và video, đồng thời trả về văn bản. Nó cũng hỗ trợ chế độ suy luận, gọi hàm, công cụ tích hợp và đầu ra có cấu trúc. Điểm kiểm tra trọng số mở chỉ hỗ trợ văn bản; đầu vào đa phương thức là một tính năng của API lưu trữ, điều mà đường dẫn DigitalOcean không mang theo.
Qwen3.8-Max có sẵn trên DigitalOcean không?
Có — kể từ ngày 14 tháng 8 năm 2026. DigitalOcean Serverless Inference phục vụ checkpoint trọng số mở (NVFP4 trên NVIDIA HGX B300) với giá $2,00/$6,00 cho mỗi 1 triệu token, $0,20 cho input được cache, ngữ cảnh 262K token, chỉ văn bản, suy luận luôn bật. Alibaba gọi DigitalOcean là “đối tác ra mắt Day 0” của họ; danh sách dịch vụ này thuộc về DigitalOcean và độc lập với cách diễn đạt đó. Các con số đo lường của DigitalOcean: prefill ~16K token/giây và ~1.937 token đầu ra/giây ở 256 yêu cầu đồng thời, không có lỗi nào.
Tôi có thể sử dụng Qwen3.8-Max thông qua OrcaRouter không?
Vâng. Mô hình hiện đã hoạt động với tên qwen/qwen3.8-max, và bản snapshot ngày 2 tháng 9 được cung cấp dưới mã định danh riêng theo ngày — qwen/qwen3.8-max-0902 — với cùng mức giá niêm yết $2.00/$6.00, markup 0%. Chi phí định tuyến tương đương với việc gọi thẳng, thông qua endpoint tương thích OpenAI mà bạn đang sử dụng. Dữ liệu telemetry trong 7 ngày của chúng tôi cho thấy p50 thời gian đến token đầu tiên là 1,64 giây.
Hôm nay tôi có nên chuyển lưu lượng truy cập production sang nó không?
Không phải thay thế toàn bộ. Mức giá và điểm số độc lập đầu tiên khiến việc đánh giá nghiêm túc trở nên rẻ và đáng làm ngay lúc này, nhưng với chi phí mỗi tác vụ cao hơn 25% so với Kimi K3, động thái kỷ luật là chia lưu lượng so sánh với hệ thống hiện tại trên cùng các prompt, có phương án dự phòng sẵn sàng — chứ không phải di dời toàn bộ. Hướng DigitalOcean thêm một lần triển khai được quản lý thứ hai để thử nghiệm đối chiếu, giúp việc đánh giá còn rẻ hơn nữa.
Kết luận
Qwen3.8-Max từng là mô hình thú vị nhất mà không ai có thể mua được trong suốt hai tuần. Khi lên GA, đây là một đề xuất thực sự khác biệt: mức giá cố định $2/$6 cho mỗi triệu token là một cách định giá táo bạo; giá cache giúp các tác vụ agent lặp đi lặp lại trở nên rẻ; và bước nhảy thế hệ trên FrontierSWE lẫn DeepSWE — nếu kết quả đó tái hiện được — sẽ khiến mô hình này trở thành một mô hình viết mã thực thụ, chứ không chỉ là màn khoe quy mô. Việc trọng số mở được phát hành theo một giấy phép đúng nghĩa vào ngày 12 tháng 8 đã biến lời hứa “trọng số mở sắp ra mắt” thành hiện thực; còn kênh DigitalOcean ngay từ ngày-zero, được công bố ngày 14 tháng 8 với số liệu serving đo lường được và mức giá đọc cache $0,20, càng củng cố luận điểm “dùng thử với chi phí thấp”, đồng thời trao cho các đội ngũ một lựa chọn triển khai do bên thứ ba quản lý để so sánh với API của chính Alibaba. Bản làm mới Qwen3.8-Max-0902 ngày 2 tháng 9 vẫn giữ nguyên luận điểm đó: giữ nguyên mức giá $2/$6 và ngữ cảnh 1 triệu token, đồng thời tăng cường hậu huấn luyện cho mảng viết mã cũng như công việc cộng tác — những lĩnh vực mà mô hình vốn đã được định vị để phục vụ ngay từ đầu. Bản làm mới này cũng bổ sung một bảng xếp hạng độc lập, dựa trên sở thích con người, cho luận điểm viết mã đó: Qwen3.8-Max-0902 ra mắt ở vị trí số 1 trên bảng WebDev của Code Arena với 1.691 điểm, xếp trên Claude Opus 5 và Kimi K3; ở mức giá hỗn hợp khoảng $5/triệu token, nó là mô hình đạt điểm cao nhất trên đường biên Pareto chi phí – hiệu năng của bảng xếp hạng này. Kết quả CommerceAgentBench mà nhóm Accio của Alibaba công bố cùng tuần — Qwen3.8-Max dẫn đầu trong nhóm mô hình trọng số mở trên một benchmark xây dựng từ các quy trình thương mại thực tế — đã mang lại cho luận điểm về công việc cộng tác một bảng xếp hạng cụ thể của riêng nó, dù bảng xếp hạng đó do chính nhà cung cấp vận hành.
Điều đã thay đổi là cả trọng tài lẫn bộ trọng số đều đã hạ cánh — và phán quyết phần lớn là tốt, nhưng kèm những dấu hoa thị thực sự. AA xếp Qwen3.8-Max ở mức 56 trên Intelligence Index, một bước nhảy thế hệ thực sự, đưa nó ngang hàng với Claude Opus 4.8; thế nhưng cùng bảng điểm đó cũng cho thấy Kimi K3 dẫn trước một điểm với chi phí mỗi tác vụ thấp hơn 25%, đồng thời cảnh báo mức sụt giảm 10 điểm về Omniscience khi tỷ lệ ảo giác đang gia tăng. Câu hỏi về tham số kích hoạt đã được giải quyết — 95B được kích hoạt, đã được xác nhận trên thẻ mô hình — và giấy phép đã được công bố: giấy phép tùy chỉnh, không phải Apache 2.0. Điều chưa thay đổi: bảng benchmark của chính Alibaba vẫn chưa được tái lập; chi phí mỗi tác vụ vẫn cao vì mô hình phải xử lý qua rất nhiều bước; bản mở được phục vụ trên DigitalOcean là một mô hình hơi khác so với các con số điểm nhấn của mô hình chủ lực (ngữ cảnh 262K, NVFP4, GPQA kiểm tra nhanh 88 thay vì 92,6); và các tuyên bố benchmark của Qwen3.8-27B chỉ do nhà cung cấp tự báo cáo dù trọng số của nó đã được phát hành. Sự kết hợp đó không khiến Qwen3.8-Max trở thành một canh bạc tồi — ở mức giá này, nó gần như là một thử nghiệm bắt buộc — nhưng nó đồng nghĩa rằng tư thế đúng đắn là đánh giá quyết liệt, định tuyến có chủ đích, và giữ sẵn một phương án dự phòng. Điểm cần theo dõi lúc này là liệu số bước tác nhân đằng sau mức chi phí 1,14 USD mỗi tác vụ kia có phải thứ mà khối lượng công việc của bạn có thể hấp thụ hay không; liệu vị trí dẫn đầu mảng Code Arena: WebDev của bản dựng 0902 có trụ vững khi số phiếu đánh giá tích lũy dần hay không; liệu các mức tăng về Coding và Cowork của nó có tái lập được trên khối lượng công việc thực tế hay không; liệu vị trí dẫn đầu về trọng số mở tại CommerceAgentBench — hai lần vượt qua tổng hợp trên chính bộ khung đánh giá của Alibaba — có sống sót qua một lần chạy độc lập hay không; liệu các tuyên bố benchmark của bản 27B có đứng vững hay không; và liệu thông lượng đo được của bản triển khai trên DigitalOcean có trụ vững trước lưu lượng thực tế hay không — điều đó sẽ quyết định xem "chỉ đứng sau Fable 5" là định vị hay là lời tiên tri.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
