Thẻ tiêu đề cho bảng tổng kết điểm chuẩn Qwen3.8-27B, hiển thị phiếu báo cáo điểm chuẩn với con dấu ghi OPEN WEIGHTS và các biểu tượng cho lập trình, thông lượng, thị giác, ngữ cảnh dài và phần cứng cục bộ, cùng các chip ghi 27B DENSE, 262K CONTEXT và APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarks: Bảng đầy đủ, kèm theo các lưu ý

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen3.8-27Bđạt Terminal-Bench 2.1 ở mức 73,0, SWE-bench Pro ở mức 61,7, LiveCodeBench v6 ở mức 90,3 và OSWorld-Verified ở mức 84,3 — và mọi con số đó đều do chính Alibaba công bố. Mô hình trọng số mở 27 tỷ tham số này đã ra mắt trên Hugging Face vào ngày 14 tháng 8 năm 2026 dưới giấy phép Apache 2.0, và tính đến ngày 15 tháng 8, chưa ai ngoài Alibaba đánh giá độc lập chất lượng của nó. Trang này là bản tổng hợp đầy đủ, có nguồn dẫn: toàn bộ 25 benchmark chính thức từ model card, những điểm khác biệt so với phiên bản tiền nhiệm Qwen3.6-27B, kết quả từ bài kiểm tra thông lượng độc lập của AMD, và những tuyên bố bạn nên coi là tạm thời.

Hướng dẫn đọc trước các con số: "chính thức" ở đây nghĩa là đánh giá của Alibaba được in trên thẻ mô hình tại Qwen/Qwen3.8-27B. Dữ liệu này do nhà cung cấp công bố và chưa được kiểm chứng độc lập. "Độc lập" nghĩa là người bên ngoài phòng nghiên cứu đã đo lường — cho đến nay, điều này chỉ áp dụng cho thông lượng phần cứng, chứ không phải cho bất kỳ điểm chất lượng nào. Các benchmark mà harness ảnh hưởng đến kết quả sẽ được đánh dấu ngay trong dòng.

Mô hình, mỗi thông số kỹ thuật một dòng

• 27B tham số dense (28B nếu tính cả bộ mã hóa thị giác), 64 lớp, kích thước ẩn 5120.

• Cơ chế chú ý lai — 48 lớp attention tuyến tính Gated DeltaNet cộng với 16 lớp attention đầy đủ, tỷ lệ 3:1 — chính là điều giúp việc chạy cửa sổ 262K token trở nên hợp lý về chi phí.

{{1}}262.144 token ngữ cảnh gốc, có thể mở rộng lên 1.000.000 với khả năng mở rộng YaRN.{{/1}}

• Nhập liệu hình ảnh và video gốc (đầu ra văn bản), trọng số Apache 2.0, khoảng 55.6GB ở định dạng BF16.

Bản ngắn gọn: đây là mô hình nhằm tiếp thu những gì Alibaba đã học được khi xây dựng Qwen3.8-Max với 2,4 nghìn tỷ tham số và nén nó thành thứ mà một GPU duy nhất có thể chạy được.

Bảng điểm: mọi điểm chuẩn trên thẻ mô hình

Tất cả điểm số dưới đây do Alibaba công bố từ phiếu thông số mô hình ngày 14/8, với điểm của Qwen3.6-27B mà mô hình thay thế được ghi trong ngoặc đơn.

Lập trình. Terminal-Bench 2.1 (lập trình terminal dựa trên tác nhân) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Các lần chạy SWE-bench Pro và QwenSWEBench sử dụng bộ khung Claude Code, theo chú thích trong thẻ mô hình — cần ghi nhớ trước khi so sánh chúng với một mô hình được chấm điểm trên một bộ khung khác.

Tác nhân tầm xa và công việc văn phòng.CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / điểm 42.9 (10.6 / 27.3).

Suy luận và kiến thức. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench làm theo chỉ dẫn 79.5 (69.1). HLE được GPT-4o chấm điểm, theo như thẻ thông tin.

Thị giác và sử dụng máy tính. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 có CI / 90.0 không có CI (85.1); BabyVision 85.6 có CI / 65.7 không có CI (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" là phương pháp tăng cường tại thời điểm suy luận của Alibaba; khoảng cách giữa trạng thái bật và tắt của nó là con số giàu thông tin nhất trên bảng điểm về việc bạn có thể mua thêm bao nhiêu điểm bằng năng lực tính toán suy luận bổ sung.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Điều gì thực sự đã thay đổi so với Qwen3.6-27B

Mọi điểm chuẩn trên thẻ đều tăng, nhưng mức chênh lệch không đồng đều — và hình dạng của sự cải thiện mới là điều đáng nói. Mức tăng tập trung ở mã hóa tác nhân và sử dụng máy tính, không phải ở khả năng truy xuất kiến thức:

• DeepSWE 1.1 (lập trình agent) 13.3 → 42.2, tăng khoảng gấp 3 lần

• QwenSWEBench 49.3 → 79.0

Điểm Agents' Last Exam: 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 và AndroidWorld 70.3 → 81.9

• BabyVision (với CI) 28.9 → 85.6 — mức tăng tương đối lớn nhất trên bảng điểm

Trong khi đó, GPQA Diamond đã tăng từ 87,8 → 89,2 và RealWorldQA từ 84,1 → 85,9: có tiến bộ thật nhưng nhỏ. Đây không phải là bản phát hành "thông minh hơn ở mọi thứ". Đây là bản phát hành nhắm thẳng vào các tác nhân AI đọc màn hình, sử dụng công cụ và viết mã qua nhiều bước.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Những khoảng trống trung thực: những điểm vẫn còn thua kém, và các lưu ý về phương pháp luận

Khi so với các mô hình tiên phong, bức tranh có vẻ đẹp đẽ nhưng không một chiều. Ở những bài kiểm tra mà Qwen3.8-27B và Claude Opus 4.6 Max cùng hiện diện, Qwen thắng đa số — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench và toàn bộ nhóm bài kiểm tra thị giác. So với Muse Glimmer-30B của Meta — đối thủ cùng phân khúc cục bộ tự nhiên — mô hình này thắng tuyệt đối cả tám bài kiểm tra trùng lặp. Nhưng nó vẫn thua Claude Opus 4.6 Max ở Terminal-Bench 2.1 (73.0 so với 78.2), GPQA Diamond (89.2 so với 91.3), Humanity's Last Exam (30.8 so với 40.0) và NL2Repo-Bench (42.3 so với 47.6). Nếu khối lượng công việc của bạn là những bài suy luận tiên phong khó nhất — toán tiên phong, những câu hỏi đa ngành quy mô lớn — thì bản 27B vẫn chưa đạt tới trình độ đó.

Ba lưu ý trước khi bạn trích dẫn bất kỳ điều nào trong số này. Thứ nhất, không có gì trong số đó được xác minh độc lập; tính đến ngày 15 tháng 8, không có chỉ số Artificial Analysis và không có lần chạy LMArena nào cho bản 27B, và các bộ đánh giá của riêng Alibaba không phải là những bộ mà bên thứ ba sẽ sử dụng. Thứ hai, thẻ mô hình sử dụng bộ đánh giá Claude Code cho SWE-bench Pro và QwenSWEBench và một giám khảo GPT-4o cho Humanity's Last Exam — việc so sánh với các mô hình được chấm điểm trên các thiết lập khác sẽ làm thay đổi các con số. Thứ ba, lần chạy MathVision của Alibaba dùng một prompt cố định, trong khi các đối thủ nhận được mức điểm cao hơn trong hai biến thể. Điều này không có nghĩa là các kết quả sai; nó có nghĩa là chúng là một mức trần, không phải mức sàn, cho đến khi có người khác chạy mô hình.

Những gì cần để chạy nó

Qwen3.8-27B là một mô hình chạy cục bộ (local model), điều này làm thay đổi ý nghĩa của "hiệu suất": thông lượng (throughput) trên phần cứng của chính bạn thay vì trên bảng giá. Các trọng số BF16 nặng khoảng 55,6GB; khi lượng tử hóa xuống 4-bit, nó vừa với card 24GB như RTX 3090 hoặc 4090. AMD đã cung cấp hỗ trợ Day-0 ngay trong ngày ra mắt, và các phép đo llama.cpp/Vulkan của chính hãng — tháng 8/2026, trung bình từ ba lần chạy trở lên — cho kết quả 24,5 token/s trên Ryzen AI Max+ 395 và 51,8 token/s trên Radeon AI PRO R9700 với 32GB, trên các hệ thống có hơn khoảng 24GB bộ nhớ đồ họa biến đổi (variable graphics memory) hoặc VRAM. Các bài kiểm tra cộng đồng với bản FP8 trên NVIDIA GH200 cho thấy khả năng duy trì 10 yêu cầu đồng thời với ngữ cảnh 262K và thời gian đến token đầu tiên (time-to-first-token) dưới 10ms. Con số của riêng bạn sẽ khác — đó là GPU của người khác — nhưng hình dạng tổng thể là thật: đây là bản phát hành Qwen đầu tiên trong phân khúc này có thể chạy ngay trên một máy trạm duy nhất, không chỉ trong bài đánh giá.

Trọng số miễn phí, hay một API trả phí?

Quyết định mà mô hình này buộc bạn đưa ra chính là ranh giới giữa chạy cục bộ và lưu trữ đám mây: trọng số thì miễn phí, nhưng GPU của bạn thì không. Tự lưu trữ nghĩa là bạn phải sở hữu phần cứng — một card 24GB nếu bạn chấp nhận lượng tử hóa 4-bit và tốc độ sinh chậm hơn, và card lớn hơn nếu bạn muốn đầy đủ ngữ cảnh 262K với chất lượng tối đa. Phương án lưu trữ đám mây trên OrcaRouter có giá $0,33 cho mỗi triệu token đầu vào và $2,40 cho mỗi triệu token đầu ra, cũng với ngữ cảnh 262K và hỗ trợ đầu vào hình ảnh cộng video, cùng thời gian đến token đầu tiên ở phân vị 50 (p50) là 225ms được đo trong bảy ngày qua — không cần mua GPU, không cần trông chừng VRAM. Phép tính vẫn là phép tính bạn luôn làm với trọng số mở: thông lượng token bạn thực sự cần nhân với chi phí mỗi token, so với giá cố định của một card. Với khối lượng sử dụng lớn liên tục, tự lưu trữ sẽ thắng; còn với khối lượng theo đợt hoặc khiêm tốn, trả $0,33/$2,40 sẽ tốt hơn mua phần cứng mà bạn hầu như để không.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Kết luận

Qwen3.8-27B là mô hình trọng số mở mạnh nhất mà Alibaba đã phát hành ở phân khúc kích thước này, theo số liệu của chính Alibaba: đứng đầu bảng trong mã hóa tác nhân (agentic coding), sử dụng máy tính (computer use) và lập luận thị giác (vision reasoning), với cửa sổ ngữ cảnh 262K và trọng số Apache 2.0. Cách đọc đúng bảng điểm là có điều kiện — mọi con số đều do nhà cung cấp báo cáo, chỉ đúng cho bộ kiểm thử cụ thể, và chưa được tái lập; các mô hình tiên phong vẫn thắng trên các benchmark suy luận khó nhất. Nếu bạn đang quyết định tự lưu trữ (self-host) hay gọi qua API, hãy coi bảng benchmark là lời hứa và các con số thông lượng của AMD là phép đo độc lập duy nhất hiện có. Chúng tôi sẽ cập nhật trang này vào ngày một phòng thí nghiệm độc lập công bố điểm số.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube