Thẻ tiêu đề cho bảng tổng kết điểm chuẩn Qwen3.8-27B, hiển thị phiếu báo cáo điểm chuẩn với con dấu ghi OPEN WEIGHTS và các biểu tượng cho lập trình, thông lượng, thị giác, ngữ cảnh dài và phần cứng cục bộ, cùng các chip ghi 27B DENSE, 262K CONTEXT và APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarks: Bảng đầy đủ, kèm theo các lưu ý

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen/Qwen3.8-27B đạt 73,0 điểm Terminal-Bench 2.1, 61,7 điểm SWE-bench Pro, 90,3 điểm LiveCodeBench v6 và 84,3 điểm OSWorld-Verified — và tất cả những con số đó đều do chính Alibaba công bố. Mô hình open-weights 27 tỷ tham số đã được phát hành trên Hugging Face vào ngày 14 tháng 8 năm 2026 theo giấy phép Apache 2.0, và chỉ trong hai tuần đầu tiên, mô hình này đã nhận được ba kết quả độc lập từ bên thứ ba: vị trí số 1 về open-weight trên benchmark Legal Agent của Harvey, trong một nghiên cứu do công ty AI pháp lý Harvey và công ty bộ nhớ Engram thực hiện; vị trí thứ 9 tổng thể trên bảng xếp hạng WebDev của Code Arena, mô hình duy nhất trong phân khúc kích thước của mình lọt vào top 10, theo thông báo của Alibaba vào ngày 25 tháng 8; và, được công bố vào ngày 26 tháng 8, vị trí số 1 về open-weight trên bảng xếp hạng Image-to-WebDev của Arena.ai, xếp hạng thứ 7 tổng thể với số điểm được báo cáo là 1.574. Trang này là bản tổng hợp đầy đủ có nguồn dẫn: toàn bộ 25 benchmark chính thức từ thẻ mô hình, những điểm khác biệt so với phiên bản tiền nhiệm Qwen3.6-27B, kết quả kiểm tra thông lượng độc lập của AMD đo được, các kết quả legal-agent và webdev-arena đó, cùng những tuyên bố nào bạn vẫn nên coi là tạm thời.

Hướng dẫn đọc trước khi xem số liệu: "official" ở đây có nghĩa là đánh giá của Alibaba được in trên thẻ mô hình tại Qwen/Qwen3.8-27B. Đây là số liệu do nhà cung cấp báo cáo và chưa được tái lập. "Independent" có nghĩa là ai đó bên ngoài phòng thí nghiệm đã đo lường — cho đến nay, điều đó bao gồm một bài kiểm tra thông lượng phần cứng, một nghiên cứu về tác nhân trong lĩnh vực pháp lý, và vị trí trên hai bảng xếp hạng phát triển web của Arena.ai, WebDev của Code Arena và đấu trường Image-to-WebDev. Các benchmark mà bộ khung thử nghiệm (harness) ảnh hưởng đến kết quả sẽ được đánh dấu ngay trong dòng.

Mô hình, mỗi thông số kỹ thuật một dòng

• 27B tham số dense (28B nếu tính cả bộ mã hóa thị giác), 64 lớp, kích thước ẩn 5120.

• Cơ chế chú ý lai — 48 lớp attention tuyến tính Gated DeltaNet cộng với 16 lớp attention đầy đủ, tỷ lệ 3:1 — chính là điều giúp việc chạy cửa sổ 262K token trở nên hợp lý về chi phí.

{{1}}262.144 token ngữ cảnh gốc, có thể mở rộng lên 1.000.000 với khả năng mở rộng YaRN.{{/1}}

• Nhập liệu hình ảnh và video gốc (đầu ra văn bản), trọng số Apache 2.0, khoảng 55.6GB ở định dạng BF16.

Bản ngắn gọn: đây là mô hình nhằm tiếp thu những gì Alibaba đã học được khi xây dựng Qwen3.8-Max với 2,4 nghìn tỷ tham số và nén nó thành thứ mà một GPU duy nhất có thể chạy được.

Bảng điểm: mọi điểm chuẩn trên thẻ mô hình

Tất cả điểm số dưới đây do Alibaba công bố từ phiếu thông số mô hình ngày 14/8, với điểm của Qwen3.6-27B mà mô hình thay thế được ghi trong ngoặc đơn.

Lập trình. Terminal-Bench 2.1 (lập trình terminal dựa trên tác nhân) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Các lần chạy SWE-bench Pro và QwenSWEBench sử dụng bộ khung Claude Code, theo chú thích trong thẻ mô hình — cần ghi nhớ trước khi so sánh chúng với một mô hình được chấm điểm trên một bộ khung khác.

Tác nhân tầm xa và công việc văn phòng.CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / điểm 42.9 (10.6 / 27.3).

Suy luận và kiến thức. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench làm theo chỉ dẫn 79.5 (69.1). HLE được GPT-4o chấm điểm, theo như thẻ thông tin.

Thị giác và sử dụng máy tính. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 có CI / 90.0 không có CI (85.1); BabyVision 85.6 có CI / 65.7 không có CI (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" là phương pháp tăng cường tại thời điểm suy luận của Alibaba; khoảng cách giữa trạng thái bật và tắt của nó là con số giàu thông tin nhất trên bảng điểm về việc bạn có thể mua thêm bao nhiêu điểm bằng năng lực tính toán suy luận bổ sung.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Điều gì thực sự đã thay đổi so với Qwen3.6-27B

Mọi điểm chuẩn trên thẻ đều tăng, nhưng mức chênh lệch không đồng đều — và hình dạng của sự cải thiện mới là điều đáng nói. Mức tăng tập trung ở mã hóa tác nhân và sử dụng máy tính, không phải ở khả năng truy xuất kiến thức:

• DeepSWE 1.1 (lập trình agent) 13.3 → 42.2, tăng khoảng gấp 3 lần

• QwenSWEBench 49.3 → 79.0

Điểm Agents' Last Exam: 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 và AndroidWorld 70.3 → 81.9

• BabyVision (với CI) 28.9 → 85.6 — mức tăng tương đối lớn nhất trên bảng điểm

Trong khi đó, GPQA Diamond đã tăng từ 87,8 → 89,2 và RealWorldQA từ 84,1 → 85,9: có tiến bộ thật nhưng nhỏ. Đây không phải là bản phát hành "thông minh hơn ở mọi thứ". Đây là bản phát hành nhắm thẳng vào các tác nhân AI đọc màn hình, sử dụng công cụ và viết mã qua nhiều bước.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Kể từ khi trang này được đăng tải, diễn biến quan trọng nhất mang tính pháp lý, không phải kỹ thuật. Alibaba công bố Qw​en3.8-27B là mô hình open-weight số 1 trên chuẩn đánh giá Legal Agent của Harvey — một tuyên bố xếp hạng xuất phát từ chính tài khoản của nhà cung cấp, nên hãy xem đây là thông tin do Alibaba tự công bố. Kết quả đằng sau đó là một nghiên cứu không thuộc về Alibaba: Harvey, công ty AI pháp lý, cùng Engram, một công ty khởi nghiệp về trí nhớ AI, đã xây dựng một công ty luật tổng hợp mang tên Calderwood & Harkness từ hơn 100 triệu token trong khoảng 10.000 tài liệu và 266 vụ việc, sau đó điều chỉnh Qw​en3.8-27B để hoạt động với mô hình này bằng bộ nhớ tham số, ghi chú nén và công cụ truy xuất.

Trong 250 nhiệm vụ pháp lý, mô hình 27B đã điều chỉnh đạt trung bình 67%, vượt qua mọi mô hình mà nghiên cứu đã thử nghiệm — bao gồm cả Claude Opus 4.8 — và về độ chính xác nghiêm ngặt theo kiểu tất cả-hoặc-không, nó dẫn trước Opus 4.8 với tỷ lệ 30% so với 25%, với chi phí khoảng 0,13 USD mỗi truy vấn so với 1,32 USD cho Opus 4.8. Những con số này do Harvey/Engram báo cáo, chưa được tái lập một cách độc lập. Trước khi huấn luyện trên các tài liệu riêng của công ty, chính mô hình đó chỉ đạt 4,7% cho các câu hỏi đặc thù của công ty; sau khi nghiên cứu chúng, con số là 72,6%.

Đọc #1 với một lưu ý lớn: mô hình đứng đầu benchmark đã nghiên cứu bộ ngữ liệu kiểm tra trước đó, được tinh chỉnh trên 100M token của công ty trước khi được đánh giá. Điều đó khiến đây là một minh chứng cho việc 27B có thể hấp thụ gì với sự tinh chỉnh theo lĩnh vực cụ thể, không phải là điểm số cho bộ trọng số Apache-2.0 chuẩn trên một môi trường đánh giá trung lập — và nó chỉ bao phủ một lĩnh vực, luật, chứ không phải chất lượng tổng quát. Điều mà nó thực sự hỗ trợ là luận điểm đằng sau dòng tweet: một mô hình 27B đủ nhỏ để chạy trên máy cục bộ lại đủ mạnh cho công việc cấp chuyên nghiệp khi có đúng kiến thức.

Kết quả độc lập thứ hai: #9 tổng thể trên WebDev của Code Arena

Kết quả độc lập thứ hai là một kết quả về lập trình, và đó là lý do trang này đã thay đổi vào ngày 25 tháng 8. Code Arena là bảng xếp hạng phát triển web của Arena.ai — dự án trước đây có tên là WebDev Arena, trên trang web trước đây có tên là LMArena — nơi người dùng xây dựng các ứng dụng thực tế bằng các cặp mô hình ẩn danh và bình chọn kết quả mà họ muốn phát hành. Trên bảng xếp hạng công khai đó, Qw​en3.8-27B đứng ở vị trí #9 toàn bảng với số điểm 1595, là mô hình duy nhất trong phân khúc kích thước của nó lọt vào top 10.

Vị trí xếp hạng là phần độc lập — nó nằm trên một bảng xếp hạng của bên thứ ba mà bất kỳ ai cũng có thể mở ra. Tiêu đề xung quanh nó là do Alibaba công bố: cách diễn đạt "mô hình nhỏ duy nhất trong top 10" và các vị trí đi kèm đều đến từ thông báo ngày 25 tháng 8 của Qw​en. Chúng đáng để nhắc lại với nhãn đó. Mô hình 27B xếp dưới sáu bậc so với Qwen3.8-Max lớn hơn nhiều (được thông báo xếp hạng #3 tổng thể), và vượt xa Gemma 4-31B có kích thước tương đương (cũng được thông báo đặt ở vị trí #80). Vấn đề không phải là một mô hình 27B vượt qua các mô hình tiên tiến nhất trong việc xây dựng ứng dụng web; mà là một mô hình đủ nhỏ để chạy trên một GPU lọt vào top mười của một đấu trường lập trình ẩn danh nơi các mô hình khác đều lớn hơn nhiều.

Kết quả độc lập thứ ba: mô hình mở #1 trên Image-to-WebDev của Arena.ai

Kết quả độc lập thứ ba đến vào ngày 26 tháng 8 và đây là kết quả mạnh nhất từ trước đến nay cho một mô hình cỡ này. Image-to-WebDev là bảng đấu anh em với WebDev của Code Arena trên Arena.ai — đấu trường nơi một mô hình được cung cấp ảnh chụp màn hình hoặc tài liệu tham khảo trực quan khác và phải biến nó thành một giao diện web hoạt động được, với những người bình chọn mù lựa chọn đầu ra mà họ muốn phát hành. Trên bảng xếp hạng công khai đó, Qw​en3.8-27B xếp #1 trong số các mô hình mở và #7 tổng thể, với điểm số đấu trường được ghi nhận là 1.574.

{{1}}Vị trí xếp hạng là phần độc lập — nó nằm trên bảng xếp hạng của bên thứ ba mà bất kỳ ai cũng có thể mở xem.{{/1}} {{2}}Tuyên bố xoay quanh kết quả này do Alibaba đưa ra: thông báo ngày 26 tháng 8 của nhóm {{KEEP}}Qw​en{{/KEEP}} giới thiệu mô hình 27B là "ngang bằng với các mô hình lớn gấp 100 lần kích thước của nó" trong bài kiểm tra này, một sự so sánh mà bảng xếp hạng không ghi lại.{{/2}} {{3}}Và xếp hạng theo sở thích không phải là phán quyết về chất lượng mã nguồn — phiếu bầu Image-to-WebDev đo lường đầu ra mà con người muốn phát hành hơn, chứ không phải liệu HTML có an toàn, dễ truy cập hay dễ bảo trì.{{/3}} Điều mà kết quả thực sự chứng minh là một mô hình mở trọng số 27B hiện dẫn đầu toàn bộ phân khúc mô hình mở trong việc biến một bức ảnh thành một trang web, một kỹ năng mà loại sản phẩm "screenshot to site" đang phát triển được xây dựng trên đó.

Những khoảng trống trung thực: những điểm vẫn còn thua kém, và các lưu ý về phương pháp luận

So với các mô hình tiên phong, bức tranh khá đẹp nhưng không hẳn một chiều. Ở những bài kiểm tra mà Qw​en3.8-27B và Claude Opus 4.6 Max trùng nhau, Qw​en thắng đa số — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, và toàn bộ khối thị giác. So với Muse Glimmer-30B của Meta, đối thủ tự nhiên cùng phân khúc local-class, nó thắng tuyệt đối cả tám bài kiểm tra trùng nhau. Nhưng nó vẫn thua Claude Opus 4.6 Max ở Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) và NL2Repo-Bench (42.3 vs 47.6). Nếu khối lượng công việc của bạn là các bài toán suy luận tiên phong khó nhất — toán học tiên phong, các câu hỏi đa ngành quy mô lớn — thì bản 27B vẫn chưa đạt tới mức đó.

Ba lưu ý trước khi bạn trích dẫn bất kỳ điều gì trong số này. Thứ nhất, bảng thẻ mô hình ở trên vẫn hoàn toàn do Alibaba công bố — chưa có chỉ số Artificial Analysis nào cho bản 27B. Hiện tại đã có ba kết quả độc lập từ bên thứ ba, nhưng mỗi kết quả đều hẹp: bảng xếp hạng Code Arena đo khả năng xây dựng ứng dụng web từ lời nhắc văn bản, bảng xếp hạng Image-to-WebDev đo khả năng biến ảnh chụp màn hình thành trang web hoạt động, cả hai đều được đánh giá bằng bỏ phiếu kín trên các đầu ra ẩn danh, còn nghiên cứu tác nhân pháp lý của Harvey chỉ bao phủ một lĩnh vực duy nhất với mô hình được huấn luyện cho bài kiểm tra đó. Không kết quả nào trong số này là chạy trọng số gốc trên một bộ đánh giá đa năng. Thứ hai, thẻ mô hình sử dụng bộ khung Claude Code cho SWE-bench Pro và QwenSWEBench, cùng bộ chấm GPT-4o cho Humanity's Last Exam — việc so sánh với các mô hình được chấm trên những thiết lập khác sẽ làm thay đổi con số. Thứ ba, lần chạy MathVision của Alibaba dùng lời nhắc cố định trong khi các đối thủ nhận được bản cao hơn trong hai biến thể. Không điều nào trong số này có nghĩa là kết quả sai; nó có nghĩa là đó là trần, không phải sàn, cho đến khi các phòng thí nghiệm độc lập chạy mô hình trên các bộ đánh giá đa năng trung lập.

Những gì cần để chạy nó

{{1}}Qw​en{{/1}}3.8-27B là một mô hình cục bộ, điều này làm thay đổi ý nghĩa của {{2}}hiệu năng{{/2}}: thông lượng trên phần cứng của chính bạn thay vì một bảng giá. Trọng số BF16 có dung lượng {{3}}khoảng{{/3}} 55,6GB; khi lượng tử hóa xuống 4-bit, nó vừa với một card 24GB như RTX 3090 hoặc 4090. AMD đã cung cấp hỗ trợ Ngày-0 ngay khi ra mắt, và các phép đo llama.cpp/Vulkan của riêng hãng — {{4}}tháng 8 năm 2026{{/4}}, trung bình từ ba lần chạy trở lên — cho thấy {{5}}24,5{{/5}} token/s trên Ryzen AI Max+ 395 và {{6}}51,8{{/6}} token/s trên Radeon AI PRO R9700 với {{7}}32GB{{/7}}, trên các hệ thống có hơn {{8}}khoảng 24GB{{/8}} bộ nhớ đồ họa biến đổi hoặc VRAM. Các bài kiểm tra của cộng đồng với bản dựng {{9}}FP8{{/9}} trên NVIDIA {{10}}GH200{{/10}} duy trì {{11}}10{{/11}} yêu cầu đồng thời với ngữ cảnh {{12}}262K{{/12}}, với {{14}}thời gian đến token đầu tiên{{/14}} {{13}}dưới 10ms{{/13}}. Số liệu của bạn sẽ khác — đó là GPU của người khác — nhưng hình dạng chung là có thật: đây là bản phát hành {{15}}Qw​en{{/15}} đầu tiên trong phân khúc này thực sự chạy được trên một máy trạm duy nhất, chứ không chỉ trong một bài đánh giá.

Trọng số miễn phí, hay một API trả phí?

Quyết định mà mô hình này buộc bạn đưa ra chính là ranh giới giữa chạy cục bộ và lưu trữ đám mây: trọng số thì miễn phí, nhưng GPU của bạn thì không. Tự lưu trữ nghĩa là bạn phải sở hữu phần cứng — một card 24GB nếu bạn chấp nhận lượng tử hóa 4-bit và tốc độ sinh chậm hơn, và card lớn hơn nếu bạn muốn đầy đủ ngữ cảnh 262K với chất lượng tối đa. Phương án lưu trữ đám mây trên OrcaRouter có giá $0,33 cho mỗi triệu token đầu vào và $2,40 cho mỗi triệu token đầu ra, cũng với ngữ cảnh 262K và hỗ trợ đầu vào hình ảnh cộng video, cùng thời gian đến token đầu tiên ở phân vị 50 (p50) là 225ms được đo trong bảy ngày qua — không cần mua GPU, không cần trông chừng VRAM. Phép tính vẫn là phép tính bạn luôn làm với trọng số mở: thông lượng token bạn thực sự cần nhân với chi phí mỗi token, so với giá cố định của một card. Với khối lượng sử dụng lớn liên tục, tự lưu trữ sẽ thắng; còn với khối lượng theo đợt hoặc khiêm tốn, trả $0,33/$2,40 sẽ tốt hơn mua phần cứng mà bạn hầu như để không.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Điểm mấu chốt

Qw​en3.8-27B là mô hình trọng số mở mạnh nhất mà Alibaba từng cho ra mắt ở phân khúc kích thước này, theo chính số liệu của Alibaba: dẫn đầu bảng về lập trình tác tử (agentic coding), sử dụng máy tính (computer use) và suy luận thị giác (vision reasoning), với cửa sổ ngữ cảnh 262K và trọng số được cấp phép Apache 2.0. Bảng điểm này cần được đọc một cách có điều kiện — mọi con số trên model card đều do nhà cung cấp tự báo cáo, gắn với từng bộ khung đánh giá (harness) cụ thể và cho đến nay vẫn chưa được tái lập, và các mô hình frontier vẫn thắng ở những benchmark suy luận khó nhất. Nếu bạn đang cân nhắc tự lưu trữ (self-host) mô hình này hay gọi qua API, hãy coi bảng benchmark là lời hứa, các con số thông lượng AMD là phép đo phần cứng độc lập đầu tiên, kết quả đánh giá tác tử pháp lý Harvey là dấu hiệu độc lập đầu tiên cho thấy năng lực của mô hình vẫn còn nguyên vẹn bên ngoài các harness của chính Alibaba, và hai thứ hạng tại các đấu trường webdev — hạng 9 chung cuộc trên bảng WebDev của Code Arena và mô hình mở số 1 trên bảng Image-to-WebDev của Arena.ai — là những xác nhận độc lập đầu tiên từ các bảng xếp hạng lập trình về năng lực đó. Chúng tôi sẽ cập nhật trang này khi có thêm các phòng lab độc lập công bố điểm số.