
Qwen3.8-27B Benchmarks: Bảng đầy đủ, kèm theo các lưu ý
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
Qwen3.8-27Bđạt Terminal-Bench 2.1 ở mức 73,0, SWE-bench Pro ở mức 61,7, LiveCodeBench v6 ở mức 90,3 và OSWorld-Verified ở mức 84,3 — và mọi con số đó đều do chính Alibaba công bố. Mô hình trọng số mở 27 tỷ tham số này đã ra mắt trên Hugging Face vào ngày 14 tháng 8 năm 2026 dưới giấy phép Apache 2.0, và tính đến ngày 15 tháng 8, chưa ai ngoài Alibaba đánh giá độc lập chất lượng của nó. Trang này là bản tổng hợp đầy đủ, có nguồn dẫn: toàn bộ 25 benchmark chính thức từ model card, những điểm khác biệt so với phiên bản tiền nhiệm Qwen3.6-27B, kết quả từ bài kiểm tra thông lượng độc lập của AMD, và những tuyên bố bạn nên coi là tạm thời.
Hướng dẫn đọc trước các con số: "chính thức" ở đây nghĩa là đánh giá của Alibaba được in trên thẻ mô hình tại Qwen/Qwen3.8-27B. Dữ liệu này do nhà cung cấp công bố và chưa được kiểm chứng độc lập. "Độc lập" nghĩa là người bên ngoài phòng nghiên cứu đã đo lường — cho đến nay, điều này chỉ áp dụng cho thông lượng phần cứng, chứ không phải cho bất kỳ điểm chất lượng nào. Các benchmark mà harness ảnh hưởng đến kết quả sẽ được đánh dấu ngay trong dòng.
Mô hình, mỗi thông số kỹ thuật một dòng
• 27B tham số dense (28B nếu tính cả bộ mã hóa thị giác), 64 lớp, kích thước ẩn 5120.
• Cơ chế chú ý lai — 48 lớp attention tuyến tính Gated DeltaNet cộng với 16 lớp attention đầy đủ, tỷ lệ 3:1 — chính là điều giúp việc chạy cửa sổ 262K token trở nên hợp lý về chi phí.
{{1}}262.144 token ngữ cảnh gốc, có thể mở rộng lên 1.000.000 với khả năng mở rộng YaRN.{{/1}}
• Nhập liệu hình ảnh và video gốc (đầu ra văn bản), trọng số Apache 2.0, khoảng 55.6GB ở định dạng BF16.
Bản ngắn gọn: đây là mô hình nhằm tiếp thu những gì Alibaba đã học được khi xây dựng Qwen3.8-Max với 2,4 nghìn tỷ tham số và nén nó thành thứ mà một GPU duy nhất có thể chạy được.
Bảng điểm: mọi điểm chuẩn trên thẻ mô hình
Tất cả điểm số dưới đây do Alibaba công bố từ phiếu thông số mô hình ngày 14/8, với điểm của Qwen3.6-27B mà mô hình thay thế được ghi trong ngoặc đơn.
Lập trình. Terminal-Bench 2.1 (lập trình terminal dựa trên tác nhân) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Các lần chạy SWE-bench Pro và QwenSWEBench sử dụng bộ khung Claude Code, theo chú thích trong thẻ mô hình — cần ghi nhớ trước khi so sánh chúng với một mô hình được chấm điểm trên một bộ khung khác.
Tác nhân tầm xa và công việc văn phòng.CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / điểm 42.9 (10.6 / 27.3).
Suy luận và kiến thức. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench làm theo chỉ dẫn 79.5 (69.1). HLE được GPT-4o chấm điểm, theo như thẻ thông tin.
Thị giác và sử dụng máy tính. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 có CI / 90.0 không có CI (85.1); BabyVision 85.6 có CI / 65.7 không có CI (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" là phương pháp tăng cường tại thời điểm suy luận của Alibaba; khoảng cách giữa trạng thái bật và tắt của nó là con số giàu thông tin nhất trên bảng điểm về việc bạn có thể mua thêm bao nhiêu điểm bằng năng lực tính toán suy luận bổ sung.

Điều gì thực sự đã thay đổi so với Qwen3.6-27B
Mọi điểm chuẩn trên thẻ đều tăng, nhưng mức chênh lệch không đồng đều — và hình dạng của sự cải thiện mới là điều đáng nói. Mức tăng tập trung ở mã hóa tác nhân và sử dụng máy tính, không phải ở khả năng truy xuất kiến thức:
• DeepSWE 1.1 (lập trình agent) 13.3 → 42.2, tăng khoảng gấp 3 lần
• QwenSWEBench 49.3 → 79.0
Điểm Agents' Last Exam: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 và AndroidWorld 70.3 → 81.9
• BabyVision (với CI) 28.9 → 85.6 — mức tăng tương đối lớn nhất trên bảng điểm
Trong khi đó, GPQA Diamond đã tăng từ 87,8 → 89,2 và RealWorldQA từ 84,1 → 85,9: có tiến bộ thật nhưng nhỏ. Đây không phải là bản phát hành "thông minh hơn ở mọi thứ". Đây là bản phát hành nhắm thẳng vào các tác nhân AI đọc màn hình, sử dụng công cụ và viết mã qua nhiều bước.

Những khoảng trống trung thực: những điểm vẫn còn thua kém, và các lưu ý về phương pháp luận
Khi so với các mô hình tiên phong, bức tranh có vẻ đẹp đẽ nhưng không một chiều. Ở những bài kiểm tra mà Qwen3.8-27B và Claude Opus 4.6 Max cùng hiện diện, Qwen thắng đa số — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench và toàn bộ nhóm bài kiểm tra thị giác. So với Muse Glimmer-30B của Meta — đối thủ cùng phân khúc cục bộ tự nhiên — mô hình này thắng tuyệt đối cả tám bài kiểm tra trùng lặp. Nhưng nó vẫn thua Claude Opus 4.6 Max ở Terminal-Bench 2.1 (73.0 so với 78.2), GPQA Diamond (89.2 so với 91.3), Humanity's Last Exam (30.8 so với 40.0) và NL2Repo-Bench (42.3 so với 47.6). Nếu khối lượng công việc của bạn là những bài suy luận tiên phong khó nhất — toán tiên phong, những câu hỏi đa ngành quy mô lớn — thì bản 27B vẫn chưa đạt tới trình độ đó.
Ba lưu ý trước khi bạn trích dẫn bất kỳ điều nào trong số này. Thứ nhất, không có gì trong số đó được xác minh độc lập; tính đến ngày 15 tháng 8, không có chỉ số Artificial Analysis và không có lần chạy LMArena nào cho bản 27B, và các bộ đánh giá của riêng Alibaba không phải là những bộ mà bên thứ ba sẽ sử dụng. Thứ hai, thẻ mô hình sử dụng bộ đánh giá Claude Code cho SWE-bench Pro và QwenSWEBench và một giám khảo GPT-4o cho Humanity's Last Exam — việc so sánh với các mô hình được chấm điểm trên các thiết lập khác sẽ làm thay đổi các con số. Thứ ba, lần chạy MathVision của Alibaba dùng một prompt cố định, trong khi các đối thủ nhận được mức điểm cao hơn trong hai biến thể. Điều này không có nghĩa là các kết quả sai; nó có nghĩa là chúng là một mức trần, không phải mức sàn, cho đến khi có người khác chạy mô hình.
Những gì cần để chạy nó
Qwen3.8-27B là một mô hình chạy cục bộ (local model), điều này làm thay đổi ý nghĩa của "hiệu suất": thông lượng (throughput) trên phần cứng của chính bạn thay vì trên bảng giá. Các trọng số BF16 nặng khoảng 55,6GB; khi lượng tử hóa xuống 4-bit, nó vừa với card 24GB như RTX 3090 hoặc 4090. AMD đã cung cấp hỗ trợ Day-0 ngay trong ngày ra mắt, và các phép đo llama.cpp/Vulkan của chính hãng — tháng 8/2026, trung bình từ ba lần chạy trở lên — cho kết quả 24,5 token/s trên Ryzen AI Max+ 395 và 51,8 token/s trên Radeon AI PRO R9700 với 32GB, trên các hệ thống có hơn khoảng 24GB bộ nhớ đồ họa biến đổi (variable graphics memory) hoặc VRAM. Các bài kiểm tra cộng đồng với bản FP8 trên NVIDIA GH200 cho thấy khả năng duy trì 10 yêu cầu đồng thời với ngữ cảnh 262K và thời gian đến token đầu tiên (time-to-first-token) dưới 10ms. Con số của riêng bạn sẽ khác — đó là GPU của người khác — nhưng hình dạng tổng thể là thật: đây là bản phát hành Qwen đầu tiên trong phân khúc này có thể chạy ngay trên một máy trạm duy nhất, không chỉ trong bài đánh giá.
Trọng số miễn phí, hay một API trả phí?
Quyết định mà mô hình này buộc bạn đưa ra chính là ranh giới giữa chạy cục bộ và lưu trữ đám mây: trọng số thì miễn phí, nhưng GPU của bạn thì không. Tự lưu trữ nghĩa là bạn phải sở hữu phần cứng — một card 24GB nếu bạn chấp nhận lượng tử hóa 4-bit và tốc độ sinh chậm hơn, và card lớn hơn nếu bạn muốn đầy đủ ngữ cảnh 262K với chất lượng tối đa. Phương án lưu trữ đám mây trên OrcaRouter có giá $0,33 cho mỗi triệu token đầu vào và $2,40 cho mỗi triệu token đầu ra, cũng với ngữ cảnh 262K và hỗ trợ đầu vào hình ảnh cộng video, cùng thời gian đến token đầu tiên ở phân vị 50 (p50) là 225ms được đo trong bảy ngày qua — không cần mua GPU, không cần trông chừng VRAM. Phép tính vẫn là phép tính bạn luôn làm với trọng số mở: thông lượng token bạn thực sự cần nhân với chi phí mỗi token, so với giá cố định của một card. Với khối lượng sử dụng lớn liên tục, tự lưu trữ sẽ thắng; còn với khối lượng theo đợt hoặc khiêm tốn, trả $0,33/$2,40 sẽ tốt hơn mua phần cứng mà bạn hầu như để không.

Kết luận
Qwen3.8-27B là mô hình trọng số mở mạnh nhất mà Alibaba đã phát hành ở phân khúc kích thước này, theo số liệu của chính Alibaba: đứng đầu bảng trong mã hóa tác nhân (agentic coding), sử dụng máy tính (computer use) và lập luận thị giác (vision reasoning), với cửa sổ ngữ cảnh 262K và trọng số Apache 2.0. Cách đọc đúng bảng điểm là có điều kiện — mọi con số đều do nhà cung cấp báo cáo, chỉ đúng cho bộ kiểm thử cụ thể, và chưa được tái lập; các mô hình tiên phong vẫn thắng trên các benchmark suy luận khó nhất. Nếu bạn đang quyết định tự lưu trữ (self-host) hay gọi qua API, hãy coi bảng benchmark là lời hứa và các con số thông lượng của AMD là phép đo độc lập duy nhất hiện có. Chúng tôi sẽ cập nhật trang này vào ngày một phòng thí nghiệm độc lập công bố điểm số.
