
Qwen3.8-27B 基准测试:完整数据表及附带注意事项
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
Qwen3.8-27B在 Terminal-Bench 2.1 上得分 73.0,在 SWE-bench Pro 上得分 61.7,在 LiveCodeBench v6 上得分 90.3,在 OSWorld-Verified 上得分 84.3——而这些数字全部出自阿里巴巴自身。这款拥有 270 亿参数的开源权重模型于 2026 年 8 月 14 日以 Apache 2.0 许可证上架 Hugging Face;截至 8 月 15 日,阿里巴巴以外尚无任何人独立评测过其质量。本页面提供完整且注明出处的汇总:模型卡中的全部 25 项官方基准测试、与上一代 Qwen3.6-27B 相比的变化、独立 AMD 吞吐量测试的实测结果,以及哪些说法应视为暂定结论。
在看这些数字之前先说一条阅读指南:这里的"官方"指的是Alibaba印在模型卡上的评测数据,位于Qwen/Qwen3.8-27B。该数据由厂商自行报告,且未经复现。"独立"则指由实验室以外的人进行的测量——目前这只适用于硬件吞吐量,而不适用于任何质量分数。那些评测框架(harness)的选择会影响结果的基准测试,已在文中相应位置标注。
模型,每个规范一行
• 27B 密集参数(含视觉编码器为 28B),64 层,隐藏维度 5120。
• 混合注意力——48 层 Gated DeltaNet 线性注意力层加 16 层全注意力层,比例为 3:1——这正是 262K token 窗口运行成本可负担的原因。
• 262,144 词元原生上下文,通过 YaRN 缩放可扩展至 1,000,000。
• 原生图像和视频输入(文本输出),Apache 2.0 权重,BF16 格式下约 55.6GB。
简而言之:这个模型旨在将阿里巴巴在构建 2.4 万亿参数的 Qwen3.8-Max 时学到的经验,压缩成单个 GPU 就能运行的东西。
评分卡:模型卡上的每项基准测试
以下所有分数均来自阿里巴巴8月14日的模型卡,括号内为被该模型取代的Qwen3.6-27B的分数。
编码。Terminal-Bench 2.1(智能体终端编码)73.0(63.4);SWE-bench Pro 61.7(53.5);QwenSWEBench 79.0(49.3);DeepSWE 1.1 42.2(13.3);NL2Repo-Bench 42.3(36.2);LiveCodeBench v6 90.3(83.9)。根据模型卡脚注,SWE-bench Pro 和 QwenSWEBench 的运行使用了 Claude Code 测试框架——在与其他使用不同测试框架评分的模型进行比较之前,值得牢记这一点。
长时程智能体与办公工作。 CoWorkBench 70.7 (61.0);JobBench 33.4 (21.8);Agents' Last Exam Pass@1 20.4 / 得分 42.9 (10.6 / 27.3)。
推理与知识。 GPQA Diamond 89.2(87.8);Humanity's Last Exam 30.8(24.0);IFBench 指令遵循 79.5(69.1)。HLE 由 GPT-4o 评判,如模型卡所述。
视觉与计算机使用。 OSWorld-Verified 84.3 (63.9);WebArena-Verified 64.8 (48.8);AndroidWorld 81.9 (70.3);MathVision 94.6(开启CI)/ 90.0(关闭CI)(85.1);BabyVision 85.6(开启CI)/ 65.7(关闭CI)(28.9);OmniDocBench 1.5 91.1 (89.4);RealWorldQA 85.9 (84.1)。“CI”是 Alibaba 的推理时增强技术;其开启与关闭状态之间的差距,是卡片上最能说明你能用额外推理算力换取多少分数的单一数字。

相比 Qwen3.6-27B,实际有哪些变化?
卡片上的每一项基准测试都上涨了,但增量并不均匀——而改进的形态才是关键。收益集中在智能体编码和计算机使用方面,而非知识召回:
• DeepSWE 1.1(智能体编码)13.3 → 42.2,约 3 倍提升。
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam 得分 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 和 AndroidWorld 70.3 → 81.9
• BabyVision(含置信区间)28.9 → 85.6 — 该卡片上最大的相对提升
与此同时,GPQA Diamond 从 87.8 升至 89.2,RealWorldQA 从 84.1 升至 85.9:确有提升,但幅度很小。这不是一次“事事皆更聪明”的发布,而是明确面向那些读取屏幕、使用工具并跨多步骤编写代码的智能体的发布。

坦诚的差距:它仍然失败的地方,以及方法论上的注意事项
面对前沿模型,表现令人欣喜,但也并非一边倒。在 Qwen3.8-27B 与 Claude Opus 4.6 Max 重叠的基准测试中,Qwen 赢下了大多数——SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6、OSWorld-Verified、AndroidWorld、IFBench,以及整个视觉板块。面对 Meta 的 Muse Glimmer-30B——这个自然而然的本土同类对手——它在全部八项重叠基准测试中取得完胜。不过,在 Terminal-Bench 2.1(73.0 对 78.2)、GPQA Diamond(89.2 对 91.3)、Humanity's Last Exam(30.8 对 40.0)和 NL2Repo-Bench(42.3 对 47.6)上,它仍然输给了 Claude Opus 4.6 Max。如果你的工作负载属于最艰难的前沿推理——前沿数学、大规模多学科问题——27B 还达不到那个水平。
在你引用这些内容之前,有三个注意事项。首先,这些内容都没有经过独立验证;截至8月15日,27B模型没有Artificial Analysis指数,也没有LMArena跑分,而阿里巴巴自己的测试框架并不是第三方会使用的。其次,模型卡对SWE-bench Pro和QwenSWEBench使用了Claude Code测试框架,对Humanity's Last Exam使用了GPT-4o裁判——与其他设置下评分的模型进行比较会改变数字。第三,阿里巴巴的MathVision运行使用了固定提示词,而竞争对手使用的是两个变体中较高的那个。这些都不意味着结果是错误的;而是意味着在其他人运行该模型之前,这些结果是上限,而不是下限。
运行它需要什么
Qwen3.8-27B 是一个本地模型,这改变了{{1}}性能{{/1}}的含义:{{2}}是在你自己硬件上的吞吐量,而不是价格表上的数字{{/2}}。BF16 权重大约 55.6GB;量化为 4-bit 后可以装进 24GB 的显卡,例如 RTX 3090 或 4090。AMD 在发布当天提供了 Day-0 支持,其自己的 llama.cpp/Vulkan 测量结果——{{3}}2026 年 8 月,三次及以上运行的平均值{{/3}}——显示:在配备{{4}}超过约 24GB 可变图形内存或 VRAM{{/4}}的系统上,Ryzen AI Max+ 395 达到 24.5 tokens/s,配备 32GB 显存的 Radeon AI PRO R9700 达到 51.8 tokens/s。社区对 NVIDIA GH200 上 FP8 版本的测试显示,它能够维持 10 个并发 262K 上下文请求,首个 token 的生成时间低于 10 毫秒。你自己的数字会有所不同——{{5}}那些是别人的 GPU{{/5}}——但整体趋势是真实的:这是同类中第一个 Qwen 版本,它{{6}}不只是能在评测中运行,而是能在单台工作站上运行{{/6}}。
免费权重,还是付费API?
这个模型迫使你做出的决定,正是本地部署与托管部署之间的分水岭:权重本身免费,但你的GPU并不是免费的。自托管意味着你要拥有芯片——如果能接受4位量化和较慢的生成速度,一块24GB的显卡就够;如果想要完整262K上下文且保持全质量,则需要更大的显卡。OrcaRouter上的托管方案是每百万输入token 0.33美元、每百万输出token 2.40美元,同样支持262K上下文和图像+视频输入,过去七天内测得的p50首token延迟为225毫秒——无需购买GPU,也无需操心VRAM。这笔账就是你面对开放权重时总要算的那笔账:用你实际需要的token吞吐量乘以每token成本,再对比一张显卡的固定价格。在持续高吞吐量下,自托管更胜一筹;而在突发性或中等规模的用量下,按0.33/2.40美元付费比买一块大部分时间闲置的显卡更划算。

底线
Qwen3.8-27B 是阿里巴巴在该尺寸级别中发布的最强开源权重模型——根据阿里巴巴自己的数据:在智能体编码、计算机使用和视觉推理方面均名列前茅,拥有 262K 上下文窗口和 Apache 2.0 权重。正确解读这份成绩单需要附加条件:所有数据均由厂商自行报告、依赖特定测试框架,且尚未得到复现;同时,前沿模型在最具挑战性的推理基准上仍然胜出。如果你正在决定是自行部署还是通过 API 调用它,请将基准测试表视为其承诺,而 AMD 的吞吐量数据则是目前唯一存在的独立测量结果。一旦有独立实验室公布分数,我们将在当天更新此页面。
