
Qwen3.8-27B 基准测试:完整表格,附注意事项
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Qwen/Qwen3.8-27B在Terminal-Bench 2.1上得分73.0,在SWE-bench Pro上得分61.7,在LiveCodeBench v6上得分90.3,在OSWorld-Verified上得分84.3——而这些数字全都是阿里巴巴自己公布的。这个270亿参数的开放权重模型于2026年8月14日以Apache 2.0协议上线Hugging Face,并在最初两周内获得了三项独立的第三方结果:在由法律AI公司Harvey和记忆公司Engram开展的一项研究中,拿下Harvey's Legal Agent基准测试的开放权重第一;据阿里巴巴8月25日公告,在Code Arena的WebDev排行榜上总排名第9,是同级规模模型中唯一进入前十的;以及8月26日宣布的,在Arena.ai的Image-to-WebDev排行榜上拿下开放权重第一,总排名第7,报告得分为1,574。本页是完整的、附来源的汇总:模型卡中的全部25项官方基准测试、与其前代Qwen3.6-27B相比有何变化、一项独立的AMD吞吐量测试测得了什么、那些法律智能体和网页开发竞技场的结果,以及哪些说法你仍应视为暂定。
在给出数字之前,先做一点阅读说明:这里的“官方”指阿里巴巴在 Qwen/Qwen3.8-27B 的模型卡上公布的评测结果。它由厂商自行报告,且未经复现。“独立”指由该实验室之外的人测量——到目前为止,这包括一项硬件吞吐量测试、一项法律领域智能体研究,以及在 Arena.ai 的两个网页开发排行榜上的排名:Code Arena 的 WebDev 和 Image-to-WebDev arena。那些评测框架很关键的基准会在行内标注。
模型,每个规格一行
• 27B 稠密参数(计入视觉编码器则为 28B),64 层,隐藏大小为 5120。
• 混合注意力——48 个 Gated DeltaNet 线性注意力层加上 16 个全注意力层,比例为 3:1——正是这一点让 262K token 的窗口运行起来成本可控。
• 262,144 tokens 原生上下文,可通过 YaRN 扩展至 1,000,000。
• 原生图像和视频输入(文本输出),Apache 2.0 权重,BF16 下约 55.6GB。
简而言之:这个模型旨在将阿里巴巴在构建 2.4 万亿参数的 Qwen3.8-Max 过程中积累的经验,压缩成单块 GPU 即可运行的东西。
记分卡:模型卡上的每一项基准测试
以下所有分数均为阿里巴巴在8月14日模型卡中报告的,括号内为该模型所取代的 Qwen3.6-27B 分数。
编程。Terminal-Bench 2.1(智能体终端编程)73.0(63.4);SWE-bench Pro 61.7(53.5);QwenSWEBench 79.0(49.3);DeepSWE 1.1 42.2(13.3);NL2Repo-Bench 42.3(36.2);LiveCodeBench v6 90.3(83.9)。根据模型卡的一条脚注,SWE-bench Pro 和 QwenSWEBench 的测试使用了 Claude Code 测试框架——在将它们与采用不同测试框架评分的模型进行比较之前,这一点值得留意。
长时程智能体与办公工作。 CoWorkBench 70.7(61.0);JobBench 33.4(21.8);Agents' Last Exam Pass@1 20.4 / 得分 42.9(10.6 / 27.3)。
推理与知识。 GPQA Diamond 89.2(87.8);Humanity's Last Exam 30.8(24.0);IFBench 指令遵循 79.5(69.1)。根据模型卡说明,HLE 由 GPT-4o 评判。
视觉与计算机使用。OSWorld-Verified 84.3(63.9);WebArena-Verified 64.8(48.8);AndroidWorld 81.9(70.3);MathVision 94.6 含 CI / 90.0 不含(85.1);BabyVision 85.6 含 CI / 65.7 不含(28.9);OmniDocBench 1.5 91.1(89.4);RealWorldQA 85.9(84.1)。"CI" 是阿里巴巴的推理时增强;其开启与关闭状态之间的差距,是这张卡片上关于你能用额外推理算力买到多少分数的最具信息量的单一数字。

相较于 Qwen3.6-27B,实际发生了什么变化?
卡片上的每一项基准测试都提升了,但增幅并不均匀——而提升的形态才是关键所在。增益集中在智能体编程和计算机使用上,而非知识回忆:
• DeepSWE 1.1(智能体编程)13.3 → 42.2,大约提升了 3 倍
• QwenSWEBench 49.3 → 79.0
• 智能体的 Last Exam 得分 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 以及 AndroidWorld 70.3 → 81.9
• BabyVision(配合 CI)28.9 → 85.6 —— 卡片上最大的相对提升
与此同时,GPQA Diamond 从 87.8 提升至 89.2,RealWorldQA 从 84.1 提升至 85.9:确有其效,但幅度不大。这不是一次“样样都更聪明”的发布,而是一次直指那些会读屏幕、使用工具、并跨多个步骤编写代码的智能体的发布。

首个独立结果:在Harvey的法律智能体基准测试中排名第一的开放权重模型
自从这个页面发布以来,最重要的进展是法律层面的,而非技术层面的。阿里巴巴宣布,Qwen3.8-27B 是 Harvey 的 Legal Agent 基准测试中排名第一的开放权重模型——这一排名说法出自厂商自己的说法,因此应将其视为阿里巴巴方面的陈述。其背后的结果是一项并非阿里巴巴所做的研究:法律 AI 公司 Harvey 和 AI 记忆初创公司 Engram,用约 10,000 份文档、266 个事项中的 1 亿多个 token 构建了一家名为 Calderwood & Harkness 的合成律师事务所,随后通过参数化记忆、压缩笔记和检索工具对 Qwen3.8-27B 进行了适配。
在250项法律任务上,经过适配的27B模型平均得分67%,领先于该研究测试的所有模型——包括Claude Opus 4.8——而在严格的“全有或全无”正确率上,它以30%对25%领先Opus 4.8,每次查询成本约为$0.13,而Opus 4.8为$1.32。这些数字由Harvey/Engram报告,尚未经独立复现。在使用该事务所自身文件进行训练之前,同一模型在事务所特定问题上的得分仅为4.7%;学习这些文件之后,达到72.6%。
看这个 #1 时,要带上一个重要的前提:登顶该基准的模型事先已经研究过测试语料,在评估之前已经在该公司的 1 亿 token 上进行了适配。这意味着,它展示的是 27B 在领域特定调优下能吸收什么,而不是原生 Apache-2.0 权重在中立测试框架上的得分——而且它只覆盖法律这一个领域,并不代表通用质量。它真正支持的是那条推文背后的主张:一个小到能在本地机器上运行的 27B,一旦拥有正确的知识,就足以胜任专业级工作。
第二个独立结果:在 Code Arena 的 WebDev 中综合排名第 9
第二个独立结果与编程有关,也正是这个页面在8月25日发生变化的原因。Code Arena 是 Arena.ai 的网页开发排行榜——这个项目原名 WebDev Arena,所在网站原名 LMArena——用户在这里用成对的匿名模型构建真实应用,并投票决定更愿意发布哪一个的输出。在那个公开排行榜上,Qwen3.8-27B 以 1595 分位列总榜第 9,是同规模级别中唯一进入前 10 的模型。
排名本身是独立的部分——它出现在任何人都能打开的第三方排行榜上。围绕它的标题则是阿里巴巴自己的说法:"前十中唯一的小模型"这一表述以及配套的名次,都来自 Qwen 8 月 25 日的公告。它们值得连同这一标注一起复述。27B 比体量大得多的 Qwen3.8-Max(公告将其列为总榜第 3)低六个名次,又远远领先于体量相近的 Gemma 4-31B(同一份公告将其列为第 80 名)。重点不在于一个 27B 模型在构建网页应用上击败了前沿模型,而在于一个小到能在单块 GPU 上运行的模型,跻身于一个盲测编程竞技场的前十,而其中的其他参与者都是体量大得多的模型。
第三个独立结果:Arena.ai 的 Image-to-WebDev 上排名第一的开源模型
第三项独立结果于8月26日公布,对于这一规模的模型来说,这是迄今最强的一次。Image-to-WebDev 是 Arena.ai 上 Code Arena 的 WebDev 的姊妹榜单——在这个竞技场中,模型会获得一张截图或其他视觉参考,并必须将其转化为可用的网页界面,由盲测的人类投票者选出他们更愿意发布的输出。在该公开排行榜上,Qwen3.8-27B 在开放模型中排名第1,整体排名第7,报告的竞技场得分为1,574。
这个名次才是独立的部分——它出现在任何人都能打开的第三方排行榜上。围绕它的大字宣传是阿里巴巴方面给出的:Qwen 团队在 8 月 26 日的公告中把 27B 标榜为在这项测试上“与规模大 100 倍的模型不相上下”,而排行榜并未记录这一对比。而且,偏好排名并不是代码质量判定——Image-to-WebDev 的投票衡量的是人类更愿意发布哪一种输出,而不是 HTML 是否安全、可访问或可维护。这个结果确实证明的是,一个 27B 开放权重模型如今在把图片变成页面这一点上领先于其整个开放领域,而不断增长的“截图转网站”类产品正是建立在这项能力之上。
坦诚的差距:它仍然失利之处,以及方法论上的注意事项
面对前沿模型,这一表现固然亮眼,但并非一边倒。在 Qwen3.8-27B 与 Claude Opus 4.6 Max 有交集的领域,Qwen 拿下多数——SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6、OSWorld-Verified、AndroidWorld、IFBench,以及整个视觉板块。面对 Meta 的 Muse Glimmer-30B 这一天然的本地级对手,它在全部八项重叠基准上完胜。但在 Terminal-Bench 2.1(73.0 对 78.2)、GPQA Diamond(89.2 对 91.3)、Humanity's Last Exam(30.8 对 40.0)和 NL2Repo-Bench(42.3 对 47.6)上,它仍不敌 Claude Opus 4.6 Max。如果你的工作负载是最艰难的前沿推理——前沿数学、高度跨学科的问题——那 27B 还达不到那个水平。
在你引用其中任何内容之前,有三点提醒。第一,上面的模型卡表格仍然完全由阿里巴巴报告——27B 还没有 Artificial Analysis 指数。它现在有三项独立的第三方结果,但每一项的范围都很窄:Code Arena 排行榜衡量的是根据文本提示构建 Web 应用,Image-to-WebDev 排行榜衡量的是把截图变成可正常工作的页面,两者都通过对匿名输出进行盲投来评判,而 Harvey 法律智能体研究只覆盖单一领域,且所用模型是针对该测试训练的。没有一项是在通用测试框架上运行原始权重。第二,模型卡在 SWE-bench Pro 和 QwenSWEBench 上使用 Claude Code 测试框架,并在 Humanity's Last Exam 上使用 GPT-4o 评委——与其他设置下评分的模型比较会改变这些数字。第三,阿里巴巴的 MathVision 测试使用了固定提示,而竞争对手得到的是两个变体中较高的那个。这一切并不意味着结果有错;它意味着,在独立实验室于中立的通用测试框架上运行该模型之前,这些结果是上限,而不是下限。
运行它需要什么条件
Qwen3.8-27B 是一个本地模型,这改变了"性能"的含义:衡量的是你自己硬件上的吞吐量,而不是价目表上的数字。BF16 权重约为 55.6GB;量化到 4 位后,就能装进 RTX 3090 或 4090 这类 24GB 显卡。AMD 在发布当天就提供了 Day-0 支持,其自家的 llama.cpp/Vulkan 实测数据——2026 年 8 月,取三次或更多次运行的平均值——显示它在 Ryzen AI Max+ 395 上达到 24.5 tokens/s,在配备 32GB 的 Radeon AI PRO R9700 上达到 51.8 tokens/s,测试系统拥有超过约 24GB 的可变显存或 VRAM。社区在 NVIDIA GH200 上对 FP8 构建版本的测试中,同时承载了 10 个 262K 上下文的请求,首 token 延迟低于 10ms。你自己的数字会有所不同——那是别人的 GPU——但大趋势是真实的:这是该级别中首个能在单台工作站上真正跑起来、而不只是出现在评测里的 Qwen 版本。
免费权重,还是付费 API?
这个模型迫使你做出的决定,正是区分本地部署与托管部署的那个决定:权重本身不花钱,但你的 GPU 并非免费。自托管意味着要拥有硬件——如果你接受 4-bit 量化和更慢的生成速度,一张 24GB 显卡即可;如果你想以完整质量获得完整的 262K 上下文,就需要更大的卡。OrcaRouter 上的托管替代方案是每百万输入 token 收费 $0.33、每百万输出 token 收费 $2.40,提供相同的 262K 上下文和图像加视频输入,并且过去七天测得的首 token 时间 p50 为 225ms——无需购买 GPU,也无需照看 VRAM。这笔账就是使用开放权重时你总会做的计算:你实际需要的 token 吞吐量乘以每 token 成本,对比一张显卡的固定价格。在持续高负载量下,自托管会胜出;在突发性或中等负载量下,支付 $0.33/$2.40 胜过购买一块大部分时间都闲置的硬件。

最重要的一点
Qwen3.8-27B 是阿里巴巴在这一尺寸级别中推出的最强开放权重模型——按阿里巴巴自己公布的数据:在智能体编程、计算机使用和视觉推理方面均为表中最佳,具备 262K 上下文窗口和 Apache 2.0 权重。对这份评分卡的正确解读应是有条件的——每个模型卡数字均由厂商报告、依赖特定评测框架,且尚未被复现,而前沿模型仍在最难的推理基准上胜出。如果你正在决定是自行托管它,还是通过 API 调用它,请把基准测试表视为其承诺,把 AMD 吞吐量数据视为首次独立的硬件测量,把 Harvey 法律智能体结果视为首个独立迹象,表明该模型的能力在阿里巴巴自家评测框架之外依然成立,并把两个 webdev 竞技场名次——Code Arena 的 WebDev 总榜第 9,以及 Arena.ai 的 Image-to-WebDev 中排名第 1 的开放模型——视为该能力首次得到独立编程排行榜的确认。随着更多独立实验室公布评分,我们将更新本页面。
