Qwen3.8-27B 评测的 Hero 标题卡片:标题为“Qwen3.8-27B 评测”,副标题为“在家即可拥有的 Opus 级开源 27B 模型——实测见真章”,展示开源权重徽章、Apache 2.0 徽章以及 GPU 与服务器图标组,背景为干净的白色并搭配柔和的蓝色渐变点缀。
Guides & Insights

Qwen3.8-27B评测:被称为“居家版Opus”的开源权重27B模型——实测检验是否名副其实

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8 27B是目前可以自行托管的最强开源权重27B模型,而且优势相当明显。权重于2026年8月14日以Apache 2.0协议发布:一个密集27B(含视觉编码器为28B)的模型,拥有262K原生上下文、原生图像和视频输入,厂商报告的智能体编码得分达到或超过Claude Opus 4.6 Max——SWE-bench Pro 61.7、DeepSWE 1.1 42.2、LiveCodeBench v6 90.3。最亮眼的价格是零:下载55.6 GB即可运行。但需要注意的地方也确实存在——独立测试发现它比前代慢约三倍,也更耗token;规格表上的每项基准仍由阿里巴巴自报;1M上下文仅限托管版功能。结论:如果你有24 GB以上显存的GPU,想要接近前沿的能力又不想按量付费,那就自行托管——但入手前务必清楚哪些数字是虚的。

先下结论:你应该使用 Qwen3.8 27B 吗?

简短回答——对于本地和私有工作负载,答案是肯定的;在采购决策之前,请等待第三方评测数据。 Qwen3.8 27B是一款罕见的模型:开源权重即产品,API只是便利。由于采用Apache 2.0许可证,一旦你拥有硬件,每token的价格就永久为零,而且你基于它构建的任何东西都无法被追溯性地重新授权或计费。你所放弃的是速度、验证和便利性。

如果你已经在运行 Qwen3.6-27B 并且对它满意,那么升级是实实在在的,但在实际时间上并非没有代价。如果你是从 Qwen3.8-Max 发布而来,那么这是同一代中更小、可自托管的成员——一种用于不同工作的不同工具。

快速事实,2026年8月15日核实

发布——权重于2026年8月14日上线,位于Qwen/Qwen3.8-27B的Hugging Face页面,并镜像至ModelScope;由于时区差异,部分报道也提及8月13日,该发布距Qwen3.8系列公布约一周时间。

许可证 — Apache 2.0:可下载、修改、再分发、商用,附带明确的专利授权。永久有效。

参数——27B密集(计入视觉编码器为28B),64层,隐藏大小5,120,词汇量248,320。

架构——混合注意力:48 个 Gated DeltaNet 线性注意力层对比 16 个完整 Gated Attention 层(3:1 的比例)。这就是为什么一个 27B 密集模型能够支持 262K tokens 的原生上下文。

上下文 — 原生支持 262,144 个 token;可通过托管版本上的 YaRN 扩展至 1,000,000。

输入 — 在文本之外还支持原生图像和视频;返回文本。参数量显示为28B的原因在于视觉编码器。

思考:推理模式默认开启,可根据请求禁用; reasoning_effort(低/中/高)和 preserve_thinking用于长时间的代理运行。

权重 — 55.6 GB 的 BF16 safetensors,共 18 个分片;此外还提供 FP8 和社区版 GGUFs。

上述规格来自 Hugging Face 模型卡片和配置文件,适用于Qwen3.8 27B,这些内容已于今日读取。基准测试的声明由 Ali​baba 报告;截至目前,尚无独立实验室复现这些结果。

Qwen3.8 27B 真正擅长的事情

最有力的案例是智能体软件工程。Ali​baba 报告称 DeepSWE 1.1 较之前的 27B 提升了 3 倍(42.2 对 13.3),在 SWE-bench Pro 上的得分也超过了 Cla​ude Opus 4.6 Max(61.7 对 53.4)。正是这些数字为它赢得了“Opus at home”的绰号——一个稠密的 27B 模型,能在个人实际拥有的硬件上完成接近前沿水平的编码工作。

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

除了原始数字之外,还有三件事使其成为一个站得住脚的买入理由:

原生多模态。图像和视频输入,文本输出——包含图表的文档或视频演示无需单独的模型。视觉推理分数(启用思维链功能后为85.6,视觉数学为94.6,均为供应商报告数据)正是视觉编码器证明自身价值之处。

262K 原生上下文。长时程智能体任务、大型代码库以及多小时的转录文本都能容纳在一个窗口内。混合线性注意力设计使该上下文的 KV 成本低于同尺寸的纯全注意力模型。

免费、永久的权重。这正是该类别存在的全部意义:封闭 API 模型是租用的;Qwen3.8 27B则是自己拥有的。4 位量化下,它可以在 24 GB 显存的显卡(RTX 3090/4090 级别)上运行,而且 AMD 在发布当天就提供了支持(据 AMD 官方博客,在 Ryzen AI Max+ 395 上可达 24.5 tokens/s,在 Radeon AI PRO R9700 上可达 51.8 tokens/s)。

评论变得难看之处:速度、tokens 和验证

到目前为止,独立测试只是某一位测试者的测试框架,而不是实验室——但这是我们目前最好的信号。将 Qwen3.8 27BQwen3.6-27B在十项真实任务上进行对比(由 GPT-5.5 通过 llmcompare 测试框架评判),3.8 在十项中胜出九项,平均得分 8.838 对 6.862——测试者称其为“他所见过的更令人印象深刻的智能提升之一”。它还消耗了几乎三倍的 token,速度也慢得多;其中一项任务耗时约长了 600%。因此,质量提升是真实的,墙钟时间上的代价也同样真实。

还有四件事可以用来指责它:

还没有第三方基准测试。 本文中的每个头条数字均为Ali​baba截至8月15日报告的数据。供应商卡片很详细,但尚未有独立实验室进行复现。如果你的决策取决于经过验证的数字,请等待这些结果——权重文件不会消失。

显存门槛确实存在。 BF16 需要 80 GB 级别的 GPU。要在 24 GB 显卡上运行,必须使用 4-bit 量化,社区反馈(dev.to 评论帖,发布后几天内)称量化版本在长上下文中会"失去焦点"。有足够显存就用官方权重;没有就用量化版本。

1M 上下文仅限托管版本。 开源权重上限为 262K。可扩展至 1M 的说法是 Qwen Cloud 托管功能,并非本地副本开箱即用。

"Beats Opus" 需要附加限定条件。Agentic 基准测试会奖励特定于测试框架(harness)的行为,dev.to 发布帖上的一条热门评论直言不讳:"它们在真实世界的使用中并不能击败 opus。" 要把分数榜视为表现良好时的上限,而非一种承诺。

它在Qwe​n 3.8系列中的定位

对比 Qwen3.6-27B——相同的硬件级别和 262K 上下文,但能力大幅跃升,代价是速度和 token 效率。如果你已在运行 3.6 且受吞吐量限制,继续沿用也是合理的。

对比 Qwen3-Coder-30B-A3B——Coder 是一个 MoE,拥有约 3.3B 激活参数,运行速度快得多(约 90–110 tokens/s)。稠密的 27B 每个 token 更慢,但继承了这一代模型的智能体增益;如果 27B 的软件工程评分在独立测试中依然成立,那么 Coder-30B 的作用就会减弱。

vs Qwen3.8-Max——2.4T MoE 旗舰模型是数据中心模型(仅限 API,据公开报道每百万 token 约 $2/$6),支持 1M 上下文和视频。27B 才是可部署的那个。它们回答的是不同的问题。

成本:本地与API之争,尘埃落定

对于闭源模型,你比较的是每 token 的价格。对于Qwen3.8 27B,在你自己的硬件上,边际 token 的成本为零——真正的代价是前期的 GPU 投入和你的时间。在 4-bit 量化下,这需要一张 24 GB 的显卡;在 BF16 下,则需要 80 GB 级的机器。如果你只是想评估这个模型,或者缺乏相应硬件,也有托管方案:OrcaRouter 目前列出了Qwen3.8 27B,其中包含一个免费且限流的层级,收费 $0,超过限额后返回 HTTP 429;还有一个付费层级,每百万输入 token 收费 $0.33,每百万输出 token 收费 $2.40(查阅于 8 月 15 日)。Qwe​n Cloud 的托管版本支持 1M 上下文,标记为“即将推出”。

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

坦诚地讲:对于开放权重模型,提供商是便利,而非依赖。免费层是判断 55.6 GB 下载是否值得的最划算方式。但一旦你做出决定,权重本身才是关键——而且它们是免费的。

如何实际尝试一下

最快的评估——使用免费的限速托管层级;如果它能回答你需要的问题,那就完成了,而且不花一分钱。

在您的硬件上进行实际测试 — 下载社区版 GGUF(Q4_K_M 版本约 17 GB,可放入 24 GB 显存的显卡),然后在 llama.cpp 或 Ollama 中运行。请传入 Jinja 聊天模板,否则模型会以思考标签的形式回答您。若要使用 GGUF 的视觉功能,还需要单独的 mmproj 文件。我们关于在本地运行Qwen3.8 27B的指南逐步介绍了这个过程。

全精度 — 通过 huggingface-cli 将 Qwen/Qwen3.8-27B 下载到 80 GB 级 GPU 上。

核验您下载的内容——检查发布者是否为 Qwen 组织,并对照 crc32.txt 校验分片;发布前曾出现过仿冒仓库。

当这篇评测出错时(以及谁应该跳过Qwen3.8 27B)

你没有 GPU,也不会租用 GPU。免费套餐有速率限制,付费套餐每百万 tokens 收费 $0.33/$2.40——一个小型 API 模型或许能更便宜、更可靠地满足你的需求。此模型适合想要自主掌控推理的用户。

你需要一份SLA。 托管层级才上线几天;今天查看 OrcaRouter 模型页面,显示过去七天错误率为 33.3%,p50 首 token 延迟为 225 毫秒。这是一个处于早期负载下的全新模型,而非生产级合同。自托管用户应固定其下载提交版本,并保留备用方案。

购买决策需要经过验证的基准测试结果。厂商报告的数据仅具方向性参考价值,不足以作为采购依据。请等待独立复现的结果。

262K 开放权重的上下文还不够。目前,1M 扩展仅限托管。

你的瓶颈在于吞吐量。批量摘要或大批量处理会拖累性能:这是一个密集的27B模型,其token消耗量约为前代产品的3倍。对于廉价批量任务,更小或更快的模型更胜一筹。

你的显卡是12 GB的。2-bit GGUF虽然能勉强塞进去,但会有明显的质量损失;这个模型不适合你。

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

底线

Qwen3.8 27B是当今最强的开源权重 27B 模型,且在 Apache 2.0 许可下永久免费。如果你有 24 GB 以上显存的 GPU,想要智能体编码、262K 上下文和原生图像/视频输入,又不想面对按量计费的账单,这就是你要入手的选择。暂缓购买的理由也同样明确:你需要独立的基准测试验证、SLA(服务等级协议)、超过 262K 的开源权重上下文,或比稠密 27B 更高的吞吐量。模型已发布,权重是真实的,数据也很好看——只是要记住这些数据出自谁手。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube