
Qwen3.8-27B评测:被称为“居家版Opus”的开源权重27B模型——实测检验是否名副其实
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens · 22 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
Qwen3.8 27B是目前可以自行托管的最强开源权重27B模型,而且优势相当明显。权重于2026年8月14日以Apache 2.0协议发布:一个密集27B(含视觉编码器为28B)的模型,拥有262K原生上下文、原生图像和视频输入,厂商报告的智能体编码得分达到或超过Claude Opus 4.6 Max——SWE-bench Pro 61.7、DeepSWE 1.1 42.2、LiveCodeBench v6 90.3。最亮眼的价格是零:下载55.6 GB即可运行。但需要注意的地方也确实存在——独立测试发现它比前代慢约三倍,也更耗token;规格表上的每项基准仍由阿里巴巴自报;1M上下文仅限托管版功能。结论:如果你有24 GB以上显存的GPU,想要接近前沿的能力又不想按量付费,那就自行托管——但入手前务必清楚哪些数字是虚的。
先下结论:你应该使用 Qwen3.8 27B 吗?
简短回答——对于本地和私有工作负载,答案是肯定的;在采购决策之前,请等待第三方评测数据。 Qwen3.8 27B是一款罕见的模型:开源权重即产品,API只是便利。由于采用Apache 2.0许可证,一旦你拥有硬件,每token的价格就永久为零,而且你基于它构建的任何东西都无法被追溯性地重新授权或计费。你所放弃的是速度、验证和便利性。
如果你已经在运行 Qwen3.6-27B 并且对它满意,那么升级是实实在在的,但在实际时间上并非没有代价。如果你是从 Qwen3.8-Max 发布而来,那么这是同一代中更小、可自托管的成员——一种用于不同工作的不同工具。
快速事实,2026年8月15日核实
• 发布——权重于2026年8月14日上线,位于Qwen/Qwen3.8-27B的Hugging Face页面,并镜像至ModelScope;由于时区差异,部分报道也提及8月13日,该发布距Qwen3.8系列公布约一周时间。
• 许可证 — Apache 2.0:可下载、修改、再分发、商用,附带明确的专利授权。永久有效。
• 参数——27B密集(计入视觉编码器为28B),64层,隐藏大小5,120,词汇量248,320。
• 架构——混合注意力:48 个 Gated DeltaNet 线性注意力层对比 16 个完整 Gated Attention 层(3:1 的比例)。这就是为什么一个 27B 密集模型能够支持 262K tokens 的原生上下文。
• 上下文 — 原生支持 262,144 个 token;可通过托管版本上的 YaRN 扩展至 1,000,000。
• 输入 — 在文本之外还支持原生图像和视频;返回文本。参数量显示为28B的原因在于视觉编码器。
• 思考:推理模式默认开启,可根据请求禁用; reasoning_effort(低/中/高)和 preserve_thinking用于长时间的代理运行。
• 权重 — 55.6 GB 的 BF16 safetensors,共 18 个分片;此外还提供 FP8 和社区版 GGUFs。
上述规格来自 Hugging Face 模型卡片和配置文件,适用于Qwen3.8 27B,这些内容已于今日读取。基准测试的声明由 Alibaba 报告;截至目前,尚无独立实验室复现这些结果。
Qwen3.8 27B 真正擅长的事情
最有力的案例是智能体软件工程。Alibaba 报告称 DeepSWE 1.1 较之前的 27B 提升了 3 倍(42.2 对 13.3),在 SWE-bench Pro 上的得分也超过了 Claude Opus 4.6 Max(61.7 对 53.4)。正是这些数字为它赢得了“Opus at home”的绰号——一个稠密的 27B 模型,能在个人实际拥有的硬件上完成接近前沿水平的编码工作。

除了原始数字之外,还有三件事使其成为一个站得住脚的买入理由:
• 原生多模态。图像和视频输入,文本输出——包含图表的文档或视频演示无需单独的模型。视觉推理分数(启用思维链功能后为85.6,视觉数学为94.6,均为供应商报告数据)正是视觉编码器证明自身价值之处。
• 262K 原生上下文。长时程智能体任务、大型代码库以及多小时的转录文本都能容纳在一个窗口内。混合线性注意力设计使该上下文的 KV 成本低于同尺寸的纯全注意力模型。
• 免费、永久的权重。这正是该类别存在的全部意义:封闭 API 模型是租用的;Qwen3.8 27B则是自己拥有的。4 位量化下,它可以在 24 GB 显存的显卡(RTX 3090/4090 级别)上运行,而且 AMD 在发布当天就提供了支持(据 AMD 官方博客,在 Ryzen AI Max+ 395 上可达 24.5 tokens/s,在 Radeon AI PRO R9700 上可达 51.8 tokens/s)。
评论变得难看之处:速度、tokens 和验证
到目前为止,独立测试只是某一位测试者的测试框架,而不是实验室——但这是我们目前最好的信号。将 Qwen3.8 27B与Qwen3.6-27B在十项真实任务上进行对比(由 GPT-5.5 通过 llmcompare 测试框架评判),3.8 在十项中胜出九项,平均得分 8.838 对 6.862——测试者称其为“他所见过的更令人印象深刻的智能提升之一”。它还消耗了几乎三倍的 token,速度也慢得多;其中一项任务耗时约长了 600%。因此,质量提升是真实的,墙钟时间上的代价也同样真实。
还有四件事可以用来指责它:
• 还没有第三方基准测试。 本文中的每个头条数字均为Alibaba截至8月15日报告的数据。供应商卡片很详细,但尚未有独立实验室进行复现。如果你的决策取决于经过验证的数字,请等待这些结果——权重文件不会消失。
• 显存门槛确实存在。 BF16 需要 80 GB 级别的 GPU。要在 24 GB 显卡上运行,必须使用 4-bit 量化,社区反馈(dev.to 评论帖,发布后几天内)称量化版本在长上下文中会"失去焦点"。有足够显存就用官方权重;没有就用量化版本。
• 1M 上下文仅限托管版本。 开源权重上限为 262K。可扩展至 1M 的说法是 Qwen Cloud 托管功能,并非本地副本开箱即用。
• "Beats Opus" 需要附加限定条件。Agentic 基准测试会奖励特定于测试框架(harness)的行为,dev.to 发布帖上的一条热门评论直言不讳:"它们在真实世界的使用中并不能击败 opus。" 要把分数榜视为表现良好时的上限,而非一种承诺。
它在Qwen 3.8系列中的定位
• 对比 Qwen3.6-27B——相同的硬件级别和 262K 上下文,但能力大幅跃升,代价是速度和 token 效率。如果你已在运行 3.6 且受吞吐量限制,继续沿用也是合理的。
• 对比 Qwen3-Coder-30B-A3B——Coder 是一个 MoE,拥有约 3.3B 激活参数,运行速度快得多(约 90–110 tokens/s)。稠密的 27B 每个 token 更慢,但继承了这一代模型的智能体增益;如果 27B 的软件工程评分在独立测试中依然成立,那么 Coder-30B 的作用就会减弱。
• vs Qwen3.8-Max——2.4T MoE 旗舰模型是数据中心模型(仅限 API,据公开报道每百万 token 约 $2/$6),支持 1M 上下文和视频。27B 才是可部署的那个。它们回答的是不同的问题。
成本:本地与API之争,尘埃落定
对于闭源模型,你比较的是每 token 的价格。对于Qwen3.8 27B,在你自己的硬件上,边际 token 的成本为零——真正的代价是前期的 GPU 投入和你的时间。在 4-bit 量化下,这需要一张 24 GB 的显卡;在 BF16 下,则需要 80 GB 级的机器。如果你只是想评估这个模型,或者缺乏相应硬件,也有托管方案:OrcaRouter 目前列出了Qwen3.8 27B,其中包含一个免费且限流的层级,收费 $0,超过限额后返回 HTTP 429;还有一个付费层级,每百万输入 token 收费 $0.33,每百万输出 token 收费 $2.40(查阅于 8 月 15 日)。Qwen Cloud 的托管版本支持 1M 上下文,标记为“即将推出”。

坦诚地讲:对于开放权重模型,提供商是便利,而非依赖。免费层是判断 55.6 GB 下载是否值得的最划算方式。但一旦你做出决定,权重本身才是关键——而且它们是免费的。
如何实际尝试一下
• 最快的评估——使用免费的限速托管层级;如果它能回答你需要的问题,那就完成了,而且不花一分钱。
• 在您的硬件上进行实际测试 — 下载社区版 GGUF(Q4_K_M 版本约 17 GB,可放入 24 GB 显存的显卡),然后在 llama.cpp 或 Ollama 中运行。请传入 Jinja 聊天模板,否则模型会以思考标签的形式回答您。若要使用 GGUF 的视觉功能,还需要单独的 mmproj 文件。我们关于在本地运行Qwen3.8 27B的指南逐步介绍了这个过程。
• 全精度 — 通过 huggingface-cli 将 Qwen/Qwen3.8-27B 下载到 80 GB 级 GPU 上。
• 核验您下载的内容——检查发布者是否为 Qwen 组织,并对照 crc32.txt 校验分片;发布前曾出现过仿冒仓库。
当这篇评测出错时(以及谁应该跳过Qwen3.8 27B)
• 你没有 GPU,也不会租用 GPU。免费套餐有速率限制,付费套餐每百万 tokens 收费 $0.33/$2.40——一个小型 API 模型或许能更便宜、更可靠地满足你的需求。此模型适合想要自主掌控推理的用户。
• 你需要一份SLA。 托管层级才上线几天;今天查看 OrcaRouter 模型页面,显示过去七天错误率为 33.3%,p50 首 token 延迟为 225 毫秒。这是一个处于早期负载下的全新模型,而非生产级合同。自托管用户应固定其下载提交版本,并保留备用方案。
• 购买决策需要经过验证的基准测试结果。厂商报告的数据仅具方向性参考价值,不足以作为采购依据。请等待独立复现的结果。
• 262K 开放权重的上下文还不够。目前,1M 扩展仅限托管。
• 你的瓶颈在于吞吐量。批量摘要或大批量处理会拖累性能:这是一个密集的27B模型,其token消耗量约为前代产品的3倍。对于廉价批量任务,更小或更快的模型更胜一筹。
• 你的显卡是12 GB的。2-bit GGUF虽然能勉强塞进去,但会有明显的质量损失;这个模型不适合你。

底线
Qwen3.8 27B是当今最强的开源权重 27B 模型,且在 Apache 2.0 许可下永久免费。如果你有 24 GB 以上显存的 GPU,想要智能体编码、262K 上下文和原生图像/视频输入,又不想面对按量计费的账单,这就是你要入手的选择。暂缓购买的理由也同样明确:你需要独立的基准测试验证、SLA(服务等级协议)、超过 262K 的开源权重上下文,或比稠密 27B 更高的吞吐量。模型已发布,权重是真实的,数据也很好看——只是要记住这些数据出自谁手。
