
Qwen3.8-27B 编程版:权重发布前值得期待的事
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 2401 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
如果你在本地运行代码模型,那么阿里 2026 年 8 月 3 日 Qwen3.8 发布中最值得关注的数字并不是 Qwen3.8-Max 那 2.4 万亿参数的头条新闻——而是 FrontierSWE 得分从上一代的 40.7 跃升到这一代的 73.5。{{1}}这个跃升发生在旗舰模型上。而有可能把其中一部分能力带到你自己硬件上的模型,是 Qwen3.8-27B——Qwen3.8 一代中约 270 亿参数的开源权重成员,{{2}}与旗舰同日发布,截至本文写作时还无法下载。这是一篇"目前已知信息"的概述,不是评测:阿里巴巴实验室之外还没有人运行过 Qwen3.8-27B,没有官方模型卡,现在任何声称是它的下载都是占位符或第三方上传。{{/2}}{{/1}}
以下是任何计划围绕27B搭建本地编码环境的人所面临的坦诚起点:旗舰版的提升目前仅为供应商自述,要等到独立测试结果出炉才能确认;27B自身的规格尚未得到证实;而今天我们可以实际衡量的是其前代产品Qwen3.6-27B——这款模型在2026年已经是最优秀的本地编码模型之一。这就是本代产品必须超越的基准线,而这条线相当高。
为什么27B是程序员真正关心的模型
Qwen3.8-Max 是一款数据中心级模型:这是一个 2.4T 参数的混合专家(MoE)模型,激活参数约 950 亿,支持 100 万 token 的上下文,且没有面向消费者的本地运行途径。Qwen3.8-27B 则是截然不同的押注——一个约 27B 级别的开放权重模型,专为单 GPU 设计,定位为这一代产品中可自行托管的版本。对于开发者群体来说,27B 才是真正的产品;Max 则证明了这一代的训练确实带来了实质性的突破。
那个"某物"是什么,按照阿里巴巴自己的评估:Terminal-Bench 2.1 得分为 86.6(高于 Qwen 3.7 Max 的 74.5),SWE-bench Pro 为 67.7,PaperBench 为 93.0,FrontierSWE 则从 40.7 跃升至 73.5——这标志着长时程、智能体式编码的阶跃式变化,即模型自主处理多步骤仓库任务,而非回答单个提示。独立追踪机构测得 Qwen3.8-Max 的 Artificial Analysis 编码指数为 71.8、智能指数为 58.1,所以即便剔除阿里巴巴的营销话术,这一代模型的进步也是真实存在的。这些数字没有一项能直接转移到 27B 上,但它们正是 27B 成为 2026 年下半年最受期待的本地编码模型的原因:一个更小的模型,哪怕只继承了那种智能体式改进的一小部分,都将重新定义 27B 规模下"优质本地编码"的含义。

前代树立了标杆:Qwen3.6-27B
Qwen3.6-27B 是所有面向 3.8 27B 的预测所基于的模型,因为它属于同一类别、遵循相同的物理规律。它是一个 27B 稠密模型,拥有 262K 原生上下文、思考与非思考双模式、原生文本/图像/视频输入,以及 Apache 2.0 许可证。它作为本地代码模型赢得声誉,靠的不是在每项基准测试中夺冠,而是成为在可用质量下仍能适配消费级 GPU 的最大模型——即在规模/质量曲线上,你不再需要用能力换取硬件的那一点。
这就是3.8-27B的上下文窗口:在相同硬件成本下,它至少需要与3.6-27B一样好,理想情况下在智能体任务上更出色,因为这是切换的唯一正当理由。如果它在原始编码上匹敌3.6,并加入这一代的智能体改进,它就会成为本地默认选择。如果它只是重复相同的分数,那这次升级就没什么意义。
硬件现实:纠结 16 GB 是问错了问题
由于没有官方规格,VRAM 的预测来自 Qwen3.6-27B 的测量,诚实的总结是:4-bit 量化是 24 GB 的游戏,不是 16 GB 的。在 Q4_K_M 下,权重大约为 16–17 GB,听起来 16 GB 的显卡能装下——直到 KV 缓存和模型的开销把实际需求推到约 20–24 GB。阿里云自己的文档给出的实际指导很直白:Q4_K_M 在实际使用中放不进 16 GB 的 GPU。社区的数据大致集中在:
• Q3_K_M — 约13 GB的权重,适配12–16 GB显卡,质量有所降低
• Q4_K_M — 权重约 16–17 GB,算上上下文实际约 20–24 GB — RTX 3090/4090 的甜点区
• Q6_K — 约21–22 GB,在24 GB显存显卡上近乎无损
• Q8_0 — 约 28.6 GB,需要 32 GB
• BF16 全精度 — 约 54–56 GB,任何消费级 GPU 都无法企及
Unsloth 预览了一个 4-bit 构建,运行大约需要 17 GB 显存,这与 ~27B 模型在 4-bit 量化下的预期一致——请将此视为无上下文、精简工作负载的下限,而非您的生产环境数值。如果正在规划硬件,请以 24 GB 显存的显卡为规划基准。
工具链:第一天与第二周分别交付什么
{{1}}权重发布时,支持不会一下子全部到位。{{/1}}服务引擎 vLLM 和 SGLang 通常会在阿里巴巴发布后的几天内合并支持,这正是自托管用户能快速获得 OpenAI 兼容端点的方式。{{2}}社区的 GGUF 和 AWQ 量化版本会滞后一到两周,{{/2}}这意味着通过基于 llama.cpp 的工具(Ollama、LM Studio)获得的“拉取即运行”体验会落后于原始权重——{{3}}而且如果 27B 与 Max 共享真正全新的架构,而非复用 3.6 的布局,预计工具支持需要更长时间。{{/3}}在最初一两周内,最快的路径是在未量化权重上运行 vLLM,而不是一键拉取。

一个27B模型在智能体工作中究竟能做什么
正确设定预期:16天的自主演示——阿里巴巴的Qwen3.8在数百次提交中构建自我进化的智能体框架,无需人工干预——是旗舰级展示。27B模型做不到这一点。根据社区对Qwen3.6-27B和Qwen3-Coder-30B-A3B的使用经验,27B级本地编码模型已被证实表现出色的是:
• 梳理并分流工单,识别根本原因,并为更强的模型完成工作奠定基础
• 以交互速度处理仓库级重构和工具调用循环
• 在本地运行你的日常编码量 — 数据留在你的机器上,成本固定
• 对完全修复真正复杂的 bug 保持约 50/50 的成功率——足够有用,但可靠性还不足以成为你唯一的智能体
{{1}}{{KEEP}}27B{{/KEEP}} 是一个带有判断尾部的容量模型。它在你工作负载的高容量中间部分会表现出色,{{2}}而在最难的百分之十上出错{{/2}}。这不是缺陷;{{3}}这就是设计{{/3}}。
围绕它构建:拆分流量
大多数团队最终采用的方案是一种拆分:本地 27B 处理常规量——日常代码生成、样板代码、重构、lint 风格修复——而托管的尖端模型处理困难的长尾部分,在这些任务中,质量上多出的几个百分点足以证明 API 成本的合理性。运行这种拆分的干净方式是通过路由器,因为两边的失败率不同,你不希望智能体流水线卡在本地瓶颈或供应商故障上。
这就是OrcaRouter所面向的工作流程。Qwen3.8-Max已在该提供商列表价格下上线——每百万输入token 2美元,每百万输出token 6美元——零加价直通传递,因此当阿里降价时,你的账单当天就会同步下降。你只需将一个兼容OpenAI的端点指向分流配置,把高难度的长尾流量路由到Qwen3.8-Max,本地27B模型则在权重落地后用于承接常规流量,同时让自动故障转移在无需改动代码的情况下捕获缓慢或故障的提供商。你可以在自己的硬件上评估27B模型,而生产路径保持在线——尚未得到验证的模型永远不会成为单点故障。

体重下降当天要检查什么
当官方仓库出现在 Hugging Face 或 ModelScope 上时,在基于它构建任何内容之前,请先验证以下几点:
• 该仓库位于官方 Qwen 组织下——不是镜像,也不是冒名者
• LICENSE 文件确实存在,且与发布说明中所声称的许可证相符。
• 模型卡披露了上下文窗口、架构(密集或MoE)以及思考模式。
在 Terminal-Bench 或 Artificial Analysis 上出现首批独立运行结果之前,厂商的宣称始终只是厂商的宣称。
• GGUF 支持现已登陆 llama.cpp 和你最爱的本地运行时
关于最后一点,早先的原则仍然适用:在独立运行确认编码收益之前,应将从 FrontierSWE 继承的承诺视为测试的理由,而非发布的理由。
公允地说,期望如下: Qwen3.8-27B 从纸面上看是 2026 年最有前景的本地编程发布——久经考验的 27B 基线,加上一代智能体训练带来的增益,硬件成本也是社区早已知道如何承担的。它能否兑现,取决于权重中实际包含的内容。关注官方仓库,阅读许可证,让第一个独立基准测试来做裁决。在此之前,Qwen3.6-27B 继续坐镇,而路由托管的旗舰模型则承担最困难的部分。
