
Qwen3.8-27B 开放权重:Max 已发布,27B 未发布——我们现在所知的情况
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
2026年8月13日,阿里巴巴为其 Qwen3.8 系列承诺的开放权重周一分为二。Max 级旗舰模型的权重——Qwen3.8-2.4T-A95B,一个 2.4 万亿参数的稀疏混合专家模型,也是有史以来首个可下载的 Max 级 Qwen 发布版——实际上已上线 Hugging Face 和 ModelScope,并于前一天深夜通过 ModelScope 社区宣布。本页所讨论的较小模型Qwen3.8-27B则没有:它原定于 8 月 10 日那一周发布,但目前仍没有官方仓库、模型卡、许可文件或自己的基准测试,第三方跟踪器现在将其描述为延期发布,且未给出新日期。本“目前已知信息”页面原本要回答的问题——“27B 到底何时发布?”——现在变成了两个:为什么 Max 的权重先发布?27B 又发生了什么?
这仍然是一篇"截至目前已知信息"的汇总文章,而非评测。Qwen3.8-Max作为API旗舰版本,自8月3日起上线,定价为每百万token 2美元/6美元;其底层开源权重基础模型Qwen3.8-2.4T-A95B已于8月13日开放下载;而Qwen3.8-27B的权重仍未发布。下文每项声明均相应标注为已确认、厂商报告或社区估算。
信号,以及本周实际兑现的内容
早期信号是@kimmonismus在X上发的帖子,他将“下周”标为值得关注的一周:“Qwen-3.8 27b - Grok 4.6”,而Astra明显不在名单上。那一周的Grok部分于8月12日发布。Qwen那一半则一分为二。这条帖子捕捉到的是以观察模型发布为业的人们的情绪——Qwen3.8开放权重发布是日历上的大事,而那一周到来时,具体细节仍未敲定。一周后,细节已部分明朗:承诺的两个开放权重发布中有一个已经落地,而且不是帖子点名的那个。
确认了什么?
• 这个系列是真实存在的,并且已正式发布。阿里巴巴于2026年8月3日发布了Qwen3.8基础模型系列,此前在7月中旬曾推出过一个预览版本。
• Qwen3.8-Max 同日发布。这款API旗舰模型——一个2.4万亿参数的混合专家模型,拥有约950亿激活参数、100万token上下文窗口,并支持文本、图像和视频输入——已在Qwen API上线,定价为每百万token 2美元/6美元。它也可通过OrcaRouter以相同的官方标价获取,0%加价转售。
• Max 的开放权重已于 8 月 13 日发布。 Qwen3.8-2.4T-A95B——Qwen3.8-Max API 所基于的基础模型——现已可从 Hugging Face 和 ModelScope 下载,并附带 FP8 量化版本。这是史上首次 Max 级别的 Qwen 开放权重发布。该可下载模型为纯文本模型,强制开启思考模式,原生支持 256K token 的上下文长度,可扩展至约 1M,并可在 SGLang、vLLM 和 TokenSpeed 上部署。
• Qwen3.8-27B 是该系列中较小的开放权重模型——仍未发布。阿里巴巴将其定位为本地和私有化部署的现实路径,并承诺将其权重与 Max 模型的权重一同发布到 Hugging Face 和 ModelScope 上。截至 8 月 13 日,仍然没有官方的 Qwen3.8-27B 仓库。承诺是真实的;交付尚未兑现。
• 该世代的首个独立评分已经出炉。Artificial Analysis 将 Qwen3.8-Max 的智能指数评为 56,每个任务约 1.14 美元——确实不错,但也带有任何刚发布数日的旗舰机型都会有的注意事项。
关于27B我们实际上知道些什么
诚实的总结是,“Qwen3.8-27B”在很大程度上仍然只是一个名称和一个参数数量。已确认的事实是:它是一个约270亿参数的模型,是Qwen3.8一代中的开源权重成员,而且它的规模定位是单GPU和本地部署,而非面向数百个GPU的集群。Unsloth的Daniel Han报告称,发布时它应能装入约17GB的显存——相当于一张专业级消费显卡。
其他一切均未得到证实。阿里巴巴尚未公布 27B 是密集模型还是专家混合模型、其上下文窗口、支持哪些模态,或任何其自身的基准测试分数。本周发生变化的是时间安排:Max 和 27B 原本承诺在同一周发布,但只有 Max 如期而至。第三方追踪器现在报告 27B 已推迟且没有新日期——这是社区解读,并非阿里巴巴官方声明;该仓库仍有可能在承诺的那一周完全结束之前上线。但截至撰写本文时,Hugging Face 上的官方 Qwen 组织并未列出 Qwen3.8-27B,而搜索中出现的少量“Qwen3.8-27B-FP8”、“-GGUF”和“-MLX”仓库,都是社区占位卡,下载量只有个位数,并非官方发布。
有用的参考基准仍是上一代的27B:Qwen3.5-27B,一个开放权重稠密模型,拥有32K上下文窗口。它是Qwen3.8-27B必须超越的合理下限,同时提醒我们,Qwen 27B级别的模型历来是为在开发者实际拥有的硬件上运行而构建的。
Max 是 27B 可能继承内容的参考点

27B将无法达到Max的原始上限,但Max的数据——现在已发布在真正的模型卡中——为这一代改进的表现设定了预期。在阿里巴巴对开放权重模型自身的评估中,Qwen3.8-2.4T-A95B在PaperBench上得分为93.0,在OSworld-Verified上为86.1,在参数化CAD上为91.5,在SWE-bench Pro上为67.7,在Terminal-Bench 2.1上为86.6,该供应商声称与Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro持平。这些是供应商报告的数字,已发布在发布材料中,尚未由独立实验室复现。API发布所称的智能体性能提升——FrontierSWE在一代之内从40.7跃升至73.5——也出现在相同的发布材料中。即使这一改进只有一部分下放到27B,也将重新定义“好的本地编码模型”在该类别中的含义。
有一个值得记住的细微差别:可下载的 Max 与 API Max 并不完全相同。Qwen3.8-2.4T-A95B 仅支持文本,且强制开启思考模式;而 Qwen3.8-Max API 则增加了视觉输入、非思考模式,以及默认 1M token 的上下文。这种差距正是 27B 很可能继承的那类问题——当你在阅读“Qwen3.8”基准测试标题,却没有核实它们描述的是哪个版本时,这一点值得牢记。
价格是Max最具优势之处:API上整个100万token上下文中,每百万token收费2美元/6美元,且没有长提示附加费。对于一个前沿API来说,这相当激进,而且对路由计算很关键——在这样的价格下,3.8 代成为了那些过去默认使用更昂贵旗舰模型的工作负载的一个可选方案。
什么才能真正运行它

对于27B,阿里巴巴仍未公布硬件要求,因此流传的数字仍是基于Qwen 3.6-27B量化表的社区推测——是估算值,而非官方规格。大多数人赖以规划的工作范围没有变化:
• Q4_K_M 量化,约 16GB 显存——RTX 4090 或同等配置,是大多数本地开发者会瞄准的理想选择。
• Q3_K_M 量化,约13GB显存 — 适合RTX 3060这类12GB显卡,但画质会降低。
• Q6_K 量化,约 21GB 显存——在 24GB 显卡上近乎无损。
• FP8 推理服务,约 27GB 显存 — 根据此前的预估,单个 L40S 即可用于生产级推理。
• 全精度,H100 80GB——这是达到基准质量的路径,但并非大多数团队会运行的方式。
新的变化在于:{{1}}现在可以自行托管 Qwen3.8 这一代{{/1}} 这句话确实没错,但并非针对人们原本规划的那个模型。Max 的开放权重完全属于另一种硬件级别:全精度 BF16 模型大约 4.9TB,Unsloth 的 1 位分层选择性量化可将其降至约 397GB——可以运行,但需要合计 410GB 或更多的内存加显存。那是正经的基础设施,不是准专业级显卡能承担的。这正是 {{2}}27B{{/2}} 所要填补的差距,因此 {{3}}27B{{/3}} 的持续缺席,使得这一代模型至今仍不存在单 GPU 本地运行的路径。
许可问题:Max刚刚开创了先例。
关于27B的许可问题仍未得到解答,但“它会是什么样子”已不再是猜测。Max的开源权重是以名为“qwen3.8-max”的自定义许可发布的,而非Apache 2.0。正如模型卡中所述,它通常可免费用于商业使用和托管,但在规模扩大时会触发额外要求:月活跃用户超过1亿或月收入超过2000万美元的产品必须显示模型名称;年收入超过5000万美元且提供模型即服务或AI工作助手服务的公司则需要单独授权。有传言称该许可禁止在美国、欧盟、英国和韩国使用,这并不属实——该许可不包含任何地域限制。
具体到27B,尚未指定许可证。但Max采用的是定制的Qwen许可证,而非Apache 2.0,因此对同系列模型来说,假设为Apache 2.0也并不可靠。旧的通义千问许可证——其1亿月活(MAU)条款——并不是Max所获得的;Max获得的是一份新的、按规模分级的许可证。在制定相关计划之前,请阅读实际仓库中的LICENSE文件,并预期27B的许可证要等到其仓库发布时才会确定。
工具链时机:首日支持刚刚得到验证
服务引擎的推进速度与预期一致——针对已发布的模型而言。Qwen3.8-2.4T-A95B 发布时已在 SGLang、vLLM 和 TokenSpeed 中获得可用支持,这就是大型开放权重版本所呈现的 {{1}}几乎立即可通过 API 提供服务{{/1}} 的样子。对于 27B 来说,只要其仓库出现,这些引擎很可能是最先提供支持的;而 Max 在发布首日即获覆盖,使得 27B 继承这一支持成为合理预期。社区 GGUF 和 AWQ 量化通常仍会滞后一到两周,因此 Ollama 式的 {{2}}拉取即运行{{/2}} 体验在 27B 发布当天很可能仍然不会出现——最初本地使用可能仍需手动配置 vLLM 或 llama.cpp。
尚不明确之处
一篇诚实的泄密报道止步于实际公开的内容,而这个边界与一周前相比,一个方向更宽,另一个方向更窄:Max 的问题得到了回答,27B 的却没有。
• 新的发布日期。承诺的是"8月10日那一周";那一周已近尾声,仓库却仍未出现。第三方追踪平台报告称此次延期且未告知新日期,但阿里巴巴并未发表官方声明。
• 架构。 27B 模型采用 Dense 还是 MoE 架构;若为 MoE,则需说明激活参数数量。
• 规格表。 上下文窗口、模态、输出限制、推理模式。
• 基准测试。27B 没有官方评分,也未经独立评估。
• 许可证。在27B的代码库发布之前尚未决定;Max的自定义许可是值得关注的前例。
• 镜像风险。 占位符问题现在已经公开出现——社区中已存在 "Qwen3.8-27B-FP8"、"-GGUF" 和 "-MLX" 的模型卡片,但没有任何官方文件。在官方 Qwen 组织发布仓库之前,请仅从官方组织页面下载。
这对构建者意味着什么
Qwen3.8 这一代的实际划分现在是三路而非两路。如果你想今天就用上前沿 API,Qwen3.8-Max 已通过 OrcaRouter 上线,按提供商的 $2/$6 标价提供,不加价转售——你看到的价格就是 Alibaba 设定的价格。如果你想自行托管 Max 级模型,开放权重现在即可下载,但你需要相应的硬件:全精度模型约 4.9TB,量化模型约 397GB。而如果你想要这一代本应提供的单 GPU 本地部署,你仍在等待 Qwen3.8-27B——它尚未发布。目前,一个兼容 OpenAI 的密钥即可覆盖 API 侧;等 27B 的托管落定后,同一个密钥也能路由到它。

最后这一点是更普遍的论点,而一个未经证实、延迟发布的开放权重模型正是检验这一点的案例。一个甚至尚未发布的模型,没有过往记录,没有独立的基准测试套件,也没有事故历史——而当它真正到来时,它将完全是全新的。路由就是你如何在不把面向客户的路径押注在它身上的情况下尝试它的方式:将能够容忍意外的流量发送给它,当它行为异常时自动故障转移到经过验证的模型,一旦它赢得了信任,就把整个工作负载切换过去。路由层也是让价格计算变得诚实的因素——当阿里巴巴降低你通过同一个端点调用的模型价格时,变更当天就会生效,因为标价是直接传递的。
看什么
• 27B 的仓库是否会出现。在 Hugging Face 或 ModelScope 上,官方 Qwen 组织名下出现列表,才是延迟结束的标志——而 8 月 10 日这一周已近结束,却仍未出现。
• 27B 的许可证文件。Max 随附的是定制的按规模分级许可证,而非 Apache 2.0。27B 是否会遵循这一先例,是其最终公告中最具决定性的一句话。
• 架构与上下文长度。Dense与MoE的对比以及上下文窗口决定了27B的用途。
• 首个独立基准测试。Max 在 Artificial Analysis 智能指数上取得的 56 分设定了基准;27B 的首次外部评测将告诉你,这一代模型的增益有多少能在消费级规模下得以保留。
• 工具链覆盖。27B 是否会继承 Max 发布首日就有的 SGLang/vLLM/TokenSpeed 支持,以及社区量化版本会多快跟进。
常见问题
Qwen3.8-27B 已经发布了吗?
不。阿里巴巴于2026年8月3日宣布了这一消息,并承诺在8月10日那一周将权重上传至Hugging Face和ModelScope,但截至8月13日,仍没有官方的Qwen3.8-27B仓库、模型卡或许可证。Max级开放权重——Qwen3.8-2.4T-A95B——已于8月13日发布;27B版本则没有,第三方追踪器报告称其已延期且未给出新日期。
运行Qwen3.8-27B需要什么硬件?
尚未确认,但基于Qwen 3.6-27B量化表的社区预测显示,Q4_K_M量化大约需要16GB显存(对应RTX 4090),Q3_K_M量化大约需要13GB(12GB显存显卡),Q6_K量化大约需要21GB(24GB显存显卡),FP8推理服务大约需要27GB(单张L40S)。Unsloth的Daniel Han报告称发布时约为17GB。在官方模型卡发布硬件指引之前,请将这些视为估算值。
Qwen3.8-27B 可以通过 OrcaRouter 使用吗?
{{1}}还没有。{{/1}}Qwen3.8-27B 是开放权重、可自托管的模型,目前尚未上线该平台。同一系列的旗舰型号——Qwen3.8-Max——现可通过 OrcaRouter 使用,按提供商每百万 token $2/$6 的挂牌价,不加价。当 {{2}}27B 的托管部署完成{{/2}}后,即可添加到同一个 OpenAI 兼容密钥中。
我该等{{1}}Qwen3.8-27B{{/1}}还是今天就使用{{2}}Qwen3.8-Max{{/2}}?
这取决于工作负载运行在哪里。如果你现在需要一个前沿API,Qwen3.8-Max 已经上线,并且定价激进,每百万token仅需 $2/$6。如果你想今天就自托管 Max 级别的模型,Qwen3.8-2.4T-A95B 现已可下载,但它需要相当强悍的硬件——大约是4.9TB的全精度模型,或者约397GB的量化版本,并且需要410GB以上的内存和显存组合。如果你需要在单张消费级显卡上运行本地或本地部署模型,Qwen3.8-27B 仍然值得等待——它是这一代中现实的自托管路径,而其发布时间现在是一个悬而未决的问题,而不是一个固定的日期。
承诺的一周即将结束,但其中一半的承诺并未兑现。Qwen3.8-2.4T-A95B 已可下载、已获授权、可提供服务;Qwen3.8-27B 已确认存在,仍承诺开放权重,但依然没有代码仓库、许可证、基准测试或新的日期。观察 27B 的代码仓库是否在承诺的一周完全结束前上线、其许可证文件与 Max 的相比内容如何,以及首批独立评测给出怎样的分数。这三个信号会告诉你,这只是常规的两步式开放权重发布、较小的模型还在后头,还是值得提前规划的延迟。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
