
Qwen3.8-27B:阿里巴巴Qwen3.8系列中的紧凑型多模态模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 316 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
Qwen3.8-27B 是 Alibaba Qwen3.8 世代中稠密的单节点成员:一个 270 亿参数的原生视觉语言模型,以 Apache 2.0 许可发布于 Hugging Face,可接受文本、图像和视频输入,并返回文本,上下文窗口为 262,144 个 token。本页是该模型的参考页面——关于它是什么、调用它需要多少成本、以及它能做什么的权威说明——而值得一开始就讲清楚的是:为什么我们会为一个权重最早出现于 2026 年 8 月、而非过去七天内的模型建立页面。我们并不是在报道一次发布。我们是在回答一个长期存在的问题:每月都有数千次读者因 "Qwen3.8-27B" 这个名字找到我们,而在此之前,我们没有任何一个页面承载过这一答案。该模型自身的发布——其日期标注在 Qwen 的模型卡上,并被 Artificial Analysis 记录为 2026-08-14——是本页用来为该模型断代的一个事实,而不是本页所报道的事件。
把它当作它本就是的例外来读:按严格的七天标准来看,2026年8月中旬的模型并不算新近,这条内容会被当作新闻跳过。这里的依据不同。它是一个参考页面,其中的数字已于 2026-09-28 对照 Qwen 自己的模型卡、该仓库的许可证文件、Qwen Cloud 价目表和 Artificial Analysis 进行核实,而其存在的理由是我们在同一天以第一方方式测得的搜索需求。它不是第二份公告,任何人都不应把它当作公告来读。
27B 在 Qwen3.8 系列中的定位
Qwen3.8 这一代并不是单一模型,而尺寸后缀正是这个名称的关键所在。Qwen 自己在整个系列中的仓库说明明确点明了这种拆分:
• Qwen3.8-27B — 27B 稠密参数,原生图像与视频输入,Apache 2.0。部署友好型成员:模型规模适合在单块 GPU 或小型节点上运行,也是本页的主题。
• Qwen3.8-Max,基于 Qwen3.8-2.4T-A95B 构建——总参数量达 2.4 万亿,激活参数 95B,是 Alibaba 在本代首次开源的 Qwen-Max 级别模型。其代码仓库采用的是量身定制的 qwen3.8-max 许可证,而非 Apache 2.0。
• Qwen3.8-Flash-Next——Qwen 称将支撑 Qwen4 的实验性架构预览版,依据 qwen-community-1.0 许可协议发布。托管版 Qwen3.8-Flash 正是基于它构建。
所以 "27B" 并不是 Max 模型的一个配置等级;它是一支团队实际能够服务的规模级别。Alibaba 声称它继承的是训练配方:卡片将 Qwen3.8-27B 描述为把这一代在编程、专业工作、研究以及长时程智能体任务上的进展,压缩进一个稠密检查点。

Qwen 发布的架构
以下每个数字均来自 Qwen/Qwen3.8-27B 的模型卡,即厂商自己的文档:
• 参数 — 如宣传所称的 27B。该仓库自身的 safetensors 元数据显示,18 个分片中共有 27,781,427,952 个 BF16 参数,因此计入视觉塔后约为 27.8B。这里没有混合专家(MoE):所有参数在每个 token 上都会激活。
• 形状 — 64 层,隐藏维度 5,120,前馈中间维度 17,408,token 嵌入和 LM 输出 248,320(填充)。
• 混合注意力——Qwen 输出的布局是 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)):每 1 个全注意力块对应 3 个线性注意力块,比例为 3:1。Gated DeltaNet 在头维度为 128 的情况下,为 V 运行 48 个线性注意力头,为 QK 运行 16 个;Gated Attention 在头维度为 256 的情况下,运行 24 个查询头对 4 个 KV 头,旋转维度为 64。正是这一比例,才让 262K 的窗口在 27B 模型上变得可行,而它也正是 Qwen3.8-Flash-Next 以稀疏注意力加以扩展的同一谱系。
• 多词元预测 — 卡片说明该模型通过多个步骤以 MTP 进行训练,这是一种在支持 MTP 的服务栈中加速生成的草稿技巧。
• 思考控制 — 思考模式默认开启,可按请求关闭。reasoning_effort 可取 xhigh(默认)、medium 或 low,且 preserve_thinking 默认开启,因此推理轨迹会跨轮次保留,而不会被重新生成。
上下文窗口和输出上限
该模型卡标明原生支持 262,144 个 token,并可通过 RoPE 缩放(YaRN)扩展至 1,000,000 个 token。Qwen 自身针对长时间智能体运行的服务指南指出,在这个 1M 范围内,允许最多 262,144 个 token 用于推理内容,最多 131,072 个 token 用于最终响应——这一上限是服务配置,而非检查点的固定属性。
有两个窗口值得分开来看,因为它们很容易被混为一谈。开放权重版本原生支持 262,144 的上下文;而托管版本运行在 Qwen Cloud 上,模型卡称其尚未推出(“服务即将上线”),而 Qwen Cloud 的模型页面将其列为 1M 上下文、991K 最大输入、131K 最大输出以及 262K 最大推理预算。托管产品的规格表并不等同于该检查点的规格表。
模态:输入和输出分别是什么
输入为文本、图像和视频,输出仅为文本。该卡片称 Qwen3.8-27B 是“一个能够理解图像和视频的原生视觉语言模型”,其示例代码传入了全部三种输入类型。没有音频输入,没有图像生成,也没有语音输出。Artificial Analysis 对同一检查点的模型记录在能力范围上给出了相同结论——输入图像、视频和文本,输出文本——这是一个有用的第二方解读,因为它并非阿里巴巴自己的页面。
Apache 2.0 许可证版本实际允许什么
该许可证并不是博客文章上的一份摘要;仓库本身载有 Apache License, Version 2.0 的文本,而该卡片的元数据声明为 license: apache-2.0。从许可证文本来看,它授予的是:一项永久、全球范围、免版税的版权许可,允许复制、准备衍生作品、公开展示、再许可和分发该作品及其衍生作品,以及来自贡献者的专利许可——商业使用属于被允许的用途之一,且没有使用领域限制、没有用户数量门槛,也没有单独的商业协议。对发布产品而言,Apache 2.0 在关键意义上也是宽松的:衍生权重可以依据不同条款再分发,前提是你保留许可证和署名声明,并说明你做了哪些修改(第 4a–4c 节)。第 6 节不授予任何与 Qwen 名称或商标相关的权利,因此基于 Apache-2.0 的分支不能以 Qwen 的名义进行自我营销。
家族内部的比较很有启发性,而且从代码仓库而非覆盖范围就能看出来:2.4T-A95B 检查点自称 其他,并采用 qwen3.8-max 许可证,而 Qwen3.8-Flash-Next 使用 qwen-community-1.0。27B 是三者中唯一以纯 Apache 2.0 许可提供的那个。
独立基准位置
Artificial Analysis 已运行过该模型,其记录值得与阿里巴巴自家的表格分开看待,因为两者回答的是不同的问题。这项独立指数是基于xhigh配置测得的:
• Intelligence Index 33.7——这是 Artificial Analysis 存储的数值,其模型页面显示时为四舍五入后的 34。已公布的有两个排名,它们衡量的样本池并不相同:该页面自身的摘要卡片将该模型在其规模类别的 142 个模型中列为第 1 名,依据的是该页面工具提示所描述的同类比较;而我们目录中源自 Artificial Analysis 的那一行记录的是 145 个中的第 45 名,约处于第 67 百分位。两者都不是针对同一范围排出的名次,因此不要把它们当作同一个数字的两种格式来解读。
• 编程指数 68.1——已收录于我们的目录,以 artificialanalysis.ai 为其指定来源,在该指数的 138 个模型中排名第 35 位。该模型在编程方面的表现高于其通用智能水平,这与该厂商自家表格所呈现的形态一致。
• 努力程度阶梯,同一测试框架——降低推理努力程度会让指数大幅下移:xhigh档为 33.7,medium档为 27.6,low档为 26.2,完全关闭推理则为 20.2。这是实测得出的 13.5 分差距,也是按工作负载而非按模型来调整努力程度的最有力论据。
• 两个来源在哪里一致、在哪里不一致——在 GPQA Diamond 上,Alibaba 的卡片报告为 89.2,Artificial Analysis 测得 90.5。在 Humanity's Last Exam 上,卡片报告为 30.8,Artificial Analysis 为 33.9。数字很接近,但并不相同,而这很正常:不同的测试框架,不同的运行。有一点提醒应当写进正文,而不是塞进脚注——目前没有任何第三方发表过 Qwen3.8-27B 与 Alibaba 对比表中任何模型在相同投入程度、相同测试框架下的正面直接对比,因此本页上的每一次跨模型比较,都是对不同测量的比较,而不是同一项结果。

Qwen 报告什么,以及如何解读
该模型卡包含大约二十多项评分,并附有 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B 和 Opus4.6 Max 的对比列。所有这些均由厂商报告且未经复现——Alibaba 自己的评估,由 Alibaba 发布——并且若干行使用了由 GPT-5.4 构建评判的 Claude Code 测试框架,模型卡的脚注说明了这一点。据此,厂商宣传的头条数字如下:
• 智能体终端编程 —— Terminal Bench 2.1(Terminus)达 73.0,而其取代的 Qwen3.6-27B 为 63.4,Opus4.6 Max 以 78.2 位居该行首位。
• 智能体编码 — SWE-bench Pro 61.7,QwenSWEBench 79.0,DeepSWE 1.1 42.2,NL2Repo-Bench 42.3,LiveCodeBench v6 90.3。
• 智能体与办公工作 — CoWorkBench 70.7,JobBench 33.4,Agents' Last Exam 42.9(按得分),Pass@1 20.4。
• 通用推理——GPQA Diamond 89.2,HLE 30.8,IFBench 79.5。在厂商自己的表格中,Opus4.6 Max 在两行推理数据上均领先,分别为 91.3 和 40.0。
• 视觉与计算机使用 — OSWorld-Verified 84.3,AndroidWorld 81.9,WebArena-Verified 64.8,OmniDocBench 1.5 91.1,RealWorldQA 85.9。
对那张表格最诚实的总结,比表格看上去要更有限。相较于它的直接前代,提升既大又一致——QwenSWEBench 79.0 对 49.3,DeepSWE 42.2 对 13.3——而这只是一个关于单代配方变更的论断。与相邻各列中的前沿模型相比,它在某些行上胜出,在另一些行上落败——依据的是阿里巴巴自己的数字,以及阿里巴巴自己选用的评测框架。
运行它
权重是 Transformers 格式下的 18 个 BF16 分片,模型卡将 Hugging Face Transformers、vLLM、SGLang 和 TokenSpeed 列为支持的栈。我们已分别撰写了本地部署与量化路径的内容,那里才是展开这些细节的合适位置:Ollama 上的 Qwen3.8-27B(用于本地守护进程),以及基准测试详解,其中包含完整评分卡,以及相较 Qwen3.6-27B 的变化。本页只聚焦于模型本身。
我们目录中的 Qwen3.8-27B
今天 OrcaRouter 上有两张卡片同时上线,并排可用,而且在本段文字撰写之前,它们都已在 2026-09-28 重新核对过。qwen/qwen3.8-27b标价为每百万输入 token 0.33 美元、每百万输出 token 2.40 美元,具备完整的 262,144 token 上下文窗口,支持文本、图像和视频输入,并以参数形式开放推理、工具、结构化输出和 JSON 接口。它的同门 obsidian/Qwen3.8-27B——相同权重以 block-FP8 方式服务,视觉塔保持全精度,并且用该卡片自己的话来说,“旨在针对广泛范围的提示提供直接、完整的响应”——标价为输入 0.40 美元、输出 4.21 美元。两者都支持 chat completions 和 Responses API,因此文档解析或截图任务可以在同一个密钥、同一个端点上指向任一模型,无需第二份合同,也无需修改代码。
作为参考规模,我们自己的 playground 在过去七天里通过 qwen/qwen3.8-27b 处理了 1.051 亿个 token,中位首字节时间为 3.8 秒,同一时间窗口内的错误率为 3.3%。这些是我们的服务数据,并不是对模型的评判。

引导至此的搜索
这个页面背后的需求分布稀疏,且恰好落在点击之外。在截至 2026-09-25 的 28 天里,我们的站点在 69 种不同的模型名称精确拼写上共获得 8,931 次展示和 273 次点击——包括“qwen3.8 27b”、“qwen3.8-27b”、“qwen 3.8 27b”,以及另外几十种书写同样三个词元的方式。我们在搜索量最大的拼写上的最佳排名在 9.0 到 10.6 之间。那些排名是其他页面偶然为我们争取到的,而这正是规范页面能解决的问题:排在第九位时,你虽然出现在页面上,但没人点击。流量唯一能转化的地方是非英语——一个俄语版的名称拼写对我们来说排在第 1.8 位,转化率为 14.4%。
这些都不是关于模型的证据。它是关于人们输入内容的证据,而这正是这个页面存在的原因。
归根结底:一个 27B 稠密检查点,拥有真正不同寻常的注意力布局、宽松许可、原生视频理解、允许你发布衍生作品的 Apache-2.0 条款、在 Artificial Analysis 所衡量的范围内跻身前四分之一的独立编码排名,以及一张相对前代表现强劲、相对前沿则参差不齐的厂商对比表。悬而未决的问题是 Alibaba 之外目前无人能回答的那个——1M token 托管路径在生产环境中表现如何,以及 Flash-Next 架构是否会落地到这一规模的模型中。
支撑 Qwen3.8-Max 的 2.4T-A95B 核心已在同一目录中上线:qwen/qwen3.8-max价格为每百万 token $2.00 / $6.00——如果你需要的不是 27B 这个规模的话。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
