一张“AesCode 32B 对比 Qwen3.8 27B”的主视觉标题卡,副标题为“微调版与祖先”,以谱系图形式绘制:左侧一张 Qwen3-VL-32B-Instruct 检查点卡片,以箭头指向一张标注为“仅限自托管,65 GB”的“AesCode 32B 微调版”卡片;而在右下方另有一张较新的卡片,标注为“Qwen3.8 27B”,带有显示“今日即可调用”的实时 API 标记;OrcaRouter 标志位于右下角。
Guides & Insights

AesCode 32B 对比 Qwen3.8 27B:微软基于 Qwen 打造了它,而其中一款可调用

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

重新定义整个对比的关键细节,就藏在模型卡的第二行:AesCode 32B以 Qwen3-VL-32B-Instruct 为起点。微软这款面向设计的专用代码模型是对 Qwen3-VL 的微调,采用 Apache 2.0 许可,托管在一个创建于 2026 年 9 月 29 日的 Hugging Face 仓库上,其中标题为“Release AesCode-32B”的提交日期为 2026 年 10 月 7 日,而微软在任何地方都未发布过公告。Qwen3.8 27B则处于这条血脉的另一端:它是该厂商自家的开放权重 27B 稠密多模态模型,于 2026 年 8 月 14 日以 Apache 2.0 许可发布,是微软所微调的那个 VL 检查点的后继架构。所以这并不是两家厂商旗舰之作之间的对决,而是一家实验室的通用开放权重模型与竞争对手基于同一家族所做的研究性微调之间的较量,而两者之间的实际差别,归根结底几乎完全在于你拿到这个文件之后被允许拿它做什么。

相同的许可证,相同的系列,不同的模型数量

两者都是 Apache 2.0,都既接受图像也接受文本,并且都返回文本。此后一切都出现分歧,而部署这一行分歧最大。

• 参数 — AesCode 32B:基于 Qwen3-VL-32B-Instruct 的 33B 稠密模型。Qwen3.8 27B:27B 稠密,算上视觉编码器为 28B,64 层,隐藏维度 5120。

• 运行所需内存——AesCode 32B:该说明卡建议仅 bf16 参数就规划约 65 GB 的加速器内存,且其自身的服务部署示例采用了四路张量并行。Qwen3.8 27B:bf16 下约 55.6 GB。

• 背景 — AesCode 32B:在报告的配置中为 24,576 个 token,训练时的提示和响应上限为 8,192。Qwen3.8 27B:原生支持 262,144 个 token,可通过 YaRN 缩放扩展至 1,000,000。

• 注意力 — AesCode 32B:继承自 Qwen3-VL 主干。Qwen3.8 27B:混合架构,48 层 Gated DeltaNet 线性注意力层与 16 层全注意力层按 3:1 的比例搭配,这正是让 262K 上下文窗口在服务端可负担的关键。

• 用途——AesCode 32B:生成信息丰富的可视化产物,以可编辑的 HTML 和 CSS 形式呈现,并开展多模态代码生成研究。Qwen3.8 27B:通用的智能体与多模态任务——编码、计算机操作、文档与视频理解、工具调用。

• 获取方式 — AesCode 32B:从 Hugging Face 下载;没有推理服务商部署它。Qwen3.8 27B:权重,或托管端点。

上下文长度翻倍,占用空间略小,骨干模型新了一代,许可证完全相同。AesCode 32B 唯一完胜的那一行是第一行,而它是在针对特定任务的微调上赢下这一行的。

每个实际上是根据什么来衡量的

这两种评估体系互不相干,而假装它们并非如此,正是像本页这类文章中的典型错误。

Qwen3.8 27B 的这张成绩单既全面又具体。编程:Terminal-Bench 2.1 为 73.0,SWE-bench Pro 为 61.7,QwenSWEBench 为 79.0,LiveCodeBench v6 为 90.3。推理:GPQA Diamond 89.2,Humanity's Last Exam 30.8。计算机操作:OSWorld-Verified 84.3,WebArena-Verified 64.8,AndroidWorld 81.9。视觉:MathVision 在使用厂商的推理时增强后为 94.6,不使用时为 90.0,OmniDocBench 1.5 为 91.1。所有这些数字都出自厂商自家、跑在厂商自家的测试框架上——还有一个值得一读的脚注:SWE-bench Pro 和 QwenSWEBench 这两项测试使用的是 Claude Code 框架,因此无法与在不同框架上评测的模型直接比较。

AesCode 32B 只有一个基准测试,且是单一用途的:300 个信息图样本,每个提示词生成三次且不做筛选,跨七个通道进行渲染与评分。最亮眼的结果是在提供参考图像的情况下取得 85.89 的总体得分,而在同一测试框架下,GPT-5.5 为 81.28,Claude Opus 4.8 为 80.39——此外还声称 AesCode 32B 在视觉维度上比其自身的 Qwen3-VL-32B 骨干模型高出 22.4 分,在总体得分上高出 24.8 分。

把它们并排放在一起,什么都对不上。Terminal-Bench 衡量的是一个 shell 任务能否完成;AesCode 评测衡量的是一张信息图的文字是否清晰可读、其布局是否不会溢出画布,以及它的表格是不是真正的 HTML 表格。二者没有共同的度量指标,没有共同的测试框架,也没有共同的任务。唯一诚实的说法是:AesCode 32B 在设计产物方面远胜于它自己的基座模型,而 Qwen3.8 27B 是一个很强的通用模型——而这两个说法都无法告诉你任何关于另一个的信息。

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

这次的证据缺口是真实存在的,而且是单向的

厂商基准测试在这个行业里是常态,所以重要的是,这两者在各自的厂商宣称有多少经过他人核实这一点上有所不同。

Qwen3.8 27B 发布时带有厂商自己的结果表,随后在几周内积累了外部结果。该模型的独立记录包括:由法律 AI 公司 Harvey 与记忆初创公司 Engram 开展的一项法律智能体研究,其中经过适配的 Qwen3.8 27B 在 250 项法律任务上领先于该研究测试的所有模型,包括 Claude Opus 4.8——但有一个重要前提:该适配模型事先学习了测试律所的 1 亿 token 语料库,因此这既是关于适配的结果,也是关于模型本身的结果。它还包括在 Code Arena 的 WebDev 排行榜上的名次,以及在 Arena.ai 的 Image-to-WebDev 排行榜上的开放权重模型第一名,但这两者都是厂商转述的排名说法,而非已公布的方法论。它还包含一个有已公布分数的第三方榜单:Artificial Analysis 在其 Intelligence Index 上记录 Qwen3.8 27B 为 33.70,每完成一项任务的成本约为 1.01 美元,并公布了其背后的 token 明细。

AesCode 32B 完全没有这些。没有竞技场排名,没有榜单收录,没有第三方复现,没有独立的吞吐量测试——而这并不是因为有人考察过后发现它有所欠缺,而是因为一个没有任何服务商提供的检查点,外部评测框架从一开始就无从评估。它的数字是厂商自己的:由训练该模型的同一套验证器栈计算得出,用的是厂商挑选的样本,对比的是厂商自己运行的基线。这次发布在方法上异常透明——奖励通道名称、rollout 次数、解码参数和失败率全部公开——但关于一个数字是如何产生的透明,并不等同于由别人把它产生出来。

那个需要绑定银行卡的

正是在这里,血脉不再只是无关紧要的谈资,而开始成为决定性的因素。

AesCode 32B 会要求你提供 65 GB 的加速器内存、一条多模态服务路径,以及愿意作为早期采用者运行一个未公布模型的意愿。它自己的服务示例就动用了四路张量并行,而且该模型文档写明支持 24,576 token 的上下文,却没有可回退的托管选项。如果你已经拥有相应硬件,并且你的流水线确实需要针对特定设计进行微调,那这是一笔合理的取舍。对大多数团队来说,在得到第一个有用输出之前,这都是一个为期两周的项目。

Qwen3.8 27B 自托管于 OrcaRouter 自有基础设施之上,今天即可调用,价格为每百万输入 token 0.33 美元、每百万输出 token 2.40 美元,上下文长度 262,144 token,支持文本、图像和视频输入。这些都是标价,原样传递,我方不加任何加价;它与其他 200 多个模型共用同一个密钥,因此与目录中任何替代方案的比较,只是一个请求参数,而非另签一份合同。这就是全部的实际理由,而这个理由相当充分:从家族谱系上看,比 AesCode 32B 的骨干落后一代的那个模型,正是你今天下午就能用自己的提示词、花几美分去评估的那个模型。

这里有一个二阶要点,而路由这一角度让它变得具体。因为 AesCode 32B 是 Qwen3-VL 检查点的微调版本,这个系列让你在决定自托管任何东西之前,有一种低成本的方法来测试该架构的托管侧是否真的能工作。Qwen3-VL 235B A22B Instruct 的价格为每百万输入 $0.40、输出 $1.60,而 Qwen3-VL 8B Instruct 为 $0.18 和 $0.70。两者都不是 AesCode 32B,也都没有为设计质量而训练——但“视觉语言模型能否读取我们的截图,并写出我们所需的标记”这个问题,只需几美分就能用它们回答,而且同一端点下的自动故障转移意味着某家提供商状态不佳的一天不会让流水线停摆。

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

谁应该选哪个

如果产物就是交付物,就选 AesCode 32B。你要大批量制作幻灯片、仪表盘、海报或报告,你需要保持可编辑、可 diff 的结构化输出——该模型会输出完整的 HTML 文档,使用真正的 HTML 表格结构和 ECharts 配置,让两者都保持可检查——而且你手上有硬件,或者有租用它的预算。上手之前,先接受三件事:任何数字都没有独立验证,权重约 65 GB,以及 24K 的上下文会制约长文档。卡片上报告的 4.3% 严重画布边界失败率——相比之下 GPT-5.5 为 34.7%——是本次发布中最令人振奋的单个数字,而它也是微软的数字。

选 Qwen3.8 27B,如果你需要一个真正能跑起来、也真正能部署上线的通用开放权重多模态模型。262K 上下文,可扩展至一百万;部署占用小到 AesCode 32B 放不下的地方它能放下;授权立场没有区别;既有对其质量的独立评测,也有对其每个完成任务成本的独立测算;还有一个托管选项,意味着你今天就能开始用,之后再自托管,而无需重写集成。它那种分阶段、逐层的注意力设计,正是长上下文成本可控的原因,而长上下文恰恰是设计和文档类流水线最需要的。

如果你两者都需要——一个设计产物生成器和一个通用主力——明智的拆分方式并不是在你自己的设备上运行两个 30B 级视觉语言模型。把通用流量路由到托管侧,让专用模型保持自托管,统一置于一个密钥之后,这样任一路径上的提供商故障都只是故障转移事件,而不是一次事故。

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

值得关注的事

AesCode 32B 的定位会彻底改变——前提是它变得可以调用。目前这个模型唯一真正的弱点是获取途径,而这只是一种临时状况:只要有推理服务商接手这个检查点,或者微软发布一个端点,65 GB 的采购问题就会变成一次模型选择。在那之前,对这场对比最诚实的总结是:这个微调模型在一项任务上更强,通用模型在可用性上更强,而通用模型恰好是它的祖先——微软之所以选择基于 Qwen3-VL 检查点来构建,是因为它是当时可获得的最强开源多模态基座,而这本身就是这场比较关于 Qwen3.8 27B 所能给出的最有用的信息。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新