一张生成的标题卡,标题为“TwIL-LM3-Pro vs Qwen 3.8”,副标题为“卡片实际运行的那场对比”,另有 两张圆角卡片分别写着“TwIL-LM3-Pro - 3.66B,本地,非商用”和“Qwen3.8-Max - 托管,1M 上下文,$2 / $6”。页脚一行写着“webAI 是与 Qwen3-8B 对比测量的,而非 Qwen3.8-Max。”OrcaRouter 标志合成在右下角。
Guides & Insights

TwIL-LM3-Pro 与 Qwen 3.8:一场错配,以及真正重要的对比

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

TwIL-LM3-Pro 和 Qwen3.8-Max 不该出现在同一个页面上,原因并不是其中哪一个更好,而是 webAI 为 3.66B 形式逻辑模型给出的公开论证,是建立在与某个 Qwen 模型的对比之上的——而那个被拿来对比的 Qwen 模型,并不是标题所点名的那个。webAI 的 Track A 和 Track B 表格衡量的是 TwIL-LM3-Pro 对 Qwen3-8B,一个来自更早世代的稠密 8B 开放权重模型,而对 Qwen3.8-Max 则完全不置一词:不是因为 TwIL-LM3-Pro 会赢,而是因为 Qwen3.8-Max 是阿里巴巴的旗舰托管系统,一个稀疏专家混合模型,据报道拥有 2.4 万亿参数、每个 token 约 950 亿激活参数、一百万字 token 的多模态上下文窗口,以及每百万输入 token 2.00 美元、每百万输出 6.00 美元的价目表。把一份 2.09 GiB 的笔记本电脑 GGUF 摆到它旁边,不过是将类别错误包装成了一张“对决”页面。

所以这篇文章做了两件事。它纠正了搜索结果弄错的对比,然后回答了读者可能真正想问的那个版本的问题:既然前沿模型只有一次 API 调用之遥,而形式逻辑专家系统就运行在你自己的机器上,那么它们各自在什么时候才真正配得上自己的位置?

这张卡实际测量的模型

相关的比较对象是 Qwen3-8B,而 webAI 自己对其的总结比二手报道所暗示的要更保守。TwIL-LM3-Pro 的域内宏门控得分为 0.5539,而 Qwen3-8B 为 0.5336;模型卡中包含了一句营销页面本会删掉的话:门控指标领先幅度为 0.020,“小于每条赛道 n = 200 时的采样噪声——所以应把这一项解读为持平,而非胜出。”

在比较并非掷硬币式碰运气的地方:strict-7,0.2879 对 0.2093,这一行在任何地方都不使用宽松匹配得分,因此不可能通过格式处理来人为制造。严格多项选择,0.4100 对 0.0000。规则归纳,0.4195 对 0.3680。还有参数比例——3.66B 对约 8B——这正是“不到一半大小”这一说法的全部依据。

在留出测试套件上,webAI 还要更直白:“TwIL-LM3-Pro 并未领先它。”十数据集宏平均为 0.7901,与它自己的 Granite 基座持平,落后于 Qwen3-8B 的 0.8493。一个小型专用模型在形式逻辑上追平规模两倍于己的通用模型,却在通用能力上输给它,这正是预期中的形态;而这样如实报告,才让 strict-7 的数字可信。

Qwen3.8-Max 究竟是什么

Qwen3.8-Max 并非 Qwen3-8B 的迭代版本。它是阿里巴巴的旗舰级档位,在 OrcaRouter 目录页面上显示为 `qwen/qwen3.8-max`,发布日期为 2026 年 8 月 3 日,具备一百万 token 的上下文窗口,支持文本、图像和视频输入,文本输出,并完整支持思考模式、函数调用、内置工具和结构化输出。它在五个区域的 OpenAI 兼容、Anthropic 兼容以及原生仪表板上提供服务,思考模式通过 `enable_thinking` 参数切换。价格为每百万输入 token 2.00 美元,每百万输出 token 6.00 美元。

一个带日期的快照 `qwen/qwen3.8-max-0902` 于 2026 年 9 月 2 日发布,具备相同的能力和相同的定价,专门发布它是为了固定行为以实现可复现的运行。如果你要基于 Qwen3.8-Max 构建任何长期使用的东西,那么应该写进配置的是这个快照标识符,而不是那个不断变化的别名。

注意那段描述中没有出现的东西:一个可以下载的参数规模、一份许可证文件,以及任何自行运行它的路径。Qwen3.8-Max 是一款托管产品。发布时的新闻报道称,开放权重被承诺将在接下来一周内推出,而 techsy 的表述——“2.4T 参数,1M 上下文,尚无权重”——正是读者应当去核实而非想当然接受的状态,因为发布时报道的一项承诺并不等于已发布的检查点。

四个维度,没有一个是接近的

• 参数 —— TwIL-LM3-Pro 3.66B 稠密、全部激活;相比之下,Qwen3.8-Max 据称采用稀疏混合专家设计,总计 2.4T,每个 token 约 95B 激活。总量上相差三个数量级,激活量上相差两个数量级。

• 运行在哪里 — TwIL-LM3-Pro 以 bf16 下载为 6.82 GiB,或以 2.09 GiB 的 Q4_K_M GGUF 用于 CPU 或 4 GB 显存;而 Qwen3.8-Max 仅作为托管端点存在。

• 上下文 — TwIL-LM3-Pro 131,072 tokens,继承自其 Granite 基座,在其自身评测中,与 1,000,000 tokens 的 Qwen3.8-Max 相比,从未验证超过 8,192 tokens。

• 模态——输入文本,输出文本,对比输入文本、图像和视频,输出文本。

• 许可——webAI 非商业许可 1.0 版,创收用途需另行签订协议,而托管的商业 API 则无需许可任何权重。

• 成本 — TwIL-LM3-Pro:无按 token 计费,也没有托管端点;而 Qwen3.8-Max 每百万输入 token 收费 2.00 美元、每百万输出 token 收费 6.00 美元,缓存输入费率约为每百万 0.25 美元。

一个 3.66B 的模型之所以便宜,是因为它小;而它小,是因为它只做一件事。Qwen3.8-Max 之所以贵,是因为它通用,而且由服务方托管。这两个价格都不是定论。

问题背后的问题

把命名上的混乱剥离掉,留下的就是一个工程问题,而且是个好问题:如果一个前沿托管模型能够对形式逻辑进行推理,那到底为什么还要运行一个狭窄的专用模型呢?

有三条理由都站得住脚。第一是许可证和网络:非商业研究团队、隔离网环境,或必须在一台没有网络连接的笔记本电脑上运行的批量标注任务,都无法调用托管端点,而 2.09 GiB 的 GGUF 直接回应了这一约束。第二是面对数据量时的成本结构——对一百万个短输入进行形式逻辑标注的任务,在托管的前沿模型上要按 token 付费,而在本地模型上只付出实际运行时间。第三是输出形态:TwIL-LM3-Pro 经过调优,输出的是可机器校验的结构,而非自然语言文本;对于蕴含标签和语义解析来说,这比提示一个通用模型再解析其答案所需的流水线更短。

相比之下,Qwen3.8-Max 的理由很简单。它能看懂图像和视频,拥有百万级 token 上下文,通过有文档记录的 API 处理工具调用和结构化输出,并且背后有已发布的基准测试和独立评估支持。一个狭窄领域的专用模型并不会威胁到这一点;二者应对的是不同的约束条件。

同时使用两者的技术栈

能在真实流水线中经受住考验的模式是两层式的,而且并不新奇。一个托管的前沿模型读取杂乱输入——扫描的教科书页面、混合模态来源、冗长的规格说明——并将其转化为干净的结构化文本。这些文本被送入一个本地形式逻辑模型,后者的全部工作就是在你自己拥有的硬件上输出一个标签、一个解析结果或一段 Lean 批评。关于第二层是否值得其维护成本的裁决,是 strict-7 式比较,而不是门控,因为专家模型是在指标没有宽容评分余地的那些赛道上赢得自己的位置的。

webAI 自己的模型卡中也有一条值得借鉴的线索:该流水线在五个不同的基础模型上运行,每个模型只改变合并系数,而 webAI 报告了每一个模型的结果,包括那些变化最小的。与任何单条基准测试结果相比,这更能说明一个配方有效,而且这类证据告诉你的是,一种方法具有泛化能力,而不是某个检查点碰巧走了运。

这里什么是可路由的,什么不是?

这是两个模型能在同一句话里被诚实并列的唯一场景。Qwen3.8-Max 是一条路由:它通过 OrcaRouter 以 `qwen/qwen3.8-max` 提供服务,而且由于平台按 0% 加价率透传供应商的目录价,$2.00/$6.00 的费率就是厂商自己的价格,厂商降价当天即可生效,而无需等一个合同周期。带日期的 `qwen/qwen3.8-max-0902` 快照也可与之并行路由,因此固定一个可复现的模型 id 只是配置选择,而不是另立一份厂商关系。

TwIL-LM3-Pro 不是一条路由,若暗示它是,那就并不诚实。它采用非商业许可,没有公开发布的托管端点,目前使用它的方式是下载检查点并自行运行。对于围绕它构建的流水线,路由器所做的是外围的文本工作——提示扩展、语料生成、过滤处理——这些都在同一个 OpenAI 兼容端点上运行,对接 200 多个模型,因此,把生成评估数据的模型换成给它打分的模型,只需改一下配置,当提供商出现问题时,自动故障转移能让长批次继续运行。

两者结合最站得住脚的用法恰恰如此:一个可路由的前沿层负责通用推理和结构化抽取,一个已下载的专家模型负责形式逻辑判断,而中间的一切共用一把密钥。

比较哪个模型,以及何时比较

如果你正在评估小型形式逻辑模型,那么值得与 TwIL-LM3-Pro 并列比较的 Qwe​n 是 Qwen3-8B,而 webAI 已经发布了那项对比,并附上了注意事项。如果你在选择把生产工作负载运行在哪里,Qwen3.8-Max 则完全是一个不同的决策——它是一个托管的前沿系统,有价目表且不可下载——正确的问题不是哪个更好,而是哪个约束在起作用:一侧是连接性与许可证,另一侧是上下文、模态与规模。大多数真实系统最终都需要这两个答案。

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新