标题卡上写着“Qwen3.8-LiveTranslate vs Qwen 3.8”,副标题为“命名冲突,而非公平对决”。
Guides & Insights

Qwen3.8-LiveTranslate 与 Qwen 3.8:命名撞车,而非公平较量

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

搜索其中一款模型,你就会看到另一款。Qwen3.8-LiveTranslate,于 2026 年 9 月 19 日发布,以及Qwen3.8-Max——大多数人在不加后缀地写“Qwen 3.8”时所指的那个模型,自 2026 年 8 月 3 日起全面可用,并于 9 月 2 日更新为 Qwen3.8-Max-0902——二者共享一个代际前缀,除此之外几乎毫无共同之处。其中一个是同声传译系统,接收音频输入,输出翻译后的音频和文本,通过 WebSocket 按 ID qwen3.8-livetranslate-flash-realtime计费。另一个是拥有 2.4 万亿参数的稀疏混合专家(MoE)通用模型,具有 100 万 token 的上下文窗口,却完全听不到任何声音。将二者进行正面比较是一种范畴错误,而如此多的人会犯这个错误,才是这里真正的故事:该厂商如今在 Qwen 3.8 这个名称下推出至少四种不同的东西,而命名方案并不能告诉你哪一款才是你想要的。

每一个到底是什么

Qwen 3.8 世代在 2026 年下半年分层次陆续发布,而这些层次之间并不能互换。

Qwen3.8-Max是托管旗舰模型:一个稀疏 MoE 模型,总参数量约 2.4 万亿,每次前向传播约有 950 亿激活参数,上下文长度达 100 万 token,支持文本、图像和视频输入,输出仅限文本。其定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,缓存读取为每百万 0.250 美元。厂商报告的分数显示,它在 Terminal-Bench 2.1 上达到 86.6,在 GPQA Diamond 上达到 92.6,在 SWE-bench Pro 上达到 67.7,在 Humanity's Last Exam 上达到 43.6。

Qwen3.8-2.4T-A95B是同一代的开源权重版本,于2026年8月12日发布:92层中共有512个路由专家,其中69层采用线性注意力,权重约4.89 TB。当人们谈论自己运行模型而非调用API时,所说的“Qwen 3.8”通常就是指这个模型。

Qwen3.8-27B是同一系列中的小规模开放权重模型,而Qwen3.8-LiveTranslate则是专精款——一款采用交错式架构的口译模型,基于混合 MoE 的 Thinker–Talker 设计打造,可识别 60 种源语言,并支持其中 29 种语言的语音输出。

区分它们的维度不是规模,而是模态。Qwen3.8-Max 完全没有音频输入路径,也没有任何音频输出。让它实时解读对话,不是靠更好地提示它就能解决;这项能力并不在该模型中。

规格对比

并排来看,这两款机型在买家关心的任何维度上都几乎没有重叠:

主要工作 — Qwen3.8-LiveTranslate:同步语音到语音口译。Qwen3.8-Max:通用推理、编程、智能体及多模态文本工作。

输入模态 — Qwen3.8-LiveTranslate:音频和图像。Qwen3.8-Max:文本、图像和视频。

输出模态——Qwen3.8-LiveTranslate:文本与合成音频。Qwen3.8-Max:仅文本。

上下文窗口 — Qwen3.8-LiveTranslate:53,248 个 token(输入 49,152 / 输出 4,096)。Qwen3.8-Max:1,000,000 个 token。

权重 — Qwen3.8-LiveTranslate:闭源,仅提供 API。Qwen3.8-Max:托管模型,同代还发布了开源姊妹模型 Qwen3.8-2.4T-A95B。

速率限制 — Qwen3.8-LiveTranslate:每分钟 10 次请求、100,000 个 token。Qwen3.8-Max:标准托管吞吐量,无单次请求的实时上限。

上下文容量的差距是最让人意外的地方。Qwen3.8-Max 拥有百万级 token,而这款口译模型的上下文大约只有它的百分之五。但实时口译并不需要长上下文——它需要的是短而极快的记忆。它 49,152 token 的输入上限,其容量恰好够把对话最近几分钟的内容延续下去,以保证人名和术语前后一致,而这正是“长上下文消歧”所承担的工作。用上下文数字来评判这款口译模型,就像用油箱大小来评判一台赛车发动机。

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: primary job live interpretation, input audio plus image, output text plus audio, context 53,248 tokens, weights closed and API-only, audio in and out $7.50 and $30.00. Qwen3.8-Max column: primary job general reasoning, input text plus image plus video, output text only, context 1,000,000 tokens, weights hosted with the open sibling 2.4T-A95B, text in and out $2.00 and $6.00. Footer reads 'LiveTranslate per Alibaba Cloud; Qwen3.8-Max per OrcaRouter. Neither independently audited.'

为什么比价是一个陷阱

按每百万个token计算,解释器的成本看起来远高于旗舰模型:音频输入为每百万个token 7.50美元,而文本输入为每百万个token 2.00美元;音频输出为每百万个token 30.00美元,而文本输出为每百万个token 6.00美元。

这种比较毫无意义,而且这是人们对这类模型最常见的误解。音频词元和文本词元不是同一个单位。语音被编码为音频词元时的密度,与相同内容写成文字时毫无对应关系——一分钟的对话消耗的音频词元,远多于其文字记录消耗的文本词元,而输出音频又在此基础上叠加了第二条流。把这两种速率并排呈现,暗示了一种在实践中并不存在的成本比例。

结构差异比价格差异更重要。Qwen 按 token 为口译服务计费,而实时语音市场的大部分则按会话分钟计费。当你的音频变得更安静、会话变得更短或说话人停顿时,这两种定价模式的表现会截然不同——按分钟计价的计量表会为静音收费,而按 token 计价的计量表不会。如果你在构建成本模型,问题不在于哪个费率更低,而在于哪种计量方式会惩罚你的使用形态。还要注意区域划分:北京定价分别为每百万 ¥40 / ¥3.3 / ¥100 / ¥160,对应音频输入、图像输入、文本输出和音频输出,显著低于新加坡费率,而这种差异只有在你把两者逐行对比时才会显现出来。

在成本方面,还有一点对口译器有利:与 Qwen3.5-LiveTranslate 相比,Qwen 基本保持了这些费率不变,北京的价格不变,新加坡则略便宜。新一代产品在价格不上涨的情况下问世,在这个市场中并非常态。

开放权重与仅提供 API 才是真正的分界线

如果你是在原则而非能力的基础上在这两者之间做选择,那么起决定性作用的事实就是许可。

Qwen3.8-Max 已提供托管版本,而该代 Max 级权重已于 8 月以 Qwen3.8-2.4T-A95B 之名开源。这条路径确实存在,但绝非随随便便就能走通:4.89 TB 的权重意味着数据中心级硬件,而且开放权重许可证要求 12 个月内营收超过 5000 万美元的组织向阿里云获取商业许可证。

Qwen3.8-LiveTranslate 没有这样一条路径。它是闭源权重的,且仅提供 API,只能通过 WebSocket Realtime API 访问,而该 API 要求在 target_languagesession.update 事件中设置好之后,才能传输任何音频;它不支持函数调用、结构化输出、上下文缓存、批量推理,也不支持微调。如果你的需求是在自己的硬件上运行这个解释器,那么这个模型无法满足,再多的工程投入也改变不了这一点。

这一点对某一类特定买家很重要:他们不能把音频发送给第三方——比如医院、律师事务所、政府承包商。对其他所有人来说,实际问题在于,这个口译器是否足够好,好到足以证明这种依赖是合理的,而答案在于一项 Qwen 尚未允许任何人进行的测量。

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint, the required target_language session parameter, and the published per-million-token rates.

按任务选择,而非按名称

对于“Qwen3.8-LiveTranslate 还是 Qwen 3.8”这个问题,正确的答案是你大概需要的是另一个问题的答案。

• 如果任务是实时口译——会议、通话、广播——这些当中只有一个能做到,而且它不是旗舰款。

• 如果任务是总结所讲内容、提取行动项、回答关于转录文本的问题,或撰写后续跟进——只有旗舰能做到,而口译员做不到。

• 如果这项工作两者都包含,那你就是在搭建一条流水线;除非你有意整合,否则你将向两家供应商付款,并涉及两份合同和两套凭证。

第三种情况最为常见,也正是在这里,把两半都放在单一端点之后运行,不再只是一种便利,而开始成为一种架构。Qwen3.8-Max 已在 OrcaRouter 上线,按供应商标价每百万输入 2.00 美元、每百万输出 6.00 美元计费,零加价直通,因此 Qwen 一旦降价,当天就能反映到你的账单上,而不必等到下一次合同续签;自动故障转移还意味着,当某家供应商出现故障时,流水线中负责摘要的那一半不会随之停摆。

需要把另一半说得明明白白,因为这一区分很重要:Qwen3.8-LiveTranslate 不在我们的产品目录中。它可以通过阿里巴巴自有的 Model Studio API 以及供应商在 omni.qwen.ai/live-translate 的试用端点获取,而我们不会暗示我们会路由一个我们并不提供的模型。今天你可以通过一个密钥接入的,是下游技术栈——即那些消费解释器所生成内容的模型。

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

命名问题才是真正的发现

四款模型,一个前缀,却没有读者可以依赖的后缀约定。“Qwen 3.8”到底指向托管旗舰版、开源的 2.4T 检查点、27B 小模型,还是口译模型,取决于打字的人是谁、以及他最近读到了什么。公布的基准测试表也无济于事,因为旗舰版有这些数据,而口译模型基本没有:Qwen3.8-Max 可以放进 Terminal-Bench 或 GPQA Diamond 评测,而 Qwen3.8-LiveTranslate 的证据则是平均滞后 2.3 秒、厂商报告的 FLEURS 上 85.7 xCOMET-XXL,以及自报的 9.7% 说话人分离错误率,且没有任何独立复现。

所以,这个页面要回答的比较,其实是一个警告。在把 Qwen 3.8 与任何东西比较之前,先确定你指的是哪一个 Qwen 3.8。如果它能处理音频,那它就是那个口译员,是你为某一项任务购买的专才。如果它能处理视频,那它就是旗舰,是你为另外二十项任务购买的通才。任何把二者混在一起的评测,都得不出关于其中任何一个的结论。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新