
Qwen3.8-LiveTranslate 与 Qwen 3.8:命名撞车,而非公平较量
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
搜索其中一款模型,你就会看到另一款。Qwen3.8-LiveTranslate,于 2026 年 9 月 19 日发布,以及Qwen3.8-Max——大多数人在不加后缀地写“Qwen 3.8”时所指的那个模型,自 2026 年 8 月 3 日起全面可用,并于 9 月 2 日更新为 Qwen3.8-Max-0902——二者共享一个代际前缀,除此之外几乎毫无共同之处。其中一个是同声传译系统,接收音频输入,输出翻译后的音频和文本,通过 WebSocket 按 ID qwen3.8-livetranslate-flash-realtime计费。另一个是拥有 2.4 万亿参数的稀疏混合专家(MoE)通用模型,具有 100 万 token 的上下文窗口,却完全听不到任何声音。将二者进行正面比较是一种范畴错误,而如此多的人会犯这个错误,才是这里真正的故事:该厂商如今在 Qwen 3.8 这个名称下推出至少四种不同的东西,而命名方案并不能告诉你哪一款才是你想要的。
每一个到底是什么
Qwen 3.8 世代在 2026 年下半年分层次陆续发布,而这些层次之间并不能互换。
Qwen3.8-Max是托管旗舰模型:一个稀疏 MoE 模型,总参数量约 2.4 万亿,每次前向传播约有 950 亿激活参数,上下文长度达 100 万 token,支持文本、图像和视频输入,输出仅限文本。其定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,缓存读取为每百万 0.250 美元。厂商报告的分数显示,它在 Terminal-Bench 2.1 上达到 86.6,在 GPQA Diamond 上达到 92.6,在 SWE-bench Pro 上达到 67.7,在 Humanity's Last Exam 上达到 43.6。
Qwen3.8-2.4T-A95B是同一代的开源权重版本,于2026年8月12日发布:92层中共有512个路由专家,其中69层采用线性注意力,权重约4.89 TB。当人们谈论自己运行模型而非调用API时,所说的“Qwen 3.8”通常就是指这个模型。
Qwen3.8-27B是同一系列中的小规模开放权重模型,而Qwen3.8-LiveTranslate则是专精款——一款采用交错式架构的口译模型,基于混合 MoE 的 Thinker–Talker 设计打造,可识别 60 种源语言,并支持其中 29 种语言的语音输出。
区分它们的维度不是规模,而是模态。Qwen3.8-Max 完全没有音频输入路径,也没有任何音频输出。让它实时解读对话,不是靠更好地提示它就能解决;这项能力并不在该模型中。
规格对比
并排来看,这两款机型在买家关心的任何维度上都几乎没有重叠:
• 主要工作 — Qwen3.8-LiveTranslate:同步语音到语音口译。Qwen3.8-Max:通用推理、编程、智能体及多模态文本工作。
• 输入模态 — Qwen3.8-LiveTranslate:音频和图像。Qwen3.8-Max:文本、图像和视频。
• 输出模态——Qwen3.8-LiveTranslate:文本与合成音频。Qwen3.8-Max:仅文本。
• 上下文窗口 — Qwen3.8-LiveTranslate:53,248 个 token(输入 49,152 / 输出 4,096)。Qwen3.8-Max:1,000,000 个 token。
• 权重 — Qwen3.8-LiveTranslate:闭源,仅提供 API。Qwen3.8-Max:托管模型,同代还发布了开源姊妹模型 Qwen3.8-2.4T-A95B。
• 速率限制 — Qwen3.8-LiveTranslate:每分钟 10 次请求、100,000 个 token。Qwen3.8-Max:标准托管吞吐量,无单次请求的实时上限。
上下文容量的差距是最让人意外的地方。Qwen3.8-Max 拥有百万级 token,而这款口译模型的上下文大约只有它的百分之五。但实时口译并不需要长上下文——它需要的是短而极快的记忆。它 49,152 token 的输入上限,其容量恰好够把对话最近几分钟的内容延续下去,以保证人名和术语前后一致,而这正是“长上下文消歧”所承担的工作。用上下文数字来评判这款口译模型,就像用油箱大小来评判一台赛车发动机。

为什么比价是一个陷阱
按每百万个token计算,解释器的成本看起来远高于旗舰模型:音频输入为每百万个token 7.50美元,而文本输入为每百万个token 2.00美元;音频输出为每百万个token 30.00美元,而文本输出为每百万个token 6.00美元。
这种比较毫无意义,而且这是人们对这类模型最常见的误解。音频词元和文本词元不是同一个单位。语音被编码为音频词元时的密度,与相同内容写成文字时毫无对应关系——一分钟的对话消耗的音频词元,远多于其文字记录消耗的文本词元,而输出音频又在此基础上叠加了第二条流。把这两种速率并排呈现,暗示了一种在实践中并不存在的成本比例。
结构差异比价格差异更重要。Qwen 按 token 为口译服务计费,而实时语音市场的大部分则按会话分钟计费。当你的音频变得更安静、会话变得更短或说话人停顿时,这两种定价模式的表现会截然不同——按分钟计价的计量表会为静音收费,而按 token 计价的计量表不会。如果你在构建成本模型,问题不在于哪个费率更低,而在于哪种计量方式会惩罚你的使用形态。还要注意区域划分:北京定价分别为每百万 ¥40 / ¥3.3 / ¥100 / ¥160,对应音频输入、图像输入、文本输出和音频输出,显著低于新加坡费率,而这种差异只有在你把两者逐行对比时才会显现出来。
在成本方面,还有一点对口译器有利:与 Qwen3.5-LiveTranslate 相比,Qwen 基本保持了这些费率不变,北京的价格不变,新加坡则略便宜。新一代产品在价格不上涨的情况下问世,在这个市场中并非常态。
开放权重与仅提供 API 才是真正的分界线
如果你是在原则而非能力的基础上在这两者之间做选择,那么起决定性作用的事实就是许可。
Qwen3.8-Max 已提供托管版本,而该代 Max 级权重已于 8 月以 Qwen3.8-2.4T-A95B 之名开源。这条路径确实存在,但绝非随随便便就能走通:4.89 TB 的权重意味着数据中心级硬件,而且开放权重许可证要求 12 个月内营收超过 5000 万美元的组织向阿里云获取商业许可证。
Qwen3.8-LiveTranslate 没有这样一条路径。它是闭源权重的,且仅提供 API,只能通过 WebSocket Realtime API 访问,而该 API 要求在 target_language 于 session.update 事件中设置好之后,才能传输任何音频;它不支持函数调用、结构化输出、上下文缓存、批量推理,也不支持微调。如果你的需求是在自己的硬件上运行这个解释器,那么这个模型无法满足,再多的工程投入也改变不了这一点。
这一点对某一类特定买家很重要:他们不能把音频发送给第三方——比如医院、律师事务所、政府承包商。对其他所有人来说,实际问题在于,这个口译器是否足够好,好到足以证明这种依赖是合理的,而答案在于一项 Qwen 尚未允许任何人进行的测量。

按任务选择,而非按名称
对于“Qwen3.8-LiveTranslate 还是 Qwen 3.8”这个问题,正确的答案是你大概需要的是另一个问题的答案。
• 如果任务是实时口译——会议、通话、广播——这些当中只有一个能做到,而且它不是旗舰款。
• 如果任务是总结所讲内容、提取行动项、回答关于转录文本的问题,或撰写后续跟进——只有旗舰能做到,而口译员做不到。
• 如果这项工作两者都包含,那你就是在搭建一条流水线;除非你有意整合,否则你将向两家供应商付款,并涉及两份合同和两套凭证。
第三种情况最为常见,也正是在这里,把两半都放在单一端点之后运行,不再只是一种便利,而开始成为一种架构。Qwen3.8-Max 已在 OrcaRouter 上线,按供应商标价每百万输入 2.00 美元、每百万输出 6.00 美元计费,零加价直通,因此 Qwen 一旦降价,当天就能反映到你的账单上,而不必等到下一次合同续签;自动故障转移还意味着,当某家供应商出现故障时,流水线中负责摘要的那一半不会随之停摆。
需要把另一半说得明明白白,因为这一区分很重要:Qwen3.8-LiveTranslate 不在我们的产品目录中。它可以通过阿里巴巴自有的 Model Studio API 以及供应商在 omni.qwen.ai/live-translate 的试用端点获取,而我们不会暗示我们会路由一个我们并不提供的模型。今天你可以通过一个密钥接入的,是下游技术栈——即那些消费解释器所生成内容的模型。

命名问题才是真正的发现
四款模型,一个前缀,却没有读者可以依赖的后缀约定。“Qwen 3.8”到底指向托管旗舰版、开源的 2.4T 检查点、27B 小模型,还是口译模型,取决于打字的人是谁、以及他最近读到了什么。公布的基准测试表也无济于事,因为旗舰版有这些数据,而口译模型基本没有:Qwen3.8-Max 可以放进 Terminal-Bench 或 GPQA Diamond 评测,而 Qwen3.8-LiveTranslate 的证据则是平均滞后 2.3 秒、厂商报告的 FLEURS 上 85.7 xCOMET-XXL,以及自报的 9.7% 说话人分离错误率,且没有任何独立复现。
所以,这个页面要回答的比较,其实是一个警告。在把 Qwen 3.8 与任何东西比较之前,先确定你指的是哪一个 Qwen 3.8。如果它能处理音频,那它就是那个口译员,是你为某一项任务购买的专才。如果它能处理视频,那它就是旗舰,是你为另外二十项任务购买的通才。任何把二者混在一起的评测,都得不出关于其中任何一个的结论。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
