
Qwen3.8-Max 评测:阿里巴巴 2.4T 旗舰模型 $2/$6 定价,0902 版本登顶 Code Arena WebDev
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
阿里巴巴 Qwen 预览了Qwen3.8-Max,于2026年7月19日在上海世界人工智能大会上,此后两周它成为最受热议却无人能实际定价的模型。没有费率卡、没有基准表、没有模型卡、没有许可证,也没有激活参数数量——只有2.4万亿参数的标题,以及该模型“仅次于Claude Fable 5”的说法。
2026年8月3日,情况发生了变化。Qwen3.8-Max正式全面可用:公开了价目表,输入每百万token收费2美元,输出每百万token收费6美元;提供兼容OpenAI和DashScope的端点;附完整基准测试表;开源权重于8月12日发布。一周后,即8月14日,它作为阿里巴巴的“首发上线合作伙伴”登陆DigitalOcean Serverless Inference——这是首个提供该模型的主要西方云平台。9月2日,阿里巴巴发布了命名刷新版本Qwen3.8-Max-0902,针对Coding和Cowork进一步后训练,Qwen称这增强了在复杂企业级和科学工作中的性能。本篇评测基于GA正式版事实撰写,并纳入了首发上线和0902版本,回答了在模型已可购买的当下团队真正关心的问题:Qwen3.8-Max是否已准备好承载生产流量,还是仍属于观望名单上的模型?
简短的答案是:它的进展远超大多数人的预期——尤其是定价,其激进程度足以重新定义前沿价格;而9月2日的更新则加倍押注于该模型原本就擅长的两件事:编码与协作工作。随后发布的独立评估结果确实不错,但在投入流量之前,有一条注意事项值得一读。
{{1}}TL;DR.{{/1}} {{2}}Qwen3.8-Max 现已正式发布(GA),每 100 万 token 定价 $2 / $6,整个 100 万 token 上下文窗口价格恒定,且不收取长提示附加费——在输出价格上低于 Kimi K3($3/$15)和 Claude Opus 5($5/$25),而输出正是推理工作的主要成本所在。{{/2}} {{3}}阿里巴巴发布了一份亮眼的基准测试成绩表(Terminal-Bench 2.1 86.6 分、GPQA Diamond 92.6 分、OSWorld-Verified 86.1 分),与前代相比,其编码能力的跃升幅度令人瞩目:FrontierSWE 从 40.7 提升到了 73.5。{{/3}} {{4}}但这份质量榜单出自阿里巴巴自己;如今,第一位独立裁判——Artificial Analysis Intelligence Index——也已给出结论:Qwen3.8-Max 得分 56,每任务成本 $1.14,与 Claude Opus 4.8(56 分)不相上下,比开放权重领头羊 Kimi K3(57 分)落后 1 分,而每任务成本却高出 25%。{{/4}} {{5}}活跃参数数量不再是一个问号:官方模型卡已确认,2.4T 总参数中激活 95B,这让外界终于能够估算其模型服务的成本账了。{{/5}} {{6}}自本评测最初上线以来,第二条托管路径也已开通:作为阿里巴巴的 Day 0 合作伙伴,Qwen3.8-Max 于 8 月 14 日在 DigitalOcean Serverless Inference 上正式上线。DigitalOcean 公布的托管数据——prefill 吞吐可扩展至约 16,000 token/秒,256 个并发请求下输出约 1,937 token/秒,且零错误——是头一份来自阿里巴巴以外的服务商的实打实的延迟数据。{{/6}} {{7}}9 月 2 日,阿里巴巴将旗舰版本更新为 Qwen3.8-Max-0902,在 Coding 与 Cowork 上做了进一步后训练。Qwen 称新快照在复杂的企业级与科学工作负载上表现更强——但这仍是供应商单方面的说法,企业级与科学任务方面尚没有任何独立数据。{{/7}} {{8}}0902 版在编码方面如今也有了自己的独立竞技场成绩:据阿里巴巴援引实时第三方竞技场榜单,Qwen3.8-Max-0902 以 1,691 分在 Code Arena: WebDev 排行榜上首次亮相即登顶第一——较上一版本高出 22 分,领先于 Claude Opus 5 和 Kimi K3。{{/8}} {{9}}同一周,智能体电商(agentic-commerce)这边也多了一块记分牌:在阿里巴巴 Accio 团队基于真实电商软件的有状态副本构建的新基准 CommerceAgentBench 上,Qwen3.8-Max 取得了开放权重模型的最强成绩——三个 harness 合计通过 156 项,领先 DeepSeek V4 Pro 两项。不过,这是供应商自己跑出的榜单,并非独立裁判给出的结果。{{/9}} {{10}}结论:如今确实买得到了,价格也足够低,足以支撑你做一次真正的评估——但要有的放矢地接入,而不是一股脑全线替换。{{/10}}
关键要点
• 自2026年8月3日起GA。预览和积分活动时代已经结束;现在有了真实的价目表和真实的端点。
• $2 / $6 每 1M token,1M 上下文范围内采用单一平价档位。大多数竞争对手会对长提示词额外收费,而 Alibaba 不会,这对长文档和大型代码库工作意义重大。
• Alibaba 的基准测试榜单表现强劲,但未经审计:Terminal-Bench 2.1 86.6、GPQA Diamond 92.6、PaperBench 93.0、IFBench 82.8、OSWorld-Verified 86.1、OmniDocBench 1.5 92.1。
• 编码的代际飞跃才是真正的亮点:FrontierSWE 73.5(从40.7)和DeepSWE 1.1 56.6(从21.6)——两者均接近翻倍。
• 首个独立评分揭晓:Qwen3.8-Max 的得分在 AA Intelligence Index 上为 56 分,每个任务 1.14 美元——较 Qwen3.7-Max(46 分)跃升 10 分,与 Claude Opus 4.8(56 分)持平,落后 Kimi K3(57 分)1 分。LMArena 的综合排行榜上仍无公开分数。
• 激活参数确认为 95B——官方模型卡显示总参数 2.4T、激活参数 95B,解决了服务成本核算中最大的悬而未决问题。
• 开放权重已发布 —— Qwen3.8-2.4T-A95B(BF16)和 Qwen3.8-2.4T-A95B-FP8 于 8 月 12 日上线 Hugging Face,采用自定义的 Qwen3.8-Max 许可证,而非 Apache 2.0。Qwen3.8-27B 本地部署版本于 8 月 14 日以 Apache 2.0 许可证发布。
• 第二条托管路径于8月14日开通。Qwen3.8-Max 已在 DigitalOcean Serverless Inference 上线,作为阿里巴巴的“Day 0 发布合作伙伴”——基于 NVIDIA HGX B300 的 NVFP4,定价 $2/$6,缓存输入 $0.20,以开放检查点的原生 262K 上下文提供服务。DigitalOcean 的实测数据(预填充约 16K tokens/秒,256 并发下零错误)是阿里巴巴之外托管平台上的首批服务性能数据。
• 9月2日更新:Qwen3.8-Max-0902。阿里在Coding和Cowork上对旗舰模型进行了进一步后训练,并在QwenCloud上以同样的$2/$6价格和100万上下文提供服务。Qwen称企业和科学性能更强——这仍是厂商说法——而编码方面在同一天获得了一项独立榜单成绩:该版本在Code Arena: WebDev上以1,691分首次亮相即位列第一(下文Code Arena要点)。
• CommerceAgentBench:开放权重模型的领跑者,由厂商自行运行。阿里巴巴Accio团队本周发布了CommerceAgentBench——在真实商业和企业软件的有状态副本中设置107项长周期任务,并在Accio、OpenClaw和Pi三种测试框架中进行基于状态的评分。Qwen3.8-Max以156次总通过数领跑开放权重模型,领先DeepSeek V4 Pro两次;闭源模型Claude Opus 5则以191次通过数位居整体第一,而这份榜单出自阿里巴巴自己,并非独立的第三方评测。
• Code Arena: WebDev #1——0902 版本的独立竞技场成绩。 Qwen3.8-Max-0902 在 Code Arena: WebDev 排行榜首次亮相即以 1,691 分登顶——较上一版本高出 22 分,领先于 Claude Opus 5 和 Kimi K3——并以约 5 美元/MToken 的综合价格领跑该榜的性价比帕累托前沿,价格约为 Claude Opus 5 综合价格的四分之一。Qwen 官方 QwenCloud 账号确认了这一排名。与 CommerceAgentBench 不同,该榜单是第三方性质的:这是一个盲测人工投票竞技场,而非阿里巴巴自家的榜单;不过,“首秀即登顶第一”这一说法是阿里巴巴对某一时点排名的公告。
准确性说明:本评测中的 Qwen3.8-Max 基准测试表由阿里巴巴自行报告,尚未经过独立复现。Artificial Analysis 智能指数得分(56分,每任务1.14美元)由 AA 在阿里巴巴官方 API 上独立测得——这是该模型的第一个独立裁判。定价来自阿里巴巴 Model Studio 的 GA 价格表。开放权重仓库(Qwen3.8-2.4T-A95B 和 Qwen3.8-2.4T-A95B-FP8)、95B 激活参数数字以及许可证文本均为第一方内容:它们来自 Qwen 自家的 Hugging Face 组织,已于2026年8月13日核实。DigitalOcean 的可用性、其价格表、服务性能测量结果,以及量化版本在 GPQA 抽查中的88分,均来自 DigitalOcean 自己的文档和社区教程,与8月14日的公告同步发布;“Day 0 发布合作伙伴”的说法来自阿里巴巴的公告措辞。我们引用的竞品数据来自 Artificial Analysis 或内文标注的厂商。9月2日公布的 Qwen3.8-Max-0902 刷新版全程为厂商自述:其规格、“Coding-and-Cowork”后训练描述,以及宣称的企业和科学领域提升,全部来自 Qwen 自己的公告及其 QwenCloud 模型页面,其数字均未经独立复现。基准测试部分涉及的 Code Arena: WebDev 排名是唯一的例外:该排行榜是第三方盲投票竞技场,而非阿里巴巴的表格——尽管“以1,691分首次登场即登顶”是阿里巴巴对某个时点排名的公布,而竞技场分数会随着投票累积而持续变动。下文涉及的 CommerceAgentBench 结果属于同类情况:该基准由阿里巴巴国际团队 Accio 构建并发布,因此其表格属于阿里巴巴报告——这是一个开源基准,但并非像 Artificial Analysis 那样的独立裁判。厂商基准表通常偏乐观——请将这些结果视为在你自己工作负载上验证的假设,而非既定排名。

Qwen3.8-Max是什么?
Qwen3.8-Max 是阿里巴巴 Qwen 系列的旗舰模型:一个拥有 2.4 万亿总参数的稀疏混合专家模型,支持 100 万 token 的上下文窗口和原生多模态输入。它接受文本、图像和视频输入,并返回文本输出。它支持思考模式、函数调用、内置工具和结构化输出,并通过兼容 OpenAI 的 /v1/chat/completions 接口提供服务,这意味着大多数现有集成只需更改基础 URL 即可,无需重写。当前生产快照为 9 月 2 日发布的 Qwen3.8-Max-0902,该版本在 Coding 和 Cowork 上进行了进一步的后训练。
实际上下文数值比营销宣传的“1M”更具体一些。阿里云的元数据列出的983,616 token的上下文窗口,启用思考模式时最大输入约为991K token,以及最大输出131,072 token。这个输出上限异常慷慨,对于整文件代码生成或长报告起草等任务非常重要,在这些场景中较低的上限会迫使你进行分块和拼接。DigitalOcean目前提供的开放检查点则是不同的配置:其模型卡原生列出262,144 token,可扩展至约1,010,000,因此运行开放基础模型的第三方服务通常会落在较小的原生数值上。
活跃参数数量现已公开,仓库名称直接体现了这一点:A95B 表示 950 亿激活参数。Qwen3.8-2.4T-A95B 的官方模型卡写道“总参数量 2.4T,激活参数 95B”,这是一个细粒度混合专家(Mixture-of-Experts)模型,共有 512 个专家,每个 token 会激活其中 10 个路由专家外加 1 个共享专家。这个数字比 2.4T 这个标题数字更重要。对于稠密模型,总参数量大致能告诉你推理成本是多少;但对于 MoE 模型,总参数量几乎说明不了任何问题——只有激活参数数量才有意义,因为每个 token 实际运行的就是这些参数。一个激活 30B 参数的 2.4T 模型,与一个激活 200B 参数的模型相比,在延迟和服务成本上表现截然不同。在 95B 激活参数下,每个 token 的计算量与 90B 参数左右的稠密模型处于同一数量级——仅为稠密 2.4T 模型所需计算量的一小部分——正是这个数字,最终让下面关于自托管的疑问有了明确答案。
9月2日更新:Qwen3.8-Max-0902
2026年9月2日,Qwen发布了其首个具名生产更新。Qwen3.8-Max-0902 保持了相同的 2.4T 参数稀疏 MoE 架构、相同的 95B 激活参数、以及相同的 1M token 上下文窗口,但在此基础上针对两项能力——Coding 和 Cowork——进行了进一步后训练,并已在 QwenCloud 的 API 上以 qwen3.8-max-0902 上线(也列为 qwen3.8-max-2026-09-02)。它是一个当前推荐版本,而非分支:阿里巴巴未标注日期的 qwen3.8-max 端点现在提供 0902 快照,因此对标准模型名称的调用会命中该更新版,而带日期的 ID 则供希望固定使用精确构建版本的团队使用。自9月3日起,该快照也已在第三方托管 API 上作为独立的可路由模型 ID 列出。价格表没有变动:每 1M 输入 2 美元,每 1M 输出 6 美元,缓存费率不变。
这些性能声明出自 Qwen。公告与 QwenCloud 模型页面称,其编码能力在工程级项目和长周期自主开发上“开辟新天地”,在多工具编排与端到端任务交付方面带来“显著增强”的协作式智能体体验,并且——用该公司自己的话说——在复杂企业任务、科学研究和长周期工作流上表现更强。首次独立检验于同一天出炉。据阿里巴巴援引实时榜单,Qwen3.8-Max-0902 在 Code Arena: WebDev(即原 WebDev Arena,一个面向智能体网页开发的第三方盲评投票竞技场)上以 1,691 分首秀即登顶,较上一版本高出 22 分,领先 Claude Opus 5 和 Kimi K3。Qwen 官方账号于同日确认了这一排名,并指向 QwenCloud API。这一结果证明了什么、不能证明什么,将在下文的基准测试部分展开说明。本次更新的其余声明——企业推理、科研工作以及通用长周期自主能力——仍属厂商单方面表述,因此请保持审视八月份表格时的那种严谨:在 Artificial Analysis 的评测或真实工作负载证实之前,先将其视为假设。
“Cowork”在实践中的含义,正是这次更新变得有趣的地方。GA时代的Qwen3.8-Max已经依赖长时程自主能力——为期16天的oh-my-cli构建、超过2000轮虚拟商务——而0902版本则是阿里巴巴在这一方向上加倍投入:智能体编排多种工具,端到端交付任务,而非一次性回答。同一周,阿里巴巴的Accio团队发布了CommerceAgentBench,一个直接衡量该方向的基准:在真实商务和商业软件的有状态副本中进行107项长时程任务,其中Qwen3.8-Max在开放权重模型中领先——详见下文基准测试部分。对于评估该模型用于企业级工作的团队来说,这是最应首先验证的主张,因为它也是最难仅凭基准表来证实的一点。
定价:这次发布中最激进的方面
Alibaba Model Studio 将 Qwen3.8-Max 列为每100万输入token收费2.00美元,每100万输出token收费6.00美元。输出包含思考token,这一点很重要,因为推理密集型配置会按输出费率对内部推理过程计费。缓存计费:缓存输入命中为0.25美元每100万,显式缓存创建为2.50美元,显式缓存读取为0.17美元。
结构上有意思的部分不是标题数字,而是统一定价档。无论提示词是5,000个token还是900,000个token,阿里巴巴都收取相同的$2/$6。大多数竞争对手都会收取长上下文附加费,恰恰是因为服务近百万token的提示词成本高昂。阿里巴巴消化这一成本,是蓄意的圈地之举,瞄准的正是长上下文至关重要的那类工作负载:全代码库代码审查、合同与文件分析、多文档研究综合。
示例。假设你运行一个仓库分析代理:每次调用包含 200,000 个输入令牌(代码上下文)和 8,000 个输出令牌。
• 每次调用: 0.2M × $2 = $0.40 输入,加上 0.008M × $6 = $0.048 输出。≈ 每次调用 $0.45。
• 按每天 1,000 次调用: ≈ 448 美元/天,或约 13,400 美元/月。
• 对 Claude Opus 5 的相同调用,价格为 $5/$25: $1.00 + $0.20 = $1.20 — 大约多出 2.7 倍。
• 在稳定的代码上下文中启用提示缓存后,缓存输入价格为$0.25,将输入端从$0.40降至$0.05,使调用成本降至约$0.10——对于重复流量而言,成本降低了近4.5倍。
真正的预算关键在于缓存差异。如果你的代理在每一轮对话中都会重新读取基本未变化的上下文——大多数编码和支持代理都是如此——实际价格更接近$0.25/$6,而不是$2/$6。跳过缓存配置的团队在此模型上通常多付3–4倍。
按标价比较:Qwen3.8-Max $2/$6;其前代 Qwen3.7-Max $2.50/$7.50;Kimi K3 $3/$15;GPT-5.6 Terra $2/$12;Claude Opus 5 $5/$25。在输入方面,Qwen 只是具有竞争力。在输出方面——也就是推理和智能体工作中支出占大头的那一侧——它是该列表中所有号称前沿的模型中最便宜的一个。
Artificial Analysis 的独立测量揭示了那些廉价 token 的另一面。在其 Intelligence Index 上,Qwen3.8-Max 每个任务的成本为$1.14——是前代产品 $0.53 的两倍多,而且比 Kimi K3 的 $0.86 高 25%,尽管 Kimi K3 的挂牌价是每 token $3/$15。这一差距源于行为,而非提价:该模型平均每项 GDPval-AA 任务执行 64 步,而 Qwen3.7-Max 为 14 步;而且,由于评测框架在每一步都会重新发送完整对话,输入 token 增长了约 15 倍,输出 token 增长了约 45%。廉价的 token 并不等于廉价的智能体——预览测试者指出的冗长问题如今有了量化的价格标签。由于 OrcaRouter 通过单一 OpenAI 兼容端点以 0% 加价传递挂牌价格,那个 $1.14 对 $0.86 的问题,你无需第二份合同便可在相同的提示词上测量。

基准测试表,以及每个数字实际衡量的内容
在GA中,阿里巴巴发布了此前预览时保留的表格。报告的分数:
• Terminal-Bench 2.1 — 86.6. 衡量模型能否操作真实 shell 直至任务完成:运行命令、读取输出、从错误中恢复。这是衡量“它能否作为编码代理而非代码建议器发挥作用”的最接近的代理指标。
• GPQA Diamond — 92.6。面向研究生水平的物理、化学和生物问题,设计为难以通过检索获取答案。高分表明真正的科学推理能力,而非记忆。92.6 的成绩处于当前领域的顶尖水平。
• PaperBench:93.0。复现研究论文中的结果——阅读方法论并重新实现它。奖励持续的多步骤理解能力。
• IFBench — 82.8。约束条件下的指令遵循:格式、长度和否定指令。值得注意的是,这是阿里巴巴自家评测表中得分最低的一项,这与预览版时期的抱怨一致,即该模型过于详尽,以至于无视了范围限制。
• OSWorld-Verified — 86.1. 计算机使用:驱动真实桌面GUI完成任务。在此方面的强劲表现支持了智能体定位。
• OmniDocBench 1.5 — 92.1.文档解析——表格、版面、图文混排。配合 1M 统一费率的上下文窗口,为文档处理流水线提供了切实的用例。
• FrontierSWE — 73.5,较前代的40.7有所提升。 DeepSWE 1.1 — 56.6,较21.6有所提升。
最后两点值得强调。在一代更新中,高难度软件工程基准测试成绩近乎翻倍,这并非正常的渐进式提升,也与阿里巴巴将该模型面向开发者而非聊天用户进行推广的决定相吻合。如果 FrontierSWE 的数据能通过独立复现的检验,Qwen3.8-Max 就是一个严肃的编程模型,而不只是一个大型模型。
预览时提出的保留意见已有所减弱,但并未消失。上表由阿里巴巴在自家测试框架下生成,外界无法核查其具体条件。厂商提供的跑分表是选出来的,而不是抽样得来的——各家实验室只公布自己表现好的基准测试。但截至8月6日,现在出现了一个真正的独立裁判:Artificial Analysis 已给出 Qwen3.8-Max 的评分:智能指数56分,每任务成本1.14美元。该评分基于阿里巴巴官方API测得——较上一代的46分跃升10分,与Claude Opus 4.8(56分)持平,落后Kimi K3(57分)1分。在AA的智能体GDPval-AA排行榜上,该模型达到1,739 Elo,超过Kimi K3(1,685)和GPT-5.6 Sol(1,730),仅次于Claude Opus 5(1,852)。AA自身的保留意见也值得同等重视:早期一次运行在端点问题解决前得分为53,官方API复测得56分;AA-Omniscience因幻觉率从23%升至40%而下跌10分;每任务成本偏高,恰恰是因为该模型需要执行的步骤多得多。LMArena综合排行榜上依然没有公开分数。
DigitalOcean 的此次发布增添了第三个数据点,而且这个数据点针对的是量化版本,而非旗舰版。DigitalOcean 对其提供的 NVFP4 权重进行了内部抽查,在 GPQA Diamond 上得分 88,而阿里巴巴公布的非量化旗舰版为 92.6。DigitalOcean 自己也将这一比较标为“指示性数据点,而非受控比较”——差异体现在三个维度上(基于开放权重而非托管旗舰版、使用 NVFP4 而非 BF16、以及不同的评估栈)——但这是对这批权重在实际服务部署中的首次独立检验,也提醒人们:开放检查点与阿里巴巴表格上的数字并非逐字节一致。
CommerceAgentBench:智能体商务排行榜
在本次更新之外,阿里巴巴国际的Accio团队还发布了CommerceAgentBench,这是一个专为评估Qwen一直宣传的长期任务能力而构建的基准。代理会在一个全新容器中启动每项任务,容器位于真实商业与商务软件的14个离线副本之一——涵盖商品发布、货运预订、店铺管理、支付运营、供应商分析——评分基于状态:只有当底层模拟服务以及生成的文件实际发生变化时,任务才算通过,因此一个只是叙述出貌似合理的工作流程、却未改变状态的代理将得分为零。该套件涵盖CLI、浏览器、文件/文档以及API/MCP界面上的107个任务,通过三种测试框架执行——Accio、OpenClaw和Pi——框架代码(Apache 2.0)与任务数据(CC BY 4.0)均已开放,可供检视或重新运行。
在已发布的榜单上,Qwen3.8-Max 记录了开源权重模型的最强结果:在 Accio 基准框架上 107 项任务中通过 56 项,在 OpenClaw 上通过 47 项,在 Pi 上通过 53 项——合计 156 次通过,比 DeepSeek V4 Pro 的 154 次多两次。开源权重模型的全部优势都来自 Accio 框架;两个模型在 OpenClaw 和 Pi 上持平。开源权重领先并不等于总榜领先:闭源模型 Claude Opus 5 以合计 191 次通过领先全场,多出 35 次。而这份榜单是阿里巴巴自家发布的——Accio 是阿里巴巴的团队,仓库本身也标注了审计限制:Accio 框架仅供参照,无法从代码检出中复现(OpenClaw 才是可重跑的路径),任务级结果缺乏不可篡改的公开校验和,Qwen 的条目依赖推理内容重放协议才能保持可比性。应将其视为厂商自述的数据点,与 OSWorld-Verified 和 AA 的 GDPval-AA 方法从不同角度衡量同一条智能体轴线——值得针对你自己的实际工作流去检验,而非一份定论排名。
Code Arena WebDev:0902 版本的独立裁判
Code Arena 是这次更新所缺失的那项独立证据。它是一个面向智能体网络开发的第三方排行榜——即先前被称为 WebDev Arena 的项目——在这里,人类对“用户更愿意采用哪个模型的输出”进行盲测、两两投票,这些投票结果会被转化为 Elo 式评分。在其 WebDev 榜单上,Qwen3.8-Max-0902 以 1,691 分首次登顶,较上一版本提高 22 分,领先于 Claude Opus 5 和 Kimi K3。这一排名还带有成本效率优势:按混合后每百万 token 约 5 美元计算——即把 2/6 美元的标价按网页应用生成实际产生的那种侧重输出的混合比例加权——0902 版本是该榜单帕累托前沿上得分最高的模型,成本约为 Claude Opus 5 混合价格(约 20 美元/百万 token)的四分之一,也远低于 Kimi K3 的约 12 美元/百万 token;这正是后两者尽管在得分上排名第二和第三,却位于前沿之外的原因。阿里巴巴于 9 月 2 日公布了这一排名,Qwen 官方账号也予以确认,并将用户引导至 QwenCloud。这项评测并非阿里巴巴自己做的:与上面的基准测试表或紧接其上的 CommerceAgentBench 运行不同,该分数是由第三方竞技场根据人类偏好投票产生的。
有两个注意事项让这一评价保持诚实。首先,竞技场评分是时点性的:1691 是阿里巴巴宣布该模型登场时排行榜上的位置,随着投票累积它会漂移,因此应将其视为 Web 开发编码方面的一个强信号,而非永久桂冠。其次,它只覆盖那一个维度。此次刷新版本在企业级、科学以及通用长周期任务上的声称仍然没有独立裁判,这就是为什么厂商对照表和基础模型上的 AA Index 56 仍是智能体前端工作之外一切内容的参考点。第三,前沿价格是一种建模选择,而不是新的费率表:约 5 美元/百万 Token 的数字,是将未变的 2 美元/6 美元报价在偏向输出端的使用假设下混合而成,所以应将其视为竞技场自身规则下的成本效率排名,而非阿里巴巴的重新定价。

开放权重、Qwen3.8-27B 以及本地部署的问题
阿里巴巴的开源权重承诺现已兑现。2026年8月12日,Qwen在Hugging Face上发布了两个仓库——BF16格式的Qwen3.8-2.4T-A95B和Qwen3.8-2.4T-A95B-FP8——各包含213个权重文件。许可证是自定义的Qwen3.8-Max许可证,而非Apache 2.0;Hugging Face的许可证字段显示为"other"。条款允许使用、修改、分发和微调,包括商业用途,但需署名,另加两个基于规模的限制条件:月活跃用户超过1亿或月收入超过2000万美元的产品必须显著展示模型名称;而Model-as-a-Service或AI工作助手业务,若过去十二个月累计收入超过5000万美元,则需要向Qwen单独申请许可证。大多数团队都在这些门槛之内;如果你的业务突破了这些门槛,在基于其构建之前请先阅读许可证文本。下载计数也印证了其发布之新——截至撰写本文时,BF16仓库为978次,FP8仓库为3,851次,对于一个前沿发布来说偏低,这与一个8月8日创建、直到8月12日才转为公开的仓库相符,而非已经可见一周的仓库。还有一点关于诚实的说明:开放检查点是基础模型,仅支持文本且思考模式始终开启,而托管的Qwen3.8-Max API则增加了视觉输入、可选的非思考模式以及完整的100万上下文——下载权重获得的是模型本身,而非API的全部功能。
自托管旗舰模型对多数团队而言仍遥不可及,但如今这种遥不可及有了已知的数学依据。完整的2.4T参数权重集在BF16下约为4.9TB,在FP8下约为2.4TB,因为每个专家都必须驻留内存,尽管每个token只激活95B参数。按4比特量化计算,大约为1.2TB,而每张H200约141GB,因此在提供第一个token之前,你就需要八块甚至更多顶级加速器。如今公开的激活参数数量弥补了吞吐量这一侧:每个token激活95B参数,每个token的计算量与约90B级别的稠密模型相当——只是稠密2.4T模型所需成本的一小部分——因此一旦权重驻留内存,每个token的成本并非总参数数量所暗示的噩梦。大内存占用与中等每token计算量的结合,正是阿里巴巴能将输出定价为每百万token 6美元的原因,这也让自托管团队走向多GPU节点运行FP8检查点,而非任何单GPU方案。
DigitalOcean 的服务选择是这一数学原理在生产环境中的实际例证。它专门在 NVIDIA HGX B300 GPU 上以 NVFP4 量化方式运行该模型,使得 2.4T 权重能够适配在单个节点上,从而避免跨节点专家路由——这是本节此前在纸面上探讨的 4-bit 经济学的一次实际部署。其权衡正是上面 GPQA 抽查所量化的:占用空间更小,但相对未量化的旗舰模型,在质量上有一定可衡量的代价。
也正因如此,对大多数读者来说,Qwen3.8-27B 才是更值得关注的发布——与旗舰版不同,它的权重如期上线。2026 年 8 月 14 日,Qwen 在 Hugging Face 和 ModelScope 上以 Apache 2.0 许可证发布了 Qwen/Qwen3.8-27B:一个稠密架构的 27B 模型,原生多模态,原生上下文为 262K token(可扩展至 1M),并支持可配置的 reasoning_effort 模式。Unsloth 的 Daniel Han 曾估计,它只需约 17GB 显存即可运行——一张高端消费级显卡——而这一点如今已可实测验证:官方仓库提供了 BF16 safetensors(18 个分片,约 55.6GB),社区仓库随后也上线了 GGUF 量化版本。至此,这一代的发布节奏已经完整:2.4T 旗舰模型的权重于 8 月 12 日先行发布,面向本地部署的小型模型则在两天后落地。我们曾在《Qwen3.8-27B 发布日期》一文中跟踪报道了它的发布。
Qwen3.8-Max 的适用场景:四种情境
1. 长文档与合同分析。这是最契合的场景。在 1M tokens 的统一定价加上 OmniDocBench 92.1 的加持下,你可以一次调用处理一份 400 页的文件,而无需附加费,也无需分块。那些对长上下文收取溢价的竞争对手,会使同样的工作成本明显更高。在 DigitalOcean 路径上,请记住该路径服务于开放基础模型,上下文为 262K——这仍然是一份大文件,但并非完整的百万级。
2. 仓库级编码智能体。Terminal-Bench 86.6 和 FrontierSWE 73.5 佐证了这一点,而缓存定价使得在稳定代码库上进行迭代工作的成本很低。首先要测试的是在你自己的并发条件下的延迟,因为预览时代的评测者发现该模型在长周期智能体运行中虽然全面但速度较慢,而且正式发布版服务与预览版服务是两回事。AA 的 GDPval-AA 结果——以每个任务 64 步的代价取得领先的 1,739 Elo——是对这种权衡两方面的独立确认。DigitalOcean 在 8 月 12 日的测量结果——在 256 个并发请求下,聚合吞吐量近乎线性扩展至约 1,937 输出 token/秒,零错误且未发现饱和——是这一问题上首个托管平台数据点,不过这些是 DigitalOcean 自家服务上的数据,而非与 Alibaba 服务的正面比较。
3. 文档与截图流水线。 视频和图像输入加上 OSWorld-Verified 86.1 使其在读取屏幕的工作流中具有可信度——QA 自动化、从截图进行支持分类、RPA 相关任务。同样,多模态输入是托管 API 功能;DigitalOcean 开放基础路径仅支持文本。
4. 我们目前还不会把它放在哪里。对延迟敏感的关键交互式用户体验,以及任何需要可复现评估的受监管工作负载。对于前者,你需要自己掌控的、经过测量的吞吐量。对于后者,可复现性如今有了模型卡和可引用的许可证,但阿里巴巴的基准测试表仍未被复制——而且AA的Omniscience回归(幻觉率高达40%)提醒我们,独立评分是一把双刃剑。

如何访问 Qwen3.8-Max
有几种可行的途径。直接通过 Alibaba Model Studio / DashScope,或 Qwen 自己的 QwenCloud API,可以拿到上述价格表,并能最早使用带日期的新快照——9月2日的 Qwen3.8-Max-0902 版本就是先在那里上线,随后才推广到其他端点——代价是需要接入新的供应商并再管理一个密钥。Qwen Chat 和 Qwen App 是在写代码前快速查看行为的最快方法。从 Hugging Face 下载开放权重是第四条路径,适合想自己搭建基础设施的团队——但要注意上面提到的体积和许可证方面的限制。通过路由服务接入则是大多数生产团队应当考虑的选项,因为它把迁移决策从评估决策中分离了出来。
自2026年8月14日起,确实有了一个全新选择:Qwen3.8-Max已在DigitalOcean Serverless Inference上上线,阿里巴巴将其称为“Day 0 首发合作伙伴”——这是阿里巴巴自己的说法,不过该列表由DigitalOcean提供,且独立存在。DigitalOcean提供开放权重检查点(平台模型IDqwen3.8-max),经NVFP4量化,运行于NVIDIA HGX B300 GPU上,与Inferact进行技术合作,作为完全托管的无服务器API:一个端点,按用量计费,无需管理基础设施。其价格表与阿里巴巴的列表一致——输入$2.00 / 输出$6.00每100万,缓存输入为$0.20——并且提供开放基础模型的原生262K上下文,始终开启思考,而非托管旗舰版的约百万token多模态模式。如果您的负载偏向长上下文,这个上下文上限就很重要:完整的百万token模式仍仅限阿里巴巴API提供。
DigitalOcean 这条路径在地理位置之外带来的,是首个来自阿里巴巴以外服务商的真实服务数据。DigitalOcean 于 8 月 12 日对其生产端点进行的测量显示,预填充扩展近似线性,速率约为 16,000 tokens/sec——经验法则:TTFT ≈(输入 ÷ 16,000)+ 0.7 秒,因此在约 1,080 tokens 时约为 1.1 秒,在约 254K tokens 时约为 15.8 秒——并且总吞吐量达到 约 1,937 输出 tokens/sec(256 个并发请求下),零错误且未发现饱和点。这些是 DigitalOcean 在其自身部署上的数据,而非受控对比测试,但它们是该模型在阿里巴巴云之外的首批延迟与并发数据,直接回应了预览时代“全面但缓慢”的担忧。
Qwen3.8-Max 已在 OrcaRouter 上线,模型标识为 qwen/qwen3.8-max;9 月 2 日的更新版也可通过其自带日期 ID —— qwen/qwen3.8-max-0902 —— 进行路由,两者价格相同,均为 $2.00 / $6.00 的挂牌费率。OrcaRouter 加价 0%,并直接沿用提供商定价,因此无论选择哪条路由,成本都与直连相同。我们自己的服务遥测目前显示,7 天窗口内 p50 的首令牌时间为 1.64 秒。这是第一方延迟测量结果,而非供应商声称的数据,值得与预览阶段那种“我用过的最慢模型”的评价放在一起权衡:那些评价来自一位评测者在预览基础设施上运行长达一小时的智能体构建任务,应当对照正式发布服务重新测试,而不是当作当前事实反复引用。
路由路径的实际价值在于:Qwen3.8-Max 与您已经运行的模型一样,位于同一个兼容 OpenAI 的端点后面,因此评估只需更改模型字符串。您可以将 5% 的生产流量发送给它,在相同的提示词下与现有模型进行比较,并保留回退方案——这正是带有未复制供应商表的模型应采用的姿态。同样的姿态也是测试 DigitalOcean 部署的正确方式:在设置好回退方案的前提下向其发送一小部分流量,而不是把生产路径押在一个刚上线两周的服务栈上。

局限性与坦诚风险
• 供应商表仍未经过审计。独立评分已出(AA 指数 56),但阿里巴巴自己的基准表仍无法复现,且 AA 的测量指出 Omniscience 出现退化,幻觉率高达 40%。独立评分有所帮助;但它并不能使供应商表变得可审计。
• DigitalOcean 的路径是开放基础,而非旗舰。 它提供的是 262K 上下文的检查点,纯文本,思考始终开启,NVFP4 量化——而 DigitalOcean 自己的抽查分数在 GPQA Diamond 上达到 88,对比阿里巴巴公布的 92.6,DigitalOcean 称这一差距是提示性的而非受控的。如果你需要完整的百万 token 多模态 API,那仍由阿里巴巴托管。
• Qwen3.8-27B 已发布,但编号由厂商自行标注。 27B 的权重已于 8 月 14 日以 Apache 2.0 许可发布,弥补了本地部署的空白——但其基准测试数据由阿里巴巴自行报告,尚未得到复现,而且截至本次更新,社区量化版本仍在陆续推出。
• 自定义许可证,并非 Apache 2.0。Qwen3.8-Max 许可证允许在注明出处的情况下用于商业用途,但设有两个规模门槛——月活跃用户超过 1 亿或月收入超过 2000 万美元时,需显著展示模型名称;MaaS/AI-Work-Assistant 类业务若过去十二个月收入超过 5000 万美元,则需另行取得许可证。在规模超过这些门槛之前,请务必阅读许可证条款。
• 冗长与指令漂移。IFBench 82.8 是阿里自家表格中最弱的一项数字,而且预览测试者反复看到模型超出范围——添加未要求的特性。AA 自己的数据现在给出了具体数值:每个 GDPval-AA 任务需要 64 步,这才把成本推高到 1.14 美元,比 Kimi K3 高出 25%。在演示中很亮眼,但当输出按 $6/1M 计费时就很昂贵,在你需要精确格式时还会造成不稳定。
• 内容护栏。与其他中国托管的前沿模型一样,涉及政治敏感话题的回复会受到限制。如果您的产品服务于开放式查询,这一点需要关注。
• 思考token按输出计费。 启用推理后,实际成本会高于粗略估算。请以实际发布时的推理配置进行测量。

常见问题
Qwen3.8-Max现在可用了吗?
是的。它于2026年8月3日达到正式可用(GA)状态,发布了定价表,并提供兼容OpenAI和DashScope的API。当前的生产快照——Qwen3.8-Max-0902(9月2日发布)——已在QwenCloud的API上运行,也是标准qwen3.8-max端点目前所服务的版本。这与7月19日的预览状态不同,当时访问仅限于Qwen Chat、Qwen App和Qoder的积分活动。
什么是Qwen3.8-Max-0902?
Qwen3.8-Max-0902 是 Qwen3.8-Max 于2026年9月2日推出的生产版本更新:相同的2.4T参数稀疏MoE旗舰模型和1M token上下文,在Coding和Cowork上进一步后训练,并以相同的$2/$6价格上线QwenCloud API。Qwen表示,新快照在复杂的企业级和科学任务上表现更强——这是厂商的说法,尚未经过独立基准测试——而在编码维度上,它已经拥有了一项独立结果:根据阿里巴巴关于实时竞技场榜单的公告,以及Qwen自家QwenCloud账号的确认,它在Code Arena: WebDev榜单上以1,691分排名第一,并以约$5/MToken的混合价格处于其性价比帕累托前沿的顶端。
Qwen3.8-Max 的价格是多少?
每100万输入token收费2.00美元,每100万输出token收费6.00美元,在整个100万token上下文窗口内费率统一,无长提示附加费。缓存输入命中为每100万token 0.25美元,显式缓存创建为2.50美元,缓存读取为0.17美元。思考token按输出费率计费。在Artificial Analysis的Intelligence Index上,该模型的实测成本为每任务1.14美元——有关其为何高于token数学计算的原因,请参阅定价部分。DigitalOcean的无服务器方案列出相同的2美元/6美元价格,缓存输入为0.20美元。
Qwen3.8-Max 有多少个参数?
总参数量为2.4万亿,采用稀疏混合专家(MoE)配置。实际激活的参数量——即真正决定服务成本与延迟的指标——现依据Qwen3.8-2.4T-A95B官方模型卡确认为950亿(512个专家;每个token激活10个路由专家加1个共享专家)。
Qwen3.8-Max的权重是否开源?
是的——自2026年8月12日起。Qwen在Hugging Face上发布了Qwen3.8-2.4T-A95B(BF16)和Qwen3.8-2.4T-A95B-FP8,每个都有213个权重文件。许可证是自定义的Qwen3.8-Max许可证(Hugging Face将其列为"other"),而不是Apache 2.0:它允许在注明出处的情况下进行商业使用,并带有两个基于规模的限制门槛。开放的检查点仅支持文本,且始终开启思考模式;托管的API则增加了视觉、可选的非思考模式以及完整的1M上下文。
Qwen3.8-Max 是否经过独立基准测试?
是的——截至2026年8月6日。Artificial Analysis在阿里巴巴官方API上测得该模型的智能指数(Intelligence Index)为56分,每个任务成本1.14美元:比Qwen3.7-Max(46分)高出10分,与Claude Opus 4.8(56分)持平,并落后Kimi K3(57分)1分。不过,上表中的基准测试结果仍然是阿里巴巴自行报告、未经复现的,LMArena综合排行榜上也依然没有任何公开分数。独立评测竞技场的格局在9月2日发生了变化:0902更新版在同一平台的Code Arena: WebDev榜单上以1,691分首次登场即登顶——这是第三方盲测投票的结果,而不是阿里巴巴的榜单——同时Code Arena的成本-性能前沿将该模型列为该榜上得分最高的性价比之选,综合费率约为5美元/MToken。DigitalOcean对该模型量化构建版本的抽查(GPQA Diamond得分88)是第三方对线上部署服务的首次检验,且明确属于参考性结果而非受控实验。关于“独立”这一列,有一点需要提请注意:Qwen3.8-Max在CommerceAgentBench中虽然领跑开源权重模型,但这并不构成第二个独立裁判——构建并发布该基准的Accio实际上是阿里巴巴自己的团队。
Qwen3.8-Max 比 Qwen3.7-Max 更好吗?
按照阿里巴巴自己的数据,提升幅度相当显著——FrontierSWE 73.5 对 40.7,DeepSWE 1.1 56.6 对 21.6,在困难的软件工程任务上接近翻倍。其价格也低于前代的 $2.50/$7.50。独立而言,AA 将其代际跃升评定为 Intelligence Index 上的 10 个点(56 对 46)。两家供应商的说法仍应在您的工作负载上加以验证。
我能自己托管 Qwen3.8-Max 吗?
实际上并不现实。完整的2.4T权重集在BF16下约为4.9TB,在FP8下约为2.4TB,在4位精度下约为1.2TB——而每块H200约为141GB,这意味着需要八块或更多顶级GPU。每token激活95B参数,单token的计算量相对适中,但内存占用才是真正的制约因素。DigitalOcean在B300s上提供的NVFP4服务就是实际证明:4位精度可以将模型装入单个节点。Qwen3.8-27B——据报道显存占用约17GB——是现实可行的本地部署选择,其权重已于2026年8月14日以Apache 2.0许可证发布——现在已可下载,不再只是空头承诺。
Qwen3.8-27B 是什么?
与旗舰产品一同发布的更小型模型,定位为实用的本地部署路径。它是一个稠密27B模型,原生多模态,原生上下文为262K token,可扩展至1M,并以Apache 2.0许可发布。其权重于2026年8月14日上线Hugging Face和ModelScope;Unsloth的Daniel Han报告称,它大约只需17GB显存即可运行——相当于一张高端消费级显卡。其基准测试数据由阿里方面报告,尚未被独立复现。
Qwen3.8-Max 是多模态的吗?
是的——它接受文本、图像和视频输入,并返回文本。它还支持思考模式、函数调用、内置工具和结构化输出。开放权重检查点仅支持文本;多模态输入是托管API的功能,而DigitalOcean路径不提供该功能。
Qwen3.8-Max 在 DigitalOcean 上可用吗?
是的——自2026年8月14日起。DigitalOcean Serverless Inference 提供开放权重检查点(NVIDIA HGX B300 上的 NVFP4),价格为每 1M token $2.00/$6.00,缓存输入 $0.20,上下文长度 262K token,仅文本,思考始终开启。阿里巴巴称 DigitalOcean 为其“Day 0 上线合作伙伴”;该列表本身属于 DigitalOcean,与该说法无关。DigitalOcean 的实测数据:预填充约 16K token/秒,在 256 个并发请求下输出约 1,937 token/秒,零错误。
我可以通过OrcaRouter使用Qwen3.8-Max吗?
是的。它已以 qwen/qwen3.8-max 上线,而 9 月 2 日的快照则作为独立的带日期 ID — qwen/qwen3.8-max-0902 — 采用相同的 $2.00/$6.00 标价,加价 0%。经由你已经使用的 OpenAI 兼容端点,路由成本与直接访问相同。我们的 7 天遥测数据显示,首 token 时间的 p50 为 1.64 秒。
我今天应该把生产流量迁移到它上面吗?
不是全面替换。定价和首个独立评分使得认真评估既便宜又值得现在进行,但每任务成本比 Kimi K3 高出 25%,因此纪律性的做法是在相同提示词上对现有系统进行流量拆分,并设置回退机制——而不是迁移。DigitalOcean 路径增加了第二个可供测试的托管部署,这使评估更加便宜。
底线
Qwen3.8-Max 曾有两周时间是最有趣却又无人能买到的模型。正式发布(GA)时,它已是一个截然不同的选择:每百万 token 统一 $2/$6 的定价相当激进,缓存费率让迭代式 agent 工作变得廉价,而 FrontierSWE 与 DeepSWE 上的代际跃升——如果能够复现——则标志着这是一款真正的编程模型,而非单纯的规模炫技。8 月 12 日,开放权重在真正的许可协议下如期发布,使“开放权重即将到来”从承诺变为事实;8 月 14 日宣布的 DigitalOcean 首日上线渠道——附有实测服务数据和 $0.20 的缓存读取价格——进一步强化了“低成本试用”的理由,也为团队提供了可与阿里巴巴自家 API 对比的托管式第三方部署方案。9 月 2 日的 Qwen3.8-Max-0902 更新保持了这一核心论点:$2/$6 定价与 1M 上下文不变,并针对该模型原本就瞄准的编程与协作任务增加了更多后训练。此次更新还为编程主张新增了一个独立的人工偏好排行榜:Qwen3.8-Max-0902 以 1,691 分在 Code Arena 的 WebDev 榜单上首发登顶,领先 Claude Opus 5 与 Kimi K3;若按综合约 $5/MToken 计算,它是该榜单成本-性能帕累托前沿上得分最高的模型。阿里巴巴 Accio 团队同一周发布的 CommerceAgentBench 结果——Qwen3.8-Max 在基于真实电商工作流构建的基准上领跑开放权重阵营——则为“协作工作”这一论点提供了自己的具体榜单,尽管该榜单系厂商自行运营。
变化在于:裁判与权重双双落地——而 verdict 大体向好,却带着真实的星号。AA 将 Qwen3.8-Max 评为 56 分 Intelligence Index,这是一次真正的代际跃升,与 Claude Opus 4.8 平起平坐;但同一张记分卡显示,Kimi K3 以每任务成本低 25% 的优势领先 1 分,并因幻觉率上升而标注了 10 分的 Omniscience 下滑。关于激活参数的问题已尘埃落定——95B 激活,已在模型卡上确认——许可证也已发布,是定制许可而非 Apache 2.0。未变的依然如故:阿里自家基准表仍无法复现;每任务成本依然偏高,因为模型要依次处理极多步骤;DigitalOcean 上提供的开放基础模型与旗舰版头条数字存在细微差异(262K 上下文、NVFP4、GPQA 抽测 88 对 92.6);Qwen3.8-27B 的基准声称虽权重已发布,但仍为厂商自报。这些因素叠加并不意味 Qwen3.8-Max 是一笔坏赌注——这个价位上它几乎是一次不得不做的实验——但它意味着正确的姿态是:激进评估、审慎路由、保留后手。接下来值得关注的事件是:那 $1.14/任务成本背后的 agent 步骤数是否在你的工作负载可承受范围内;0902 构建在 Code Arena: WebDev 上的领先能否在票数累积中保持;其 Coding 与 Cowork 增益能否在真实负载上复现;CommerceAgentBench 开放权重领先(在阿里自家 harness 上两次聚合通过)能否经得起独立运行;27B 的基准声称能否成立;以及 DigitalOcean 部署的实测吞吐量在真实流量下能否撑住——这些将决定「仅次于 Fable 5」是定位叙事还是预言。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
