
GLM-5.3-Flash,五周之后:一次独立测评 42 分、一场 Mythos 级的漏洞利用演练,以及那个重建了自己服务栈的 GLM 智能体
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 87 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
GLM-5.3-Flash 已承载生产流量五周,而在2026年9月17日,智谱AI就其运行位置披露了一些信息:公司透露,GLM-5.3-Flash 的每一个生产请求如今都运行在一个由超过10万块国产中国AI加速器组成的集群上;从在这套硬件上首次启动,到承载其全部线上工作负载,用时不到两周;在同一时段内,端到端吞吐量提升了3.2倍。最引人注目的部分在于谁完成了这些工作。其中大部分并非由基础设施团队完成,而是由一个由GLM-5.3本身驱动的智能体完成;它读取瓶颈、提出修复方案并编写推理系统代码,而工程师则负责设定目标、构建反馈环境,并审查任何涉及数值语义、并发或生产风险的内容。GLM-5.3-Flash 是智谱于2026年8月26日发布并开源的总参数3200亿、激活180亿(320B-A18B)的多模态模型——即该公司当天揭晓的匿名“Ox Alpha”——而其更大的同门GLM-5.3则是其定价所对标的743B旗舰模型。今天披露中的三个数字都不是来自我们或任何其他人:它们都是智谱自己的。旗舰模型也不再是唯一重要的比较对象:在ExploitBench上——一项独立评估,衡量模型在真实Chrome漏洞利用阶梯上能爬多高——GLM-5.3-Flash 现在被测得与Claude Mythos Preview持平,后者是其开发者仅向经过审查的防御者发布的闭源前沿模型,而前者每次尝试的成本仅为后者的一小部分。
那是好消息,而且它是真实的,但它出自厂商。自这篇帖子在发布日首次发出以来,另外三件事发生了变化,其中两件朝着相反方向。Artificial Analysis 现已发布了自己对该模型的测量结果,而它的数字不是 Zhipu 的。让这款模型成为市场上最便宜且能力足够强的模型的发布折扣,已于 9 月 9 日如期到期,且未获延长。第三方评估机构 Generality Labs 也发布了自己的 ExploitBench 运行结果,其中 GLM-5.3-Flash 在同一阶梯上得分高于 Claude Mythos Preview 的三次运行平均值——而花费大约只有后者的 6%。对于任何在 8 月下旬将这款模型收藏为“便宜的那个”的人来说,今天的账已经和当时不同,而诚实的标题是喜忧参半:服务经济性确实改善了,价格上涨是因为促销结束,被广泛引用的智能指标未能经受住独立测试框架的首次接触,而确实对该模型有利的能力比较,是一次未经同行评审的运行,其作者自己也表示不应过度解读。
Zhipu 是集群规模、两周时间线和 3.2 倍这一数字的唯一来源——这些都没有独立审计,而且该公司自己也表示尚未实现递归自我改进,称这一结果只是最小规模循环,而非真正的递归自我改进。能核查的,我们都核查了:这篇叙述中唯一一件存在于 Zhipu 围墙之外的具体产物——Flash Linear Attention 内核中的一处精度修复——确实已合并到上游,我们已确认。下文中的数字若来自 Zhipu,文中会说明。若来自 Artificial Analysis,文中则会注明它。若来自 Generality Labs——本文中漏洞利用数字背后的安全评估机构——文中会注明它,并附上其作者自行附加的限定条件:一次运行、41 个 bug、自行发布的方法、没有第三方复现,以及他们主动提出的一个污染问题。若某个数字来自 Anthropic——这里是唯一来自在该答案中有竞争利害关系的实验室的数据——正文会说明它实际测量的是哪个模型,因为并非所有数字都测的是这个模型。
实际发布的内容
GLM-5.3-Flash 是一款总参数量 320B、激活参数量 18B 的混合专家模型,共有 45 层,其激活规模略高于 GLM-5.2 约 32B 的一半。最突出的能力是模态:它原生支持文本、图像和视频输入——这是 GLM-5 系列中首个做到这一点的模型——而不是通过单独的适配器来转接视觉信息。上下文长度可达 100 万 token,智谱声称其长上下文服务成本约为 GLM-5.3 的三分之一。
在架构方面,智谱将其描述为首个开源前沿模型,将混合稀疏加线性注意力与用于扩展的流形约束超连接(mHC),以及一种 IndexPool 机制相结合——该机制将四个索引器键向量压缩为一个加权池,以降低长上下文延迟。预训练在一个 30 万亿 token 的多模态语料库上运行。这一切都没有经过独立审计——这是智谱在描述自己的模型——但服务效率方面的说法已经足够具体,如今权重就摆在开源推理栈面前,可以进行测试了,而 9 月 17 日的说明则首次详细呈现了服务侧实际是如何构建的。
发布当天的规格表,一目了然:
• 参数 — 总计320B / 激活18B,45层,MoE。
• 模态——原生文本、图像和视频输入;文本输出。
• 上下文窗口 — 最多 1,000,000 tokens
• 许可 — MIT,自发布之日起就在 Hugging Face 上开放权重。
• {{1}}价格{{/1}} — 每百万词元 0.15 美元 / 0.50 美元(输入 / 输出),每百万缓存输入 0.03 美元。

那张卡片是发布当天的快照,其中两行数据自 8 月 26 日以来已经发生变化。AA Index 的数值仍然只是智谱自己的说法,如今已被独立测量结果所推翻——下文会详细说明。它显示的折扣价已经失效;促销已于 9 月 9 日结束。参数量、上下文窗口、许可证和模态仍是未变的当前事实,而这幅图主要就是为呈现它们而作。
Ox Alpha 周,以及免费赠品活动真正测试的是什么
这次揭晓为持续一周的猜测画上了句号。8月20日,一个匿名模型出现在某第三方 AI API 平台上,拥有 100 万 token 上下文窗口,支持文本/图像/视频输入,价格为 0,并迅速成为该平台周榜上调用量最高的模型。社区在48小时内将其指纹追溯到 Zhipu 的 GLM 系列——与此前识别出其他中国实验室模型相同的“先匿名、后认领”模式——分析人士普遍猜测是 GLM-5.3 的 Flash 变体。8月26日的公告证实了这一猜测:免费一周是一次有意测试,该公司称,匿名运行在六天内于提供该模型的各编程平台上流转了超过 62 万亿 token,全部由国产中国芯片提供算力。
最后那句话当时看起来像一条脚注。结果它却是重点。免费的那一周主要不是营销噱头,甚至也不是对模型的一次负载测试;它是对其底层加速器集群的一次负载测试,而且测试规模大到一旦失败就会公开且无需付出代价。三周后,Zhipu 将同一集群描述为承载着该模型 100% 的生产流量。

那一周的定价逻辑如今依然成立,只有一处需要更正。一款先以0美元免费提供一周、随后以旗舰产品十分之一的价格推出、还在此基础上再打五折的模型,是入门价位区间里一次刻意为之的做市之举;而“限时”这一限定词,始终是值得留意的部分。我们当时就指出,这是一项可能被收回的安排。它如期被收回了——这一点值得直说,因为折扣到期,是这个故事中唯一会体现在账单上的变化。
一个智能体重建的服务栈
Zhipu 9 月 17 日的技术文章首次详细描述了 GLM-5.3-Flash 如何在中国芯片上提供服务,其核心主张是:一个模型帮助优化了运行它自身的系统。该公司将这一机制称为“密集反馈”:正确性测试、执行日志、追踪、微基准测试和端到端指标被串联起来,使智能体能够在本地验证假设,而不必在每次更改后等待完整部署和负载测试。为了让这一机制奏效,Zhipu 表示,反馈必须是本地的、低成本的且可客观检查的——绑定到特定内核或代码路径,足够快以便迭代,并且无需人工介入即可判定真伪。
在有了这个循环之后,该智能体发现并修复了公司详细描述的三件事:
• KDA 内核中的一条上下文并行路径在序列增长时逐渐损失精度,因为 tl.dot 尽管输入为 FP32,却默认使用 TF32,导致舍入误差随上下文长度不断累积。修复方案将输入精度固定为 tf32x3,并在不支持 TF32 的平台上回退到 ieee。其中这一条是三者中最有意思的,因为它是该叙述中唯一一条超出智谱自身基础设施范围的说法:该变更已作为 PR #1180 合并到 Flash Linear Attention 上游,我们已核实并确认其于 2026 年 8 月 27 日合并。
• KV 传输与 DeepEP 的调度未能重叠。在所使用的 DeepEP 版本中,无论是节点内 dispatch 还是节点内 combine,都没有释放 Python GIL,导致传输线程被阻塞在其后;同一份记述的英文版与中文版分别称由此产生的开销高于 20% 和高于 30%。修复之后,智谱表示其相对于纯 prefill 基线的差距已降至 1% 以下。
• 一个解码内核原本会重复计算相同的 FP32 归一化和门控四次,每个 V 维度分块各一次。拆分除法工作使内核时间减少了 9.6%,而将各分块合并到单个线程块中——从而使归一化只运行一次——带来了 1.71 倍的加速。
围绕这些修复的是结构性变更:ReplaySSM,它以计算换片上内存,因为这些加速器的片上内存比该技术栈最初为之编写的 GPU 更少;节点内张量并行,以缓解同样的压力;INT8、FP8 和 BF16 混合缓存,以扩展容量;以及 Encode-Prefill-Decode 解耦架构,它将三个推理阶段分开调度,而不是作为一条流水线。Zhipu 也坦率指出了这些限制——有限的片上内存和互连带宽、不成熟的软件、不完整的算子覆盖以及单薄的文档——并表示尚未实现递归自我改进,将这一结果描述为最小规模的循环。
要以怀疑态度看待这种说法,因为其中的动机显而易见。Zhipu 不会说明智能体完成了多少工作,工程师又完成了多少,而且对于吞吐量数据、两周时间表或集群规模,都没有外部审计。密集反馈这一表述还有一种特定的自利性:它让听起来最惊人的说法(“我们的模型实现了自我改进”)建立在最难以核查的证据(一个无人能够检视的内部循环)之上。让这个故事没有沦为纯粹营销的,是它最具体的说法可以被证伪,而且结果证明是真的——tf32x3 内核修复确实存在于上游仓库中,日期为 8 月 27 日,比围绕此事的媒体报道周期早了三个星期。
以实际美元计算,它的成本是多少
这份价目表是智谱的,而且很简单:每百万输入 token 0.15 美元,每百万输出 token 0.50 美元,每百万缓存输入 token 0.03 美元。这是截至目前的标准标价。五折的发布促销持续到 2026 年 9 月 9 日,之后没有延长,因此 8 月下旬广泛流传的那几个数字——0.075 / 0.25 / 0.015 美元——在厂商自家的 API 上已经不再适用。对照 GLM-5.3 公布的 1.40 / 4.40 美元,Flash 按标价仍然只落在其大约十分之一的水平——折扣只是在那个本身就已足够说明问题的价格之上额外附赠的优惠,而不是价格本身。Artificial Analysis 按 7:2:1 的缓存命中/输入/输出配比,算出约合每百万 token 0.10 美元的混合价格,并列出输出速度约为每秒 117 个 token,称其"明显很快",不过 AA 也指出,这些速度数字描述的是该模型的第一方 API,而非 AA 自己运行的测试。
智谱更广泛的成本叙事,是价格能够维持在那个水平的原因。在8月31日发布的半年业绩中,该公司表示,其10万加速卡国产集群上的单位token推理成本自2026年初以来已下降80%,并且由于规模、定价以及更廉价的服务,API毛利率从-0.4%升至24.6%。这些是一家向股东报告的公司给出的公司数据,未经我们审计;应将其视为方向明确,而非精确无误。上文关于推理服务的叙述正是这一说法背后的机制——更少的冗余内核执行、更低的内存压力、更好的重叠——这比一个干巴巴的百分比更可信,即便最终被引用的会是那个百分比。
对标旗舰模型的效率宣称没有变化:相较 GLM-5.3,注意力计算降低 3.0 倍,KV 缓存降低 4.4 倍,均为厂商自报;智谱承认其 KV 缓存仍略大于 DeepSeek V4 Flash 和 Kimi K3。发布时声称在国产芯片上端到端服务提升 3 倍,如今改称 3.2 倍,测量范围从首次启动到承载全量生产流量。这两个数字都出自智谱,而给出它们的两种说法相隔三周——其中没有任何一项在公司外部得到复现。
为什么这一揭示很重要——以及那个头条数字去了哪里
对于任何读过发布报道并记住了那个数字的人来说,下面这处更正最为重要。智谱的材料将 GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 上标为 57,与 Claude Opus 4.8 持平。此后,Artificial Analysis 在 Intelligence Index v4.3 上公布了自己对该模型的测量结果,读数为 42——而同一版本上 GPT-5.6 Sol(max)为 47。57 从来都不是一个独立的数字;它出自智谱,而独立测量显示,该模型比贴近前沿的区间低约五分,也远低于厂商宣传的头条数字。在同一现行指数上,GLM-5.3 本身的测量结果为 45,因此我们发布报道中出现的旗舰型号 60 这一数字,已不再与 Artificial Analysis 今天公布的结果相符。宣称与实测之间 15 分的差距并非四舍五入的差异,而这也是读者能从本次更新中获得的最有用的单一信息——但有一个限定条件,下节将会补充,因为本报道中的第二项独立测量指向恰好相反。
那次修正后,仍然成立的部分更窄,但依然真实。GLM-5.3-Flash 是一个开放权重的多模态模型,拥有 1M 上下文以及原生图像和视频输入,价格大约是其旗舰同门标价的十分之一——这种组合在美国前沿实验室那里没有直接对应物,后者可比的多模态模型成本要高得多,而且以闭源形式发布。智谱自己的说法“前沿智能,闪电成本”,正是受到打击的部分:在实测为 42 的情况下,它是一个强大的预算型模型,而不是打折的前沿模型。独立测评还显示,它在同类规模的开放权重模型中稳居中位数以上,对于一个拥有 180 亿活跃参数、推理成本只有十分之一的模型来说,这确实是一项真正的成就——只不过它与发布报道所暗示的成就是另一种。
另一个独立数字——而且它站在了模型这一边
如果 Artificial Analysis 的结果让 GLM-5.3-Flash 降了一档,那么这一次则恰恰相反,而这是整个故事中最离奇的事实。卡内基梅隆大学构建的 ExploitBench 并不问模型能否让目标崩溃。它给这条攀登路径打分:抵达易受攻击的代码、触发缺陷、构建可复用的原语,最终实现完全控制流劫持并执行任意代码,全部在开启安全沙箱的生产版 V8 上被机械化评分。Generality Labs 让 GLM-5.3-Flash 跑遍 41 个缺陷,每个缺陷给 10 亿 token 预算,而不是该基准通常的 300 轮上限,理由是轮次不能很好地代表买家实际花费,美元才是诚实的约束。GLM-5.3-Flash 在 41 个中有 13 个达到完全任意代码执行,平均能力得分为该阶梯最大值的 64.8%。Claude Mythos Preview 三次已公布的运行在同一阶梯上得分分别为 9、10 和 11——平均为 10,即 62.2%。Generality 自己在图表下方印出的表述是,按这一测量,GLM-5.3-Flash“在网络安全方面可能达到 Mythos 水平”。Anthropic 自己于 9 月 29 日发布的 ExploitBench 运行报告,在绝对比率低得多的情况下给出了同样的排序——不过测的是旗舰版 GLM-5.3,而非 Flash:它统计的是每次尝试的端到端漏洞利用,而不是阶梯进展,并将 GLM-5.3 记为 410 次中 50 次,Mythos Preview 为 410 次中 56 次。统计规则不同,排序相似——这正是为什么引用 ExploitBench 数字时绝不能不带规则。
真正重要的原因在于它底下的分母。这次运行将 GLM-5.3-Flash 的输出 token 定价为每百万 $0.20——这是其五折费率,该费率此后已经失效——对照 Claude Mythos Preview 历史性的每百万 $100,差距达 500 倍。在成本持平的情况下,这次运行每项花费 $16.81,而 Mythos 为 $297.17,这就是大约 6% 这个数字的来源。仔细读一下这个说法,因为流传的正是这个版本。并不是说 GLM-5.3-Flash 是比 Claude Mythos Preview 更好的漏洞利用开发者。而是说,在这一特定任务上,一美元的 GLM-5.3-Flash 大约能买到一美元的 Mythos token 所能买到的东西,而且前者的美元你能负担得多得多。
Generality 自己给出的说明比标题更有价值。他们明确表示,单次运行并不能证明在整个网络攻防领域已达到同等水平;污染问题仍未有定论——ExploitBench 可能以某种方式被用于训练——并且 41 个样本中有 4 个出错,其评分方式是沿用上一次观测到的结果,这即便有影响,也是低估了该模型。他们还在 9 月 28 日发布了一份后续报告,使整个对比变得更加复杂。在 2.5 亿 token 的预算下,让 GLM-5.3-Flash 跑过七种不同的智能体框架,并在十个被挑选以覆盖难度区间的样本上测试,同一套权重在 Codex 框架下得分 10.6——高于 Claude Mythos Preview 的 10.02 基准——而在 Claude Code 框架下得分为 6.2,甚至低于该基准最初限制轮次的配置(6.4)。框架对分数的影响超过了模型对比本身,而作者也表示,这十个样本的子集很可能并不具有代表性。那张图表于 10 月 2 日广泛流传,并附有"测试时计算扩展正在抹平各模型层级之间差距"的论点,这是关于整个行业的论断,而不是本次评估的发现:评估所发现的是,一个廉价的开源模型,若获得的是预算而非轮次限制,就能够在某一评测阶梯上达到前沿实验室漏洞利用专家模型的水准。
这已经不再是一个实验室的故事了。Anthropic 自家的 Frontier Red Team 评估于 9 月 29 日发布,它让 GLM-5.3-Flash——那个较小的同门型号——参与了一场人在回路(human-in-the-loop)的会话:在只提供一个已修补 Chrome 漏洞的公开细节外加另一个漏洞、且没有重要方向指引的情况下,该模型将它们串联成一个可靠的 ARM64 漏洞利用程序,绕过了指针认证加固,而这仅耗费了 20 分钟的人工注意力和 8 小时的模型工作——按智谱 API 费率计算为 20.40 美元。上文那个"410 个中命中 50 个"的 ExploitBench 数字同样出自这份评估,而那部分测量的是 GLM-5.3,即 743B 的旗舰型号,而非 Flash——这一区别在对该报告的报道中已大多被抹平。两个相互独立的当事方,不同的测试框架,不同的预算,同一个方向。两者也都只是单个实验室的单次运行,没有任何一个是可复现的结果,而且只有 Generality 那次运行报告的是 Flash 而非旗舰型号的美元数字。实际的解读正是 Anthropic 直言不讳的那一点:权重可以下载,对 GLM-5.3-Flash 做 abliteration 大约花了 600 GPU 小时,而一个每小时运行成本不到一美元的模型,其可得性问题的性质,与一个被置于审查程序之后的模型截然不同。
试试它,以及路由层如何适配
访问方式很直接。智谱自家的 API 按上述标价提供它,MIT 许可的权重以 FP8 和 BF16 格式发布在 Hugging Face 上的 zai-org/GLM-5.3-Flash,智谱的编程产品——ZCode 和 GLM Coding Plan——也将其打包提供。若自行托管,vLLM 和 SGLang 均支持它。如果你走这条路,有两点实用提示:SGLang 的 cookbook 带有一条未决变更警告,称在 5.13 之前的 transformers 构建版本上,视觉输入可能会被静默丢弃,这不会引发错误,而只会让你对图像请求得到纯文本的读取结果;另外,AMD 路径仍不是一个现成方案。最初发布日的 gfx950 启用 PR(sgl-project/sglang #37653)于 9 月 6 日被关闭且未合并,并由一组更广泛的首日 gfx950 PR 取代——通过 AITER 的 mHC、k-pool DSA 索引器、FP8 与 MXFP4 服务——其中若干在 9 月 17 日时仍处于开放状态。MI350X 级硬件上的启用正在进行中,尚未交付,而且仍没有独立的 AMD 吞吐量数据。
在路由这一侧,自发布以来情况已经发生变化:GLM-5.3-Flash 如今已进入 OrcaRouter 的模型名录,与 GLM 系列的其他成员并列。我们按供应商标价原样传递,加价 0%,且不收取路由器附加费——对于一款价格刚刚发生变动的模型来说,这正是最关键的机制:Zhipu 那边的折扣到期,你在这里当天就支付同样的价格,不必再谈第二份合同,也无需改动代码。这种原样传递是双向的,值得把话说白:促销到期就是你账单上一笔实实在在的涨价,而且上游一发生,这里就同步发生。如果你正在 Flash 与 GLM-5.3 或其他经济型模型之间权衡,它们都位于同一个密钥之后,并支持提供商之间的自动故障转移——这是在某款模型的独立评测分数尚未稳定时的低成本试用方式,不必把生产路径押在它身上。对于上文那个结果而言,这也正是合适的形式,而且理由比“方便”更直白:同一套权重在同一个基准上可能得到 10.6 分,也可能得到 6.2 分,取决于由哪个 agent harness 驱动,所以买家实际测试的是“脚手架 + 模型”的组合,而在同一个密钥下、于固定脚手架背后替换模型,比押注其中任何一个都更便宜。

接下来看什么
有四件事将决定这个故事接下来的走向。第一,42 是否会变动:该模型自 8 月以来已被广泛公开使用,因此,如果智谱的内部评估与 AA 的测试框架因某种结构性原因——推理 token 计费、冗长度、厂商赋予较高权重的一项评估——而产生分歧,那么这应当在指数修订时体现出来,而不是表现为一次性的差距。第二,漏洞利用的结果能否复现。Generality Labs 曾用自家测试框架跑过一次那 41 个 bug,并且也这么说了;后续的测试框架对比显示,仅因测试框架选择不同,同一组权重就会移动四个点,因此能一锤定音的数字,是由第二个团队在预算以美元固定、测试框架保持不变的情况下重跑这 41 个 bug。第三,国产芯片的说法能否获得第二个信源。智谱是唯一能够说明集群规模、两周时间线和 3.2 倍这一数字的一方,而其中唯一可独立验证的说法——已合并的内核修复——只是个小修复。第四,价格:折扣已经取消,而有趣的问题是,当智谱需要走量时,折扣是否会以促销形式回归,还是说现在标价就是底线。
贯穿始终的主线是,GLM-5.3-Flash 被要求同时证明两件事——一款廉价模型能行,以及中国加速器能够大规模承载它——而 9月17日的披露,则是 Zhipu 对第二个问题的回答,且由一款参与撰写该披露的模型发布。第一个问题如今附上了两个独立数字,而它们指向相反的方向:智能指数上的 42 分,远低于厂商的主打宣传数字;以及一次漏洞利用测试,成绩与某前沿实验室的专家模型持平,成本却只有后者的二十分之一。两者可以同时成立,而真正作出决策的依据,恰恰是它们之间的差距——而非其中任何一个数字。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
