
Ox Alpha 揭晓:Z.AI 将其以开放权重形式发布为 GLM-5.3-Flash
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 144 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
8月26日(周三)晚间,这场谜团以取证分析所预示的方式落幕。Z.AI——这家位于北京、打造GLM系列的实验室——将其一直以匿名方式测试的模型作为开放权重产品发布,命名为GLM-5.3-Flash,这正是子名称分词器取证分析和预测市场所共同指向的结论。Ox Alpha,这个自8月20日浮出水面以来一直位居使用量榜首的匿名模型,如今已成为一个已发布、可自行部署的模型:MIT许可证,总参数320B,每个token激活18B,1,048,576个token的上下文窗口,以及其在列表页上宣传的文本/图像/视频输入能力,权重已上线Hugging Face。此次揭晓也解答了匿名一周中最大的谜题——一个无人拥有的模型如何每天处理100万亿个token:Z.AI表示,该服务完全运行在大约10万块国产AI芯片上,这是中国芯片首次承载前沿级别的全球流量。这一算力规模也催生了本周最流行的错误猜测——在那种规模下,许多观察者在谷歌DeepMind研究人员的隐晦帖文鼓动下,认为Ox Alpha必然是运行在NVIDIA硬件上的Gemini;此次揭晓也纠正了这一点。同一天晚上,阿里巴巴发布了Qwen3.8-Flash-Next,这是其Qwen4架构的开放权重预览版——一个晚上,中国实验室就推出了两款前沿级别的开放权重模型。Ox Alpha之前的四个匿名发布最终全部被中国实验室认领:智谱AI的GLM-5、小米的MiMo-V2-Pro、蚂蚁集团的Lingxi Ling-2.6-flash,以及美团的LongCat-2.0。Ox Alpha不再是一个平台专属的实验;它是一个开发者可以自行部署的模型。
本文中的每一个数字均为运营方自行声称、平台自有列表数据、公开公告或社区指纹识别的结果。DeepSWE 数据来自独立研究员 Ben Davis 的社区测量——一次完整的 113 项任务运行,并非官方排行榜条目,不过约 63% 的数字如今与 Z.AI 自家厂商报告的 DeepSWE v1.1 得分 63.4 高度吻合。身份问题已经尘埃落定:8 月 26 日,Z.AI 以 GLM-5.3-Flash 之名发布了开放权重模型 Ox Alpha——MIT 许可证,总参数 3200 亿,激活参数 180 亿——证实了 tokenizer 和视频编码器取证分析所汇聚出的子名称。架构、参数数量和定价现已由公司公布;仍属厂商陈述而非独立验证的,是基准测试套件以及 Z.AI 关于匿名周推理服务运行在约 10 万颗国产 AI 芯片上、每 token 成本与主流 NVIDIA 硬件相当的说法——这是多家媒体已反复转述的公司声明,而非经审计的数字。早期的 Gemini 假说——由每天 100 万亿 token 的处理能力催生、并受到 Google DeepMind 研究人员隐晦发帖的助推——是错误的,这次发布已为其画上句号。归因于分析师 teortaxesTex 的质量评级——以及他关于进一步训练的 Ox Alpha 可能成为更强 GLM 5.5 主力的建议——是该分析师基于社交帖子做出的个人评估,既非独立测量,也非智谱的官方表态。下文描述的循环动画演示同样属于社区报告——一位开发者在 X 上的发帖,并在国内开发者论坛上得到呼应——而非厂商能力声明,运营方也未宣布任何此类功能。
我们所知道的——以及我们所不知道的
快速版本:
• 该运营方将 Ox Alpha 描述为"一个专为高效编码、持续智能体工作和真实生产环境使用而构建的前沿模型"——这是一款推理模型,面向长周期软件工程以及融合文本与视觉上下文的工作流。
它拥有1,048,576个token(1M)的上下文窗口,131,072个token的输出限制,并支持文本、图像和视频输入——这是历次匿名发布中首个宣称支持视频输入的版本,而GLM-5.3-Flash发布版也证实了这一能力为原生支持,而非后期附加。
• 第一周免费:输入和输出均为每百万 tokens 0 美元,运营商声称“慷慨的速率限制、近乎无限的使用量”,并宣称每日可提供 100 万亿 tokens 的服务容量——该发布后来透露,这一容量是基于大约 10 万颗国产中国芯片配置的。
• 已确认:8月26日,Z.AI以开放权重模型形式发布了Ox Alpha,命名为GLM-5.3-Flash——采用MIT许可证,总参数320B,激活参数18B——这与子名称分词器、视频编码器、错误代码取证以及预测市场所汇聚指向的完全一致。独立分析师teortaxesTex对其评级约为GLM-5.3的水平(视觉方面除外),并推测进一步训练后的Ox Alpha可能成为更强大的GLM 5.5背后的主力模型。
• 闪速多模态阅读现在有了演示支撑:当被要求生成一段循环动画——一只鹈鹕骑着自行车,并打开一部播放着同样动画的手机——Ox Alpha 给出了一个自包含的循环动画,作为单个 HTML/SVG 文件。这是一个社区演示,而非厂商声明。
• 平台上的早期活动数据已经显示出真实的生产流量,包括来自Nous Research的编码代理以及Zed编辑器。
• 该公司如今已将其正式发布——8月26日,Z.AI 以 MIT 许可证将 Ox Alpha 作为开放权重的 GLM-5.3-Flash 发布,一举终结了有关身份、规格和价格的疑问:总参数 320B、激活参数 18B、原生多模态,Z.AI 标价为每百万 token 输入 $0.15 / 输出 $0.50,并称 50% 的发布促销仅持续至 9 月 9 日——而该日期现已过去八天,仍在执行的仍是折扣价。Z.AI 还披露,匿名周期间每天 100T token 的服务运行在大约 10 万枚中国国产芯片上,这在该规模上尚属首次。此次揭晓未包含的是独立基准测试——该模型的评分卡由厂商自行报告——因此最具代表性的独立数字仍是 Ben Davis 完整的 113 项任务 DeepSWE 运行,约为 63%,与 GPT-5.6 Sol mid 相当。
Ox Alpha 是什么
该平台的介绍将 Ox Alpha 描述为“专为编码、持续智能体工作和生产工作负载而设计的推理模型——涵盖长周期软件工程、复杂推理以及将文本与视觉上下文相结合的工作流程。”这是一个明确的定位:它专为长时间运行的智能体循环和代码而构建,而非用于通用对话。100万上下文就是明证——这足以容纳长达数小时的智能体会话或大型代码库——而131K的输出上限则允许进行长篇幅的单次生成。它还支持工具和函数调用以及结构化JSON输出,这满足了智能体功能清单的其余要求。

视频输入是规格表上最独特的一项。早期匿名模型都没有宣传这一功能,而一个既能处理文本和图像、又能接收视频帧的模型,与之前那些针对聊天调优的版本相比,面向的是不同类型的工作负载。正如后来的取证分析所示,它也是模型所能携带的最强身份标识之一。所有这一切——描述、规格、速度数字——都来自运营商和平台的列表。GLM-5.3-Flash 版本确认了主要规格(320B-A18B,原生多模态);速度和容量数字仍为厂商声称。
多模态的故事本周有了一个具体的演示。开发者 Chetaslua——其服务端探针是指纹识别追踪轨迹的一部分——发布了一项测试,他要求 Ox Alpha 制作一个循环动画:一只鹈鹕骑着自行车,然后打开一部手机,手机里播放着同样的动画——这是循环之中的自指循环。他的报告显示,该模型生成了一个单文件 HTML/SVG 动画——鹈鹕的两段式腿部真正在蹬踏板,车轮速度与地面速度同步,带有视差背景,以及循环中手机的最终呈现。中文开发者论坛也分别用各自的鹈鹕自行车提示词进行了测试并讨论了结果,因此这个演示并非孤立的、无法验证的说法。由于输出是代码,这符合该平台仅输出文本的规范:多模态理解与创造性代码生成协同工作,而非原生视频合成。Chetaslua 的结论——这是多模态的回报,而且一个强大的开源模型将随之而来——是他个人的预测,而非厂商声明;运营方尚未宣布任何消息。
为期一周的免费优惠
这次推广攻势很猛。在运行的那一周免费,宣称“慷慨的速率限制,近乎无限制的使用”,并称每天有100万亿token的处理能力,运营者还附言邀请用户“看看你能做什么”。按字面理解,每天100T token将把该运营者置于全球最大推理服务提供商之列——这个说法读起来不太像规格说明,更像是一道压力测试挑战,而这正符合某种模式:匿名发布是实验室在不挂名的情况下获得前沿规模真实流量的方式。这一确认的解读让规模声明变得具体,而不只是更容易说得通:Z.AI披露,每天100T token的服务运行在大约10万块国产AI芯片上——这是前沿级发布首次在无NVIDIA硬件的条件下以如此规模提供服务。该披露仍是公司单方面的说法,现已被多家媒体转载,但未经独立审计,而且它还附带第二个较为委婉的供应商说法:Z.AI称,国产集群上的单token成本与主流NVIDIA GPU相当。
“免费一周”的另一面是,随之而来的价格此前并不明确——这次揭晓给出了答案。Z.AI 公布的 GLM-5.3-Flash 标价为每百万输入 token 0.15 美元、每百万输出 token 0.50 美元,每百万缓存输入 0.03 美元。据称上线五折促销持续到 2026 年 9 月 9 日,将价格降至 0.075 美元 / 0.25 美元。该日期过去八天后,实际计费的仍是折扣价:2026 年 9 月 17 日重新查看时,z-ai/glm-5.3-flash 模型页面标出的输入价格为 0.075 美元、输出价格为 0.25 美元、缓存读取为每百万 token 0.0173 美元,且没有任何促销标签。对比 GLM-5.3 的 1.40 美元 / 4.40 美元标价,这大约只是二十分之一。实际后果是,9 月 9 日这个结束日期已经过时,而非仍具约束力——按 0.15 美元 / 0.50 美元做预算的开发者,依据的是一个目前无人被实际收取的数字。定价页面没有解答的是原因。Z.AI 自己的模型列表仍为 GLM-5.3-Flash 标注 0.15 美元 / 0.50 美元,因此促销究竟是延长了、转为永久,还是只是任其继续运行,我们无从查证;折扣价是这一日期观察到的事实,而原因仍悬而未决。
首个完整基准测试——结果与GPT-5.6 Sol mid持平
Ox Alpha 至今在 Artificial Analysis 或 LMArena 等独立追踪平台上仍没有收录记录——"前沿"一词是运营方自己的说法,Z.AI 随 GLM-5.3-Flash 发布时公布的基准数据(DeepSWE v1.1 63.4、AutomationBench 48.8、Artificial Analysis Intelligence Index 57)也均系厂商自报,而非独立得分。自发布以来发生变化的是,社区实测数字开始流传——差距已经收窄。在 Kingbench 上,早期运行将 Ox Alpha 定为 87.5,略低于 GLM-5.3 的 91.25。在 DeepSWE 上,独立研究员 Ben Davis 最初运行了一个 10 任务子集,报告 Pass@1 为 80%,领先于 Claude Fable 5(65%)、GLM-5.3 和 Grok 4.6(62%)以及 GPT-5.6 Sol(52%)。此后,他又对整个 113 任务的 DeepSWE 集完成了完整运行,修正后的结果约为 63%——与 GPT-5.6 Sol mid 大致相当。80% 的子集结果确实夺人眼球,但 10 个任务不到该基准的 9%;Davis 本人也指出,全量数据集的数字才"更有意义"。这些数字是社区实测所得,既非厂商基准,也非官方排行榜得分——但完整运行结果是迄今任何人从该模型中获得的、最具代表性的数据,且与 Z.AI 自己厂商报告的 DeepSWE v1.1 得分 63.4 高度吻合——这是有用的交叉验证,尽管公司的数字是声明,而非实测结果。
有一个对比如今比发布时更为关键。DeepSeek V4 Pro 0813——DeepSeek 旗舰模型的 GA 正式版,于8月13日上线——在 DeepSeek 自家基准卡上报告的 DeepSWE 得分为62.7,而早期版本 DeepSeek V4 Pro Preview 为12.8。截至本文撰写时,这两项数字均为厂商自行报告,尚未经独立实验室复现。与 GLM-5.3-Flash 约63%的社区全量数据集跑分以及 Z.AI 自身 DeepSWE v1.1 的63.4放在一起看,DeepSeek 的62.7使这两个最知名的中国编程智能体成绩同处于60分出头这一区间。曾被视作 Ox Alpha 招牌优势的那个十分差距,其实是对比更便宜的较小模型 DeepSeek V4 Flash 0731 得出的;若与 DeepSeek 的旗舰模型相较,GLM-5.3-Flash 与其实力相当,而非领先十分。
另一个教训是关于数字本身。分析师teortaxesTex——自匿名周以来一直在追踪这些估算——指出,关于Ox Alpha的第一份报告也给出了80%的DeepSWE:那是Davis那个引人注目的10任务子集,而在完整113任务集上的最终结果是63%。鉴于DeepSeek V4 Pro 0813官方成绩62.7也落在同一区间,他的观察是,迄今还没有任何结果接近真正复现的80%——80%这个数字总在模型公开亮相的早期出现,而一旦跑完完整数据集,就总是回落到60出头。这是他的分析师解读,而非实测数据,但它是看待下一个DeepSWE头条的正确视角,包括任何关于GLM-5.3-Flash本身的消息。

同样存在的还有实际使用。平台的活动数据显示,上线头几个小时内就出现了真实的生产流量——包括来自 Nous Research 的智能体编程项目 Hermes Agent,以及 Zed 编辑器。这两者恰恰是这款模型所定位的“持续性智能体工作与编码”用例。这不是一个分数,而是一个信号:拥有真实工作负载的开发者认定,一个免费、前沿级、匿名的赌注值得接入。在完整的 DeepSWE 运行结果落地之前,早期采用是仅有的证据;如今约 63% 的全集数据为模型提供了一个基准锚点,可以与之权衡对照。
数据保留细则
免费周公告标榜“零数据保留”。然而,该模型在平台上的介绍则讲述了一个更有所保留的故事:根据平台的隐身模型条款,提示词和补全内容会被提供商保留,但不会用于训练。如果你正打算将专有代码粘贴进一个由某提供商拥有的100万token上下文窗口,这个区别就至关重要——这家提供商在Z.AI于8月26日站出来之前一直是匿名的。在Z.AI发布明确写明“零数据保留”的条款之前,请将其视为营销话术——并将任何你不想被记录的内容,路由到一个独立的、有明确归属的模型。
匿名模型手册
Ox Alpha 是六个月内的第五个匿名发布,前四个都以同样的方式收场——匿名亮相,一阵免费流量,然后一家公司站出来:
• Pony Alpha(2026年2月)——发布约五天后,智谱AI确认其为GLM-5,即采用744B参数的MoE旗舰模型。
• Hunter Alpha(3月11日)——一款免费的万亿参数模型,拥有1M上下文窗口,成为春季最受猜测的焦点,被广泛认为是DeepSeek V4;最终被揭示为小米的MiMo-V2-Pro,而配套的Healer Alpha则被确认为MiMo-V2-Omni。
• Elephant Alpha(四月)——一款免费、注重效率的文本模型,蚂蚁集团在其出现约两周后宣称其为“灵犀凌-2.6-flash”。
• Owl Alpha(四月下旬)——一款以智能体为核心的模型,具备原生工具调用能力和约 100 万(1M)上下文长度;美团于 6 月 30 日确认其为 LongCat-2.0,这是首个完全在国产芯片上完成训练和服务的万亿参数模型。
• Ox Alpha(8月20日)——8月26日揭晓为GLM-5.3-Flash,一款开放权重、MIT许可的320B-A18B模型;身份、许可和规格在面具摘下的同一天全部正式公开。

为什么要蒙面发布一个好模型?标准的解读——Hunter Alpha 周期已将其具体化——是匿名性消除了评测中的品牌偏见,而在大家争论幕后所有者之际,免费使用以前沿规模众包了真实世界的评测数据。正如对该模式的一项分析所言:“没有品牌本身就是营销。”额外的优势在于速度:匿名模型无需发布会即可在数小时内触达全球开发者受众,而神秘感本身就成了分发渠道。
Ox Alpha是谁?
直到8月26日发布之前,没有公司声称拥有它,智谱AI也没有发表任何言论——但该模型亮相后的48小时内,确凿证据的情况发生了变化,而下面的取证分析解释了为什么这次以GLM-5.3-Flash名义的披露如此不令人意外。容量数据一度不利于取证分析:每天100万亿个token的数据看起来像是顶级实验室在NVIDIA芯片上的标志,而Ox Alpha是新一代Gemini的理论——受Google DeepMind研究人员隐晦帖子的推动——一度势头强劲,直到分词器证据出现,随后Z.AI自己的发布终结了这一理论。最强的信号是分词器。一个社区构建的指纹识别工具modelprint对Ox Alpha运行了九项基础设施探测,发现它在六项上与Z.ai的GLM-5.3匹配,所有四项归一化分词器计数都与GLM家族匹配,而最佳的非GLM候选者只达到了四项中的两项。独立研究员Ben Davis报告称,在25个测试提示中,Ox Alpha的token计数与GLM-5.3完全匹配,仅存在一个恒定的+75 token差异,他将其归因于隐藏的包装器。分词器匹配是最难伪造的身份信号——模型不经过重新训练就无法改变其文本分段方式。
视频路径是第二个特征签名。在四个受控样本中,Ox Alpha 的视频 token 消耗与 GLM-5V-Turbo 完全一致——相同的帧采样、时长缩放和分辨率机制——而 MiMo v2.5、Qwen 3.8 Max 和 GLM-4.6V 均出现偏差。这是一个强有力的线索:视频处理深植于模型内部,而非后期附加功能。指纹堆栈的其余部分也与这一判断吻合:Ox Alpha 像 GLM-5V 一样拒绝音频输入,共享 GLM 特有的“1301”错误代码,输出风格相似(每 1,000 个字符约 1.3 个表情符号),携带与平台在 Ox Alpha 发布前两天出现的 GLM-5.3 列表相同的受限参数和 API 配置,且知识截止日期接近 2025 年 11 月。
这一识别在智谱自己的剧本里有先例:2月匿名发布的Pony Alpha,结果就是GLM-5,上线约五天后被指认。本周流传的分析师解读——Ox Alpha就是GLM-5.3,推测是Flash模型——得到了Pliny the Liberator的回应,他说自己的agent已确认"Ox-alpha来自Zai,GLM-5.X家族"。独立分析师teortaxesTex在质量上做出了同样的判断,并补充了一个时间上的论断:他给Ox Alpha的评级大致相当于GLM-5.3的水平(撇开视觉不谈),而他觉得最引人注目的是这个周转速度——在8月14日发布后的几天内,就把纯文本的GLM-5.3压缩并带着可用的视觉能力推了出来。这是一位分析师的评估,不是独立的评分,他认为这应该让"中国趁热打铁发布模型"的叙事有所停顿。他的最新帖子在这个解读之上又叠加了一层路线图猜测:GLM-5的更新周期可能很短;Ox Alpha与GLM-5.3足够接近,以至于把它当子代理用几乎没什么意义——"不如直接跑ox @4"是他对直接运行该模型的简写;而经过进一步训练的Ox Alpha作为主力模型——用他的话说是一头"驮畜"——来支撑强大得多的GLM 5.5,会非常合理。这是一位分析师对路线图的推测,不是智谱的声明。相比之下,子名称的问题已经尘埃落定:8月26日,Z.AI将Ox Alpha作为GLM-5.3-Flash发布。曾经让Flash标签停留在"推测"一侧的那个波折——GLM-5.3于8月14日以纯文本模型发布,而Ox Alpha宣称支持视频输入——正是这次发布所解决的:GLM-5.3-Flash是一个独立的、原生多模态模型,而不是同一个纯文本模型。其他理论——小米的MiMo团队、DeepSeek——曾被抛出,但在tokenizer和视频证据面前基本被否定,而这次发布直接了结了家族归属问题。Davis认为应该在意Flash标签的理由,最终被证明是出于实际考量:因为Ox Alpha确实就是GLM-5.3-Flash,性能达到GPT-5.6 Sol中等水平,所以它现在可以本地运行——权重已放在Hugging Face上,SGLang、vLLM和TokenSpeed都能提供服务——这把一个中等水平的前沿编程模型变成了一次性的硬件成本,而不是任何愿意托管它的人按token支付的账单。
地缘政治的框架来自分析师,而非证据本身:“这给美国前沿实验室(US Frontier Labs)带来了更大的压力,与中国之间的差距正在缩小。”这是对“一个免费开放的智谱级模型以前沿规模运行”对竞争格局意味着什么的一种解读——而硬件数据的披露,为这种解读提供了分析师们此前不具备的优势。每天在约10万块国产芯片上处理100万亿个token,首次大规模证明了:不依赖英伟达芯片的中国技术栈也能承载前沿推理负载——这正是英伟达CEO黄仁勋今年春天在Dwarkesh播客上警告过的情形。他当时称,出口管制将加速中国构建脱离英伟达的技术栈,而一个在中国国产硬件上运行效果最佳的顶尖模型,对美国而言将是“可怕的结果”。Z.AI宣称的成本持平数字仍是厂商单方面的说法,但事件本身是真实的。同一个晚上,模型侧也具体印证了这一点:在Z.AI发布GLM-5.3-Flash的同时,阿里巴巴推出了Qwen3.8-Flash-Next,这是Qwen4架构的开放权重预览版。一夜之间两款中国前沿级开放权重模型的发布,正是观察人士所称“中国开源的大日子”的具体形态。
你这周应该在此基础上继续推进吗?
免费周已经结束,但测试依然便宜:9 月 17 日实际结算的费率是每百万 token 输入 $0.075 / 输出 $0.25,而非 $0.15 / $0.50 的标价——那个原本声称 9 月 9 日结束的 50% 上线促销,八天后仍在生效。如果你做的是长周期智能体工作、在长上下文上写代码,或是运行视频密集型的流水线,那恰恰就是 Ox Alpha 所卡位的交叉点——而且权重开放,你可以在自己的硬件上跑这项测试,而不必仰赖某个匿名平台的脸色。两点提醒。第一,"前沿"这个标签仍只是一个说法:GLM-5.3-Flash 的成绩单是厂商自报的,而唯一扎实的独立数字——Davis 约 63% 的 DeepSWE 跑分——虽然很强,但距离早期 10 题子集上疯传的 80% 还差得很远。第二,$0 的价格是有时限的,而这次揭晓也给出了之后的价格——就能力而言算便宜,但不再免费。开放权重的发布所消除的是依赖:文件已经放出,所以模型可以自托管,而不必租用。那是一次测试的形态,而非依赖。
以生产安全的方式做这类测试,靠的是一条回退链:实验模型在健康时负责应答,一旦它卡住、报错或消失,请求就会立刻转到经过验证的模型上。这正是路由层存在的意义。这次披露让回退选择变得毫无悬念:Ox Alpha 就是 GLM-5.3-Flash,而该模型本身已以真实名称上线 OrcaRouter,价格为每百万 token 输入 $0.075 / 输出 $0.25,缓存读取 $0.0173 —— 这是号称将于 9 月 9 日结束的五折首发价,而截至 9 月 17 日,页面上显示的仍是这个价格,而非 $0.15 / $0.50 的标价。它零加价透传,一个 API 覆盖 200+ 模型,并具备自动故障转移,让发布周的流量高峰不会变成你的服务中断。把新模型放在前面试演,链中它身后配一个经过验证的回退;当价格变化时,你在 OrcaRouter 上看到的数字,就是你当天支付的数字。或者干脆完全跳过 API —— 权重是开放的,所以在同一条链身后自托管 GLM-5.3-Flash 也在选项之中。
看什么
还有六件事将揭示接下来的故事。独立基准测试:GLM-5.3-Flash 的成绩单是厂商自报的,Davis 约 63% 的 DeepSWE 运行成绩是迄今为止唯一可靠的独立数字,DeepSeek V4 Pro 0813 的官方 62.7 现在也处在同一区间,而 Artificial Analysis 或 LMArena 上的条目——或一场独立的正面对决——将是最终检验“前沿”究竟是事实还是口号。价格走势:就目前的证据来看,稳态问题已有答案——50% 的促销据称于 9 月 9 日结束,但到了 9 月 17 日,实际提供的仍是折扣后的 $0.075 / $0.25 费率,因此应该按促销价而非 $0.15 / $0.50 的标价来做预算;仍未解的是原因,因为 Z.AI 自己的标价并未变动。硬件声明:Z.AI 称,匿名周运行在约 10 万枚国产芯片上,成本与 NVIDIA 持平——对此的首次大规模公开检验,就是这一说法能否经得起独立审视,以及国产技术栈是否会成为 GLM 系列的默认选择。采用情况的计算:Ox Alpha 在匿名面具下吸引的登顶平台流量,如今它有了名字、许可证和价格,这些流量是否会转化为自托管和 API 部署。后续篇:GLM-5.3-Flash 是否把 Ox Alpha 当作垫脚石——teortaxesTex 的暗示是,进一步训练的版本会成为强大得多的 GLM 5.5 的主力,这将使本次发布成为下一代 GLM 的基础。以及反应:随着 Qwen3.8-Flash-Next 在同一晚落地,背后还有国产芯片的披露,压力落到美国前沿实验室——以及出口管制辩论——身上,要求它们作出回应;留意是否会有快速跟进、价格动作或政策回应落在差距的另一边。
诚实的结论是:Ox Alpha 在两个方向上都是一次异常廉价的实验。该平台测试了一个定价为 $0 的匿名前沿级模型能否在一周内赢得真实生产流量——它做到了,而且有足够说服力,以至于 Z.AI 不仅在第六天站了出来,还在当晚就以开放模型的形式发布了权重。现在,你可以测试这个模型是否值得在你的技术栈中占有一席之地,而且不必再承担匿名风险:GLM-5.3-Flash 是一个具名、采用 MIT 许可、可自托管且价格已公布的模型,硬件问题也有了答案——Z.AI 表示,每天 100T token 的推理服务运行在大约 100,000 枚中国国产芯片上,这虽为公司自述,但如今已被广泛报道。仍有待了解的是,“前沿”能否经得起独立测量,Z.AI 的国产芯片成本持平主张能否在大规模下站得住脚,为什么在声称的 9 月 9 日截止日期过去八天后,50% 的发布促销仍是当前提供的价格,以及这次揭晓是否如 teortaxesTex 所暗示的那样,把 GLM-5.3-Flash 定位为更强 GLM 5.5 的主力。运行这个实验,但要在其下配备一个后备方案。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
