
Union Alpha vs GLM-5.3-Flash:免费,直到有人认领为止
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
这两个模型中,只有一个能被从你手中夺走。Union Alpha是一个无人认领的隐秘上架条目,于2026年9月16日出现,并于2026年9月17日变为可路由。它不花任何费用,也不属于任何会承认它的人。GLM-5.3-Flash的价格是每百万输入 token 0.075 美元、每百万输出 token 0.25 美元,而 Z.ai 于2026年8月26日根据 MIT 许可证发布了其权重——这意味着如果 API 哪天变得更差、更贵或消失,你可以下载它并自行提供服务。这场对比中的其他一切都相差无几。但那一处差异并非如此,而这就是为什么“今天该调用哪一个”的答案会干净利落地一分为二。
这种对应并非随意巧合。GLM-5.3-Flash 生命中的头六天,所处的条件与 Union Alpha 如今面临的完全一致:一个名为 Ox Alpha 的匿名条目,提供方一栏写着 “Stealth”,没有实验室,没有模型卡,没有权重。Z.ai 在 8 月 26 日现身,匿名条目随之让位于一个公开发布的模型,并公布了定价。一个月后,Union Alpha 在同一平台上重演着同样的剧本,只是对外展示的规模更小——而这一次,没有任何人公布过容量数据,也没有与之相伴的“近乎无限”的承诺。
所以,免费端点并不是付费端点的廉价版本。它是另一种不同的东西,有不同的有效期,而那些存在差异的规格,恰恰能告诉你它是为什么而打造的。
这两份规格表究竟说了什么
下面的两个数字均读取自我们路由层上 2026 年 9 月 17 日的实时模型页面,并辅以供应商自己发布的资料,以补充路由层不公布的部分。
• 上下文窗口——Union Alpha 262,144 个 token(262K)对比 GLM-5.3-Flash 1,048,576 个 token(1M)。只有窗口的四分之一。
• 最大输出 — Union Alpha 131K tokens 对比 GLM-5.3-Flash 128K。实际上持平,也是 stealth 模型名义上领先的唯一一行。
• 输入模态 — Union Alpha 支持文本和图像,而 GLM-5.3-Flash 支持文本、图像和视频。Union Alpha 仅输出文本,GLM-5.3-Flash 也是如此。
• 价格 — Union Alpha 在明确限速的免费层级上为 $0,超出限额的请求会返回 HTTP 429。GLM-5.3-Flash 为每 100 万 token $0.075 输入 / $0.25 输出,缓存读取为 $0.017。
• 推理控制——Union Alpha 未暴露任何推理控制。其接受的参数为 tools、tool_choice、response_format、temperature、top_p 和 max_tokens,这就是完整列表。GLM-5.3-Flash 暴露了一个推理控制,支持 low、high 和 max 三档 effort,默认值为 max。
• 权重——Union Alpha 没有公开的代码仓库、许可证、参数规模或架构说明。GLM-5.3-Flash 是一个 320B 参数的稀疏专家混合模型,每 token 激活约 18B 参数,采用 MIT 许可证,可下载。
• 基准测试 — Union Alpha 的基准测试字段显示为“待定”。GLM-5.3-Flash 已有一套已发布的结果。
• 我们这一层的过去一周流量——Union Alpha 1.2M tokens 对 GLM-5.3-Flash 18,128.8M tokens。这一点要仔细读:GLM-5.3-Flash 已正式开放三周,而 Union Alpha 从 9 月 17 日 05:32 UTC 起才开放,所以这个差距衡量的是生产流量有多少时间落地,而不是两个模型谁更优秀。
往下读那份列表,Union Alpha 的形态是连贯的。一个 262K 窗口、图像输入、无视频、无推理调节旋钮、无权重,这是快速层级或同系列变体的特征,而不是前沿旗舰——这与 GLM-5.3-Flash 在其自身家族中所处的结构位置相同。这是从宣传表面得出的假设,而非发现,并且值得指出竞争性解释:运营方也可以特意裁剪预览版的宣传表面,以阻碍指纹识别。这两种解读目前都还没有证据支持。

延迟表现发生逆转,而有一个数字表现得有些反常
正是在这里,这场较量变得比规格表所暗示的更有趣,也正是在这里,你应该对那个标题数字保持怀疑。
Union Alpha 的页面报告首 token 时间 p50 为 10.00 秒——p95 也是 10.00 秒。百分位数完全相同,正是样本过于单薄的表现:当时间窗口内几乎所有请求都落在同一个桶里时,中位数与尾部便塌缩到了一起。请把那个 10 秒的数字理解为“启动偏慢,确切数值尚无定论”,而不是一个精确的中位数。GLM-5.3-Flash 在同类窗口下测得 p50 为 6.49 秒,p95 为 10.00 秒——一个具有真实跨度的真实分布。
Then there is output speed, and here the sources genuinely disagree. Our routing layer measured 225 tokens per second for Union Alpha over the trailing week. Independent testers calling the endpoint directly on launch day described something much slower — queueing, and waits measured in minutes for trivial prompts. We are not going to pretend those reconcile. The most likely explanation is a rolling window that is mostly off-peak against launch-hour congestion, and the honest position is that Union Alpha's throughput is unsettled until it has been up long enough to measure. GLM-5.3-Flash reports 77.8 tokens per second with a 0.27% error rate, against Union Alpha's 1.1%.
没有争议的是这场交易的方向。GLM-5.3-Flash 更早开始产出,而且产出稳定。Union Alpha 的免费额度在未拥塞时或许响应爆发得更快,而它在你已经把请求发出去之前,不会告诉你自己正处于哪种状态。
免费不是价格——而是一套你尚未读过的条款
“$0,受速率限制,超出限制即 HTTP 429”就是整个定价部分,在Union Alpha 的模型页面上。没有公布速率限制,没有每分钟请求数,没有容量数字,也没有结束日期。隐秘预览没有数据处理协议,没有明示的保留期限,没有司法管辖区,没有 SLA,没有支持途径,也没有通知期,因为没有具名交易对手可被要求遵守其中任何一项。这不是回避它的理由。这是要确切知道自己在拿什么作交换的理由。
这种特定风险并非假设,因为我们亲眼目睹了它的发生。8 月 26 日,当 Ox Alpha 的运营方公开身份时,免费层没能挺过那则公告——匿名条目消失了,GLM-5.3-Flash 的付费定价取而代之。今天指向 Union Alpha 的一条生产路径,其到期日期无人公布。为 404 而构建。
还有第二项更隐蔽的成本:没有推理参数,就意味着无法把思考强度调低。在始终以最大努力进行推理的模型上,每次调用都要以输出 token 的形式为这份思考买单——这在 GLM-5.3-Flash 上是一笔实实在在的开支,而在 Union Alpha 上则从结构上就不可能出现,因为这个旋钮根本不存在。这究竟是一种折扣,还是缺失的一项控制,取决于模型是否需要这份思考;而由于 Union Alpha 尚未公布任何基准测试数据,目前没人能告诉你答案。

What GLM-5.3-Flash's $0.075 actually buys
输入每百万 token 0.075 美元、输出每百万 token 0.25 美元,缓存读取为 0.017 美元,GLM-5.3-Flash 的定价像一款预算级模型,规格却像另一回事:1M token 窗口、视频输入和 MIT 权重。我们自家模型页面上的成本计算器在其默认假设下,将一个有代表性的工作负载估算为启用提示缓存时每月约 1.07 美元,不启用时为 1.28 美元——这种差距只有在规模上来时才有意义,但收集它不花什么成本,因为缓存只是一个标志位,而不是需要重新架构。
定价页面上没有提到的那部分:由于权重采用 MIT 许可且可下载,$0.075/$0.25 是上限,而不是下限。如果 Z.ai 提高 API 价格,或者端点性能下降,又或者你只是已经超出了按量计费推理所能满足的范围,同一个模型都能在你自己硬件上运行,无需任何人的许可。而对 Union Alpha 来说,无论价格如何,这个选项都不存在,这也正是为什么在这次比较中,“免费”和“便宜”并不属于同一个维度。
在 OrcaRouter 上,两个模型共用同一把密钥,它以 0% 的加价路由 200+ 个模型——提供商的标价原样透传。对于这场对比中付费的那一半来说,这一点比免费的那一半更重要:如果 Z.ai 下调或上调 GLM-5.3-Flash 的价格,我们页面上的数字当天就会换成新价格,而且不需要第二份合同、不需要单独的 SDK,也无需为了跟进它而做迁移。并且,由于两者都能通过同一个端点访问,你可以评估 Union Alpha,再回退到 GLM-5.3-Flash,而只需更改一个模型字符串。

基准问题才是诚实的区分因素
Union Alpha 没有基准测试分数。其模型页面的基准字段显示为“待定”,而且在运营方自己的列表之外,没有任何来源给出过可复现的分数。你现在看到的任何关于该模型流传的数字都未经证实——包括那些听起来最令人印象深刻的数字。这并不是在贬低这个模型。这只是发布仅一天后的证据现状,也是目前还不应基于它进行构建的最大原因。
GLM-5.3-Flash's published set is not uniformly vendor-reported, and the distinction changes what you can do with it. Our model page tags every entry with the source it came from, and eight of those entries come from Artificial Analysis rather than from Z.ai: GPQA Diamond 91.2, AA Coding 71.5, AA Intelligence 41.9, SciCode 51.6, Long-Context Recall 80, Humanity's Last Exam 39.9, tau_banking 47.2 and terminalbench_v2_1 84.27. Those are measured by a third party rather than reported by the lab that built the model, which puts them in a different category from everything else on the list.
这一组里剩下的都是 Z.ai 自己的报告:DeepSWE v1.1 63.4、Terminal-Bench 2.1 84.3、AutomationBench v1.0.6 48.8、Agents' Last Exam 26.3、BabyVision 53.4、Chartography 78、CharXiv Reasoning 89.4、带工具的 HLE 55.3、MMVU 80.5、MVBench 77.8、NL2Repo 56.3、OfficeQA Pro 62.4 和 Toolathlon Verified 78.4。我们没有重新运行其中任何一项,而它们是一项背后有方法论支撑的主张——比完全没有主张更强,比你自己掌控的评估框架更弱。把两份清单与 Union Alpha 对照,这种不对称就是全部关键:GLM-5.3-Flash 有第三方测得的分数,而 Union Alpha 一个都没有——不是厂商报告的,不是独立测得的,什么都没有。
实际后果是,你目前无法就质量对这两个模型进行比较。你可以比较它们的价格、上下文、模态、延迟和条款,而决策实际上正是基于这些比较。如果你需要的是质量比较,那么今天的答案是:这种比较并不存在。
Union Alpha 真正胜出的地方
三个地方,而且它们都不小。
第一项是实验成本,而它恰好为零。如果你想知道一个 262K 窗口的模型如何处理你的代码仓库、你的提示词形态或你的工具 schema,Union Alpha 今天就会免费告诉你,无需绑定银行卡。而在 GLM-5.3-Flash 上,同样的探索是按量计费的——便宜,但并非免费,并且会在数百次失败的 agent 运行中积少成多。
第二个是输出上限。Union Alpha 的 131K token 最大输出名义上大于 GLM-5.3-Flash 的 128K,而对于长篇幅的单次生成——一个完整文件、一份很长的结构化文档、一段必须在一轮内完成的智能体转录——正是这一项决定了你是否会遭遇截断。
The third is the absence of a reasoning tax. If your workload is high-volume, low-difficulty and latency-tolerant, a model with no deliberation knob cannot bill you for deliberation. It also cannot be tuned, which is the trade.
GLM-5.3-Flash获胜之处,而这是其余的大部分情况
四倍的上下文窗口,这正是能否装下一个中型代码库与装下一个大型代码库之间的差别。视频输入,而 Union Alpha 完全没有这个能力。一个可以调低的推理控制,它既是质量杠杆,也是成本杠杆。你可以自行持有的模型权重,这会把与供应商的关系变成一项资产。公开的基准测试,其中八项由独立于供应商的第三方测量。6.49 秒的中位启动时间,对比固定不变的 10 秒。以及一个可识别的交易对手方,拥有许可证、司法管辖区和支持路径——正是这个不起眼的东西,把原型变成了系统。
如何在不押注任何一方的情况下两者兼得
这里可能犯的错误,是把这种选择当成非此即彼。事实并非如此,而现有的工具让放弃这种看法变得代价很低。
把你的评估流量指向 Union Alpha,因为它是免费的,而且可能会证明非常出色。把 GLM-5.3-Flash 放在它后面作为回退,因为它便宜、规格明确,而且不会从你这里被撤走。然后让切换成为一项配置,而不是一次重写。这正是路由 DSL 的用途——把多个模型组合在一个端点背后,这样请求可以先尝试未经证实的那一个,并在它限流、返回 429 或不再存在时落到经过证实的那一个上。跨提供商的自动故障转移无需你编写重试逻辑就能完成同样的事情,而且正是这一机制让匿名端点可以安全地评估:你并不是在承诺某个模型,而是在承诺一个套接字。
Union Alpha 暗中就是 GLM-5.3-Flash 吗?
几乎可以肯定不是同一个模型,而原因就在规格表上。Union Alpha 的上下文长度只有 GLM-5.3-Flash 的四分之一,没有视频输入,也没有推理参数。如果它真是 GLM-5.3-Flash,就不会以删掉这三项功能的样子出现。一个同系列、定位更低的模型,反而更符合所宣传的情况——但没有人公布过指纹,“Union”这个名字打破了此前一年里一直沿用的动物代号命名惯例,而且两种说法都没有证据。本周你读到的任何言之凿凿的归属判断,包括言之凿凿的否认,都当作猜测就好。
Union Alpha 的预览结束后会发生什么?
先例是这篇文章里最有用的东西。Ox Alpha 于 8 月 20 日出现,8 月 26 日被公开,而它的免费层级没能撑过这次公开。从头到尾,六天。如果 Union Alpha 沿着同样的轨迹走,免费窗口就只有几天,而最可能的结果是:具名厂商、价格、公开权重,或者条目干脆消失。这四种情况中的任何一种都会改变你能用它做什么。它们没有一个是提前宣布的。
把你在意的工作交给 Union Alpha 安全吗?
只有当你能接受把那些工作交给一个匿名运营方——没有明示的数据保留政策、没有司法管辖归属、也没有任何协议——时才这么做。模型页面明确写道,在模型评估期间不会披露提供方,且能力和可用性可能在不另行通知的情况下发生变化——这是一条合理的提示,而非危险信号。合理的界限是你可以承受丢失的代码和数据:公开代码仓库、合成的测试数据、用完即弃的分支。客户数据、凭据以及任何受合规义务约束的内容,都应留在这一对比中有偿、可追溯的那一侧。
今天该给谁打电话
如果你想弄清楚一个 262K 窗口、具备图像能力的模型对你到底有没有用,现在就调用 Union Alpha,一分钱都不用付。把它放在兜底方案后面用,做好迟早会撞上 429 的准备,默认免费额度会在毫无通知的情况下消失,而且别让任何你输不起的东西碰它。这确实是一笔很划算的买卖,而它何时到期,没有任何人公布过时间表。
如果你需要一个可以放心投入的模型——100 万上下文、视频、可调的推理强度、公开的评分、MIT 许可证,以及让价格成为上限而非下限的权重——那就是 GLM-5.3-Flash,而且 $0.075/$0.25、缓存读取 $0.017,这样的投入并不昂贵。基准测试有一半是宣称而非实测,但另一半是由 Z.ai 以外的人测出来的,剩下的你可以花几美分、用自己的工作负载去验证。
这篇文章里真正值得带走的不对称,不是免费与付费之别,而是这两个模型中,一个是测试,另一个是购买。Union Alpha 在被某人认领之前是免费的。GLM-5.3-Flash 你可以留着。
