
Union Alpha 与 Gemini 3.8 Flash:一个有分数,另一个只有说法
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha 和 Gemini 3.8 Flash 是同一套宣传说辞,却以两种截然不同的证据水平呈现。Union Alpha 的运营方将其描述为“在广泛的通用任务上具备前沿级性能”,却没有公布任何基准测试、参数量、许可证或名称。Gemini 3.8 Flash 发布时则附带了带日期的评估表、Artificial Analysis Intelligence Index、独立测试者给出的每任务成本数据,以及一份有记录、延续到 2027 年的价格表。如果你在两者之间做选择时考虑的不只是价格,那你就是在“一个你能核实的数字”和“一句你无法核实的话”之间做选择。
并肩而立,在争吵之前
• 上下文窗口 — Union Alpha 262,144 个 token,对比 Gemini 3.8 Flash 的 1,048,576 个 token。
• 最大输出 — 131,072 个 token 对 65,536 个 token。Union Alpha 在这一项上胜出,而这也是它唯一胜出的结构性维度。
• 输入 — 两者均支持文本和图像,但 Gemini 3.8 Flash 还额外接受视频、音频和文件。
• 定价 — Union Alpha 在预览期间为 $0,而 Gemini 3.8 Flash 为输入 $0.75/百万、输出 $3.75/百万、缓存输入 $0.075/百万,并将于 2027 年 1 月 1 日翻倍至 $1.50/$7.50。
• 推理控制——Union Alpha 上未提供任何此类控制,而 Gemini 3.8 Flash 上的思考层级则会直接影响质量与成本。
• 已发布的评估 —— 来自 Union Alpha 运营方的:无;相比之下,Gemini 3.8 Flash 上有一份完整的、标注日期的表格。
• 来源 — 匿名操作方,无权重,对比 Gemini 3.8 Flash 有明确日期的发布与有文档记录的传承。

Gemini 3.8 Flash 的数字究竟说明了什么
Gemini 3.8 Flash 于 2026 年 9 月 2 日发布——这是 Google 在大约六周内的第三次 Flash 发布,由此也能看出,这个模型的故事里有多少成分是发布节奏,而非技术突破。公布的那份评测表格把数据分别归功于 artificialanalysis.ai 和 deepmind.google,所以不妨把它读作独立数据与厂商数据的混合,而不是一份干净的第三方审计。
• AA Coding — 76.3,这是一个真正强劲的编程评分。
• AA Intelligence — 41.2。请注意,Artificial Analysis 在高推理强度下对 Intelligence Index 单独给出的报告值为 59,因此该数字会随推理强度设置大幅变化;引用时必须一并说明该设置,否则这个数字毫无意义。
• GPQA Diamond — 95.3,是本次比较中遥遥领先的最高单项数值。
• HLE-Verified — 54.9,而普通版 Humanity's Last Exam 为 47.8。
• Terminal-Bench 2.1 — 在 Google 自己的榜单上得分为 89.4,略微领先于 Claude Opus 5 的 89.1。
• 长上下文召回 — 81.3;SciCode 56.6;tau_banking 44.9。
• 观测到的吞吐量——在最近 7 天窗口内,达到每秒 323 个输出词元,错误率为 0.63%,首个词元延迟中位数为 3.46 秒,实测流量为 4.985 亿个词元。
弱点与优势一样有详细记录。在 Terminal-Bench 4.0 上,它得分 19.1,而 Claude Opus 5 为 51.8。在 OSWorld 2.0 上,它取得 59.0%,而对比为 75.4%。在 GDPVal-AA v2 上,它以 1545 Elo 落后于 1824。Gemini 3.8 Flash 在特定一类工作上表现出色,但在最难的通用智能体评测上则断崖式下跌——而这正是公开表格能让你看到的那种形态。
令人措手不及的定价套路
谷歌未调整每 token 的价格,与 Gemini 3.7 Flash 保持一致。账单却还是涨了。
模型更费力:推理步骤更多,迭代式工具调用也更多。Artificial Analysis 的独立测试测得,与 3.7 Flash 相比,每项任务的输出 token 数大约多 30%,每项任务成本约高 40%。在高推理档位下,每项任务成本约为 $0.58;中等档位约为 $0.41,低档位约为 $0.24。
对于任何做预算的人来说,这是对比中最有用的一点,而且它远不止适用于这两个模型:单价和每次任务成本是两个不同的数字,而其中只有一个会出现在定价页面上。Google 一直将 3.7 Flash 保留为更便宜的选择,这无异于默认承认了这一转变。
Union Alpha 反而提供的是什么
Union Alpha 于 2026 年 9 月 16 日出现在第三方模型目录中,并运行于OrcaRouter 的免费层级。它是匿名的——没有实验室、没有权重、没有许可证、没有知识截止日期——并在明确说明的约一周窗口期内免费开放,有速率限制,且未公布预览期之后的价格。
它的端点可验证,即使其来源不可验证:262,144 token 上下文,131,072 token 最大输出,文本和图像输入且仅文本输出,工具调用和 JSON 输出,temperature、top_p、max_tokens,以及没有任何形式的推理控制。工具选择实际上仅支持 "auto"。
恰好只有一项独立测量。SMF Clearinghouse 在关闭推理的情况下运行了 157 项 Official A 测试,得分为 136/157——86.6%,零错误,在 26 个中排名第 10。推理为满分 30/30,工具 2/2,编程 26/30,数学 24/30。写作得分为 2/5。
那并不是一个糟糕的结果。它只是压根不具备可比性。Official A 是一套涵盖 157 项测试的广泛通用套件;AA Coding 和 GPQA Diamond 则是不同的工具,在不同难度下衡量不同的东西。把 136/157 和 GPQA Diamond 上的 95.3 并列在一起,然后宣布谁赢了,恰恰就是那种让厂商数字变得毫无用处的粉饰。


没人能真正完成的成本比较
这是一个已演算的示例,而且它故意不完整。
拿一个你每月要运行一千次的任务。在 Gemini 3.8 Flash 的高推理模式下,公布的每任务约 0.58 美元的数字意味着每月大约 580 美元。这是一个基于实测 token 消耗量得出的真实、站得住脚的数字。
在 Union Alpha 上,同样的一千个任务今天花费为 0 美元。三周后它们的成本是多少尚不可知,因为不存在预览期之后的价格。它们在可靠性上的代价也同样未知,因为该模型受到速率限制,运行在单一端点上,没有备用提供商,并且一旦你超过一个无人公布过的上限,就会以 HTTP 429 响应。
所以,诚实的答案是:Union Alpha 赢得了唯一可用的成本比较,却失去了对它进行预测的能力。对于一次性的比拼,这没问题。对于预算条目来说,它不是一个数字——而是一个带着 URL 的希望。
每个所属的地方
凡是你需要一个可衡量的性能下限的地方,Gemini 3.8 Flash 都适用:带视频或音频输入的长上下文文档工作;AA Coding 得分 76.3 才是相关标尺的编程任务;以及任何附带预算的工作负载,因为你可以在投入前计算成本,并且知道它会在 2027 年 1 月 1 日翻倍。
Union Alpha 属于探索性位置——试用一款支持视觉的 256K 模型,其输出上限是 Gemini 的两倍,用于那些端点消失也不会让你有任何损失的工作。
把它们放在一个端点后面,而不是做成两个集成,原因是这种比较会反复改变形态。路由 DSL 让你能把两者组合成一次调用——把 Gemini 3.8 Flash 作为受测路径,把 Union Alpha 作为实验分支——而不是硬编码一个你之后会想重新审视的决定,比如当免费窗口关闭时,或者当 Google 的优惠定价到期时。这两个日期都不远了,而它们都会改变这笔账。
什么能解决这个问题
Union Alpha 在同样收录 Gemini 3.8 Flash 的排行榜上有一条带日期的记录。这就是缺失的全部。在那之前,站得住脚的说法不是“Union Alpha 和 Gemini 3.8 Flash 一样好”——而是“Union Alpha 免费一周,而且没有人拿它与 Google 发布的任何东西做过对比”。这两句话截然不同,而目前只有一句是真的。
这对组合中经过实测的那一半记录在此:Gemini 3.8 Flash 模型页面载有 $0.75/$3.75 的费率、90% 的缓存输入折扣,以及决定长篇报告工作的 65,536 token 输出上限。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
