生成的标题卡,标题为“Union Alpha vs Gemini 3.8 Flash”,副标题为“一个有分数,另一个有说法”,位于三张圆角卡片上方,卡片上分别写着:“Gemini 3.8 Flash:标注日期的评估表、已公布价格”、“Union Alpha:其运营方未提供基准测试”以及“最大输出:131,072 对比 65,536 个 token”。页脚写着 Union Alpha 的数据未经审计,Gemini 的数据则依据 Google 和 Artificial Analysis。
Guides & Insights

Union Alpha 与 Gemini 3.8 Flash:一个有分数,另一个只有说法

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Union Alpha 和 Gemini 3.8 Flash 是同一套宣传说辞,却以两种截然不同的证据水平呈现。Union Alpha 的运营方将其描述为“在广泛的通用任务上具备前沿级性能”,却没有公布任何基准测试、参数量、许可证或名称。Gemini 3.8 Flash 发布时则附带了带日期的评估表、Artificial Analysis Intelligence Index、独立测试者给出的每任务成本数据,以及一份有记录、延续到 2027 年的价格表。如果你在两者之间做选择时考虑的不只是价格,那你就是在“一个你能核实的数字”和“一句你无法核实的话”之间做选择。

并肩而立,在争吵之前

• 上下文窗口 — Union Alpha 262,144 个 token,对比 Gemini 3.8 Flash 的 1,048,576 个 token。

• 最大输出 — 131,072 个 token 对 65,536 个 token。Union Alpha 在这一项上胜出,而这也是它唯一胜出的结构性维度。

• 输入 — 两者均支持文本和图像,但 Gemini 3.8 Flash 还额外接受视频、音频和文件。

• 定价 — Union Alpha 在预览期间为 $0,而 Gemini 3.8 Flash 为输入 $0.75/百万、输出 $3.75/百万、缓存输入 $0.075/百万,并将于 2027 年 1 月 1 日翻倍至 $1.50/$7.50。

• 推理控制——Union Alpha 上未提供任何此类控制,而 Gemini 3.8 Flash 上的思考层级则会直接影响质量与成本。

• 已发布的评估 —— 来自 Union Alpha 运营方的:无;相比之下,Gemini 3.8 Flash 上有一份完整的、标注日期的表格。

• 来源 — 匿名操作方,无权重,对比 Gemini 3.8 Flash 有明确日期的发布与有文档记录的传承。

Generated two-column comparison scoreboard for Union Alpha and Gemini 3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published evals from its operator, 10.00 s p50 time to first token. Gemini 3.8 Flash column: context window 1,048,576 tokens, max output 65,536 tokens, text, image, video and audio input, $0.75 input and $3.75 output per 1M tokens, a full dated evaluator table, 3.46 s p50 time to first token. Footer reads latency per OrcaRouter over the last 7 days with Union Alpha benchmarks unaudited.

Gemini 3.8 Flash 的数字究竟说明了什么

Gemini 3.8 Flash 于 2026 年 9 月 2 日发布——这是 Google 在大约六周内的第三次 Flash 发布,由此也能看出,这个模型的故事里有多少成分是发布节奏,而非技术突破。公布的那份评测表格把数据分别归功于 artificialanalysis.ai 和 deepmind.google,所以不妨把它读作独立数据与厂商数据的混合,而不是一份干净的第三方审计。

• AA Coding — 76.3,这是一个真正强劲的编程评分。

• AA Intelligence — 41.2。请注意,Artificial Analysis 在高推理强度下对 Intelligence Index 单独给出的报告值为 59,因此该数字会随推理强度设置大幅变化;引用时必须一并说明该设置,否则这个数字毫无意义。

• GPQA Diamond — 95.3,是本次比较中遥遥领先的最高单项数值。

• HLE-Verified — 54.9,而普通版 Humanity's Last Exam 为 47.8。

• Terminal-Bench 2.1 — 在 Google 自己的榜单上得分为 89.4,略微领先于 Claude Opus 5 的 89.1。

• 长上下文召回 — 81.3;SciCode 56.6;tau_banking 44.9。

• 观测到的吞吐量——在最近 7 天窗口内,达到每秒 323 个输出词元,错误率为 0.63%,首个词元延迟中位数为 3.46 秒,实测流量为 4.985 亿个词元。

弱点与优势一样有详细记录。在 Terminal-Bench 4.0 上,它得分 19.1,而 Claude Opus 5 为 51.8。在 OSWorld 2.0 上,它取得 59.0%,而对比为 75.4%。在 GDPVal-AA v2 上,它以 1545 Elo 落后于 1824。Gemini 3.8 Flash 在特定一类工作上表现出色,但在最难的通用智能体评测上则断崖式下跌——而这正是公开表格能让你看到的那种形态。

令人措手不及的定价套路

谷歌未调整每 token 的价格,与 Gemini 3.7 Flash 保持一致。账单却还是涨了。

模型更费力:推理步骤更多,迭代式工具调用也更多。Artificial Analysis 的独立测试测得,与 3.7 Flash 相比,每项任务的输出 token 数大约多 30%,每项任务成本约高 40%。在高推理档位下,每项任务成本约为 $0.58;中等档位约为 $0.41,低档位约为 $0.24。

对于任何做预算的人来说,这是对比中最有用的一点,而且它远不止适用于这两个模型:单价和每次任务成本是两个不同的数字,而其中只有一个会出现在定价页面上。Google 一直将 3.7 Flash 保留为更便宜的选择,这无异于默认承认了这一转变。

Union Alpha 反而提供的是什么

Union Alpha 于 2026 年 9 月 16 日出现在第三方模型目录中,并运行于OrcaRouter 的免费层级。它是匿名的——没有实验室、没有权重、没有许可证、没有知识截止日期——并在明确说明的约一周窗口期内免费开放,有速率限制,且未公布预览期之后的价格。

它的端点可验证,即使其来源不可验证:262,144 token 上下文,131,072 token 最大输出,文本和图像输入且仅文本输出,工具调用和 JSON 输出,temperature、top_p、max_tokens,以及没有任何形式的推理控制。工具选择实际上仅支持 "auto"。

恰好只有一项独立测量。SMF Clearinghouse 在关闭推理的情况下运行了 157 项 Official A 测试,得分为 136/157——86.6%,零错误,在 26 个中排名第 10。推理为满分 30/30,工具 2/2,编程 26/30,数学 24/30。写作得分为 2/5。

那并不是一个糟糕的结果。它只是压根不具备可比性。Official A 是一套涵盖 157 项测试的广泛通用套件;AA Coding 和 GPQA Diamond 则是不同的工具,在不同难度下衡量不同的东西。把 136/157 和 GPQA Diamond 上的 95.3 并列在一起,然后宣布谁赢了,恰恰就是那种让厂商数字变得毫无用处的粉饰。

The OrcaRouter model page for Gemini 3.8 Flash, showing a 1M-token context window, a 65K max output, text plus image, video, file and audio input, $0.75 per million input tokens and $3.75 per million output tokens, a p50 time to first token of 3.46 s, and 498.5M tokens of traffic over seven days.The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

没人能真正完成的成本比较

这是一个已演算的示例,而且它故意不完整。

拿一个你每月要运行一千次的任务。在 Gemini 3.8 Flash 的高推理模式下,公布的每任务约 0.58 美元的数字意味着每月大约 580 美元。这是一个基于实测 token 消耗量得出的真实、站得住脚的数字。

在 Union Alpha 上,同样的一千个任务今天花费为 0 美元。三周后它们的成本是多少尚不可知,因为不存在预览期之后的价格。它们在可靠性上的代价也同样未知,因为该模型受到速率限制,运行在单一端点上,没有备用提供商,并且一旦你超过一个无人公布过的上限,就会以 HTTP 429 响应。

所以,诚实的答案是:Union Alpha 赢得了唯一可用的成本比较,却失去了对它进行预测的能力。对于一次性的比拼,这没问题。对于预算条目来说,它不是一个数字——而是一个带着 URL 的希望。

每个所属的地方

凡是你需要一个可衡量的性能下限的地方,Gemini 3.8 Flash 都适用:带视频或音频输入的长上下文文档工作;AA Coding 得分 76.3 才是相关标尺的编程任务;以及任何附带预算的工作负载,因为你可以在投入前计算成本,并且知道它会在 2027 年 1 月 1 日翻倍。

Union Alpha 属于探索性位置——试用一款支持视觉的 256K 模型,其输出上限是 Gemini 的两倍,用于那些端点消失也不会让你有任何损失的工作。

把它们放在一个端点后面,而不是做成两个集成,原因是这种比较会反复改变形态。路由 DSL 让你能把两者组合成一次调用——把 Gemini 3.8 Flash 作为受测路径,把 Union Alpha 作为实验分支——而不是硬编码一个你之后会想重新审视的决定,比如当免费窗口关闭时,或者当 Google 的优惠定价到期时。这两个日期都不远了,而它们都会改变这笔账。

什么能解决这个问题

Union Alpha 在同样收录 Gemini 3.8 Flash 的排行榜上有一条带日期的记录。这就是缺失的全部。在那之前,站得住脚的说法不是“Union Alpha 和 Gemini 3.8 Flash 一样好”——而是“Union Alpha 免费一周,而且没有人拿它与 Google 发布的任何东西做过对比”。这两句话截然不同,而目前只有一句是真的。

这对组合中经过实测的那一半记录在此:Gemini 3.8 Flash 模型页面载有 $0.75/$3.75 的费率、90% 的缓存输入折扣,以及决定长篇报告工作的 65,536 token 输出上限。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新