產生的標題卡標題為「Union Alpha vs Gemini 3.8 Flash」,副標題為「一個有分數,另一個只有宣稱」,上方有三張圓角卡片,分別寫著「Gemini 3.8 Flash:過時的評估表、公開價格」、「Union Alpha:其營運商未提供任何基準測試」以及「最大輸出:131,072 對 65,536 個 token」。頁腳寫道,Union Alpha 的數據未經審計,Gemini 的數據則依據 Google 與 Artificial Analysis。
Guides & Insights

Union Alpha vs Gemini 3.8 Flash:一個有分數,另一個有宣稱

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Union Alpha 和 Gemini 3.8 Flash 是同一套推銷說詞,卻以兩種截然不同的佐證程度呈現。Union Alpha 的營運商將其描述為「在廣泛的通用任務上具備前沿水準的效能」,卻未公布任何基準測試、參數數量、授權條款,甚至連名稱也沒有。Gemini 3.8 Flash 推出時則附上標註日期的評估表、Artificial Analysis Intelligence Index、獨立測試者提供的各項任務成本數據,以及一份一路記載到 2027 年的價格表。如果你在兩者之間做選擇時,考量的是價格以外的任何因素,那麼你實際上是在一個可以查核的數字,與一句無法查核的說法之間做取捨。

並肩而立,在爭吵之前

• 上下文視窗 — Union Alpha 262,144 個 token 對比 Gemini 3.8 Flash 1,048,576 個 token。

• 最大輸出 — 131,072 個 token 對比 65,536 個 token。Union Alpha 在這項勝出,而這也是它唯一勝出的結構性層面。

• 輸入 — 兩者皆支援文字與圖像,但 Gemini 3.8 Flash 額外接受影片、音訊和檔案。

• 定價 — Union Alpha 預覽期間為 $0,對比 Gemini 3.8 Flash 每百萬(M)輸入 $0.75、每百萬輸出 $3.75、每百萬快取輸入 $0.075,並於 2027 年 1 月 1 日倍增至 $1.50/$7.50。

• 推理控制項 — Union Alpha 未提供任何選項,而 Gemini 3.8 Flash 的思考層級則會直接同時影響品質與成本。

• 已發表的評估——Union Alpha 的營運方未提供任何評估,相較於 Gemini 3.8 Flash 上一份完整且標註日期的表格。

• 來源出處——匿名營運者、未公開權重,對比 Gemini 3.8 Flash 有明確的發布日期與可考證的系譜。

Generated two-column comparison scoreboard for Union Alpha and Gemini 3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published evals from its operator, 10.00 s p50 time to first token. Gemini 3.8 Flash column: context window 1,048,576 tokens, max output 65,536 tokens, text, image, video and audio input, $0.75 input and $3.75 output per 1M tokens, a full dated evaluator table, 3.46 s p50 time to first token. Footer reads latency per OrcaRouter over the last 7 days with Union Alpha benchmarks unaudited.

Gemini 3.8 Flash 的數字究竟說明了什麼

Gemini 3.8 Flash 於 2026 年 9 月 2 日推出——這是 Google 在大約六週內的第三個 Flash 版本,從中可看出這款模型的故事有多大部分在於推出節奏,而非突破性進展。這份公開的評測表將功勞分別歸給 artificialanalysis.ai 和 deepmind.google,因此應把它視為獨立數據與廠商數據的混合,而非一份純粹的第三方稽核。

• AA Coding — 76.3,這是一個確實很強的程式設計分數。

• AA Intelligence — 41.2。請注意,Artificial Analysis 另有一項報告指出,在高推理投入下 Intelligence Index 為 59,因此這個數字會隨投入設定大幅變動;請一併註明設定,否則這個數字毫無意義。

• GPQA Diamond — 95.3,{{1}}在這項比較中以大幅差距成為最高的單一數據{{/1}}。

• HLE-Verified — 54.9,而一般 Humanity's Last Exam 為 47.8。

• Terminal-Bench 2.1 — 在 Google 自家的表格上為 89.4,微幅領先 Claude Opus 5 的 89.1。

• 長上下文召回 — 81.3;SciCode 56.6;tau_banking 44.9。

• 觀測吞吐量 — 在最近七天的期間內,每秒輸出 323 個 token,錯誤率為 0.63%,首個 token 的中位延遲為 3.46 秒,且測得流量為 4.985 億個 token。

弱點和優勢一樣有詳細記載。在 Terminal-Bench 4.0 上,它得分 19.1,而 Claude Opus 5 為 51.8。在 OSWorld 2.0 上,它取得 59.0%,相較之下為 75.4%。在 GDPVal-AA v2 上,它以 1545 Elo 落後,對手為 1824。Gemini 3.8 Flash 在特定範圍的工作上表現出色,但在最艱難的通用型代理評估中表現一落千丈——而這正是公開表格能讓你看到的那種樣態。

讓人措手不及的定價陷阱

Google 維持與 Gemini 3.7 Flash 相同的每 token 價格。帳單還是變高了。

這個模型運作得更賣力:更多推理步驟、更多反覆的 tool calls。Artificial Analysis 的獨立測試測得,相較於 3.7 Flash,每個任務的輸出 token 量約多出 30%,每個任務的成本則高出約 40%。在高推理強度下,每個任務的成本約為 $0.58;中等約在 $0.41 附近,低則接近 $0.24。

對任何需要編列預算的人來說,這是比較中最有用的一點,而且它的適用範圍遠超出這兩個模型:單價和每項任務成本是不同的數字,而其中只有一個會出現在定價頁面上。Google 仍保留 3.7 Flash 作為較便宜的選項,這無異於默認了這一轉變。

Union Alpha 取而代之提供的是什麼

Union Alpha 於 2026 年 9 月 16 日出現在第三方目錄中,並運行於OrcaRouter 的免費方案。它是匿名的——沒有實驗室、沒有權重、沒有授權條款、沒有知識截止日期——並在所述約一週的期間內免費,有速率限制,且未公布預覽後價格。

即使其來源不可驗證,其端點仍可驗證:262,144 token 上下文、131,072 token 最大輸出、文字與圖像輸入但僅文字輸出、工具呼叫與 JSON 輸出、temperature、top_p、max_tokens,且完全沒有任何推理控制項。工具選擇實際上僅支援 "auto"。

恰好只有一項獨立測量。SMF Clearinghouse 在關閉推理的情況下執行了 157 項 Official A 測試,得分為 136/157——86.6%,零錯誤,在二十六個中排名第十。推理表現完美,30/30;工具 2/2;程式設計 26/30;數學 24/30。寫作則為 2/5。

那並不是一個糟糕的結果,只是不能相提並論罷了。Official A 是一套涵蓋 157 項測試的廣泛通用套件;AA Coding 和 GPQA Diamond 則是不同的測量工具,衡量的是不同難度下的不同事物。把 136/157 跟 GPQA Diamond 上的 95.3 並列,然後宣布誰勝出,正是那種讓廠商數字變得毫無價值的洗白手法。

The OrcaRouter model page for Gemini 3.8 Flash, showing a 1M-token context window, a 65K max output, text plus image, video, file and audio input, $0.75 per million input tokens and $3.75 per million output tokens, a p50 time to first token of 3.46 s, and 498.5M tokens of traffic over seven days.The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

沒有人能真正完成的成本比較

這是這個已解說的範例,而且它刻意不完整。

拿一個你每個月執行上千次的任務來說。在 Gemini 3.8 Flash 的高推理模式下,官方公布的每項任務約 $0.58 這個數字,換算下來大約是每月 $580。這是一個真實、站得住腳的數字,建立在實測的 token 消耗量之上。

在 Union Alpha 上,同樣的一千項任務今天只要 $0。三週後要花多少則不得而知,因為並不存在預覽後的價格。它們在可靠性上的代價同樣不得而知,因為該模型受到速率限制、只在單一端點上運行、沒有備援供應商,而且一旦超過沒有人公開的用量上限,就會以 HTTP 429 回應。

所以,誠實的答案是:Union Alpha 贏得了唯一可用的成本比較,卻失去了預測它的能力。對一次性的評比來說,這沒問題。但對預算項目來說,這不是一個數字——而是一個附帶 URL 的希望。

每個所屬之處

Gemini 3.8 Flash 適合用在任何你需要可量測基準的地方:搭配視訊或音訊輸入的長脈絡文件作業、以 AA Coding 分數 76.3 這項指標為準的程式編寫任務,以及任何附帶預算的工作負載,因為你可以在投入之前先算出成本,而且你知道它會在 2027 年 1 月 1 日翻倍。

Union Alpha 應該放在探索性位置——嘗試一款具備視覺能力、輸出上限是 Gemini 兩倍的 256K 模型,用在即使端點消失也對你毫無成本的工作上。

之所以要讓它們跑在同一個端點後面,而不是做成兩套整合,是因為這項比較的形態會一變再變。路由 DSL 讓你能把兩者組成單一呼叫——以 Gemini 3.8 Flash 作為受測路徑,Union Alpha 作為實驗分支——而不是把某個你日後必然想重新檢視的決定寫死,等到免費期間結束或 Google 的優惠導入價到期時才回頭調整。這兩個日期都不遠,而且兩者都會改變算盤。

什麼能解決這件事?

在同時收錄 Gemini 3.8 Flash 的排行榜上,有一筆標註日期的 Union Alpha 紀錄。那就是唯一缺少的一塊。在那之前,站得住腳的說法不是「Union Alpha 和 Gemini 3.8 Flash 一樣好」——而是「Union Alpha 免費一週,而且還沒有人拿它跟 Google 公佈的任何東西做過比較。」這兩句話非常不同,而目前只有其中一句是真的。

這對組合中經過實測的那一半記錄於此:Gemini 3.8 Flash 模型頁面載明 $0.75/$3.75 的費率、90% 的快取輸入折扣,以及決定長篇報告作業的 65,536 個 token 輸出上限。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新