
Union Alpha vs Gemini 3.8 Flash:一個有分數,另一個有宣稱
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha 和 Gemini 3.8 Flash 是同一套推銷說詞,卻以兩種截然不同的佐證程度呈現。Union Alpha 的營運商將其描述為「在廣泛的通用任務上具備前沿水準的效能」,卻未公布任何基準測試、參數數量、授權條款,甚至連名稱也沒有。Gemini 3.8 Flash 推出時則附上標註日期的評估表、Artificial Analysis Intelligence Index、獨立測試者提供的各項任務成本數據,以及一份一路記載到 2027 年的價格表。如果你在兩者之間做選擇時,考量的是價格以外的任何因素,那麼你實際上是在一個可以查核的數字,與一句無法查核的說法之間做取捨。
並肩而立,在爭吵之前
• 上下文視窗 — Union Alpha 262,144 個 token 對比 Gemini 3.8 Flash 1,048,576 個 token。
• 最大輸出 — 131,072 個 token 對比 65,536 個 token。Union Alpha 在這項勝出,而這也是它唯一勝出的結構性層面。
• 輸入 — 兩者皆支援文字與圖像,但 Gemini 3.8 Flash 額外接受影片、音訊和檔案。
• 定價 — Union Alpha 預覽期間為 $0,對比 Gemini 3.8 Flash 每百萬(M)輸入 $0.75、每百萬輸出 $3.75、每百萬快取輸入 $0.075,並於 2027 年 1 月 1 日倍增至 $1.50/$7.50。
• 推理控制項 — Union Alpha 未提供任何選項,而 Gemini 3.8 Flash 的思考層級則會直接同時影響品質與成本。
• 已發表的評估——Union Alpha 的營運方未提供任何評估,相較於 Gemini 3.8 Flash 上一份完整且標註日期的表格。
• 來源出處——匿名營運者、未公開權重,對比 Gemini 3.8 Flash 有明確的發布日期與可考證的系譜。

Gemini 3.8 Flash 的數字究竟說明了什麼
Gemini 3.8 Flash 於 2026 年 9 月 2 日推出——這是 Google 在大約六週內的第三個 Flash 版本,從中可看出這款模型的故事有多大部分在於推出節奏,而非突破性進展。這份公開的評測表將功勞分別歸給 artificialanalysis.ai 和 deepmind.google,因此應把它視為獨立數據與廠商數據的混合,而非一份純粹的第三方稽核。
• AA Coding — 76.3,這是一個確實很強的程式設計分數。
• AA Intelligence — 41.2。請注意,Artificial Analysis 另有一項報告指出,在高推理投入下 Intelligence Index 為 59,因此這個數字會隨投入設定大幅變動;請一併註明設定,否則這個數字毫無意義。
• GPQA Diamond — 95.3,{{1}}在這項比較中以大幅差距成為最高的單一數據{{/1}}。
• HLE-Verified — 54.9,而一般 Humanity's Last Exam 為 47.8。
• Terminal-Bench 2.1 — 在 Google 自家的表格上為 89.4,微幅領先 Claude Opus 5 的 89.1。
• 長上下文召回 — 81.3;SciCode 56.6;tau_banking 44.9。
• 觀測吞吐量 — 在最近七天的期間內,每秒輸出 323 個 token,錯誤率為 0.63%,首個 token 的中位延遲為 3.46 秒,且測得流量為 4.985 億個 token。
弱點和優勢一樣有詳細記載。在 Terminal-Bench 4.0 上,它得分 19.1,而 Claude Opus 5 為 51.8。在 OSWorld 2.0 上,它取得 59.0%,相較之下為 75.4%。在 GDPVal-AA v2 上,它以 1545 Elo 落後,對手為 1824。Gemini 3.8 Flash 在特定範圍的工作上表現出色,但在最艱難的通用型代理評估中表現一落千丈——而這正是公開表格能讓你看到的那種樣態。
讓人措手不及的定價陷阱
Google 維持與 Gemini 3.7 Flash 相同的每 token 價格。帳單還是變高了。
這個模型運作得更賣力:更多推理步驟、更多反覆的 tool calls。Artificial Analysis 的獨立測試測得,相較於 3.7 Flash,每個任務的輸出 token 量約多出 30%,每個任務的成本則高出約 40%。在高推理強度下,每個任務的成本約為 $0.58;中等約在 $0.41 附近,低則接近 $0.24。
對任何需要編列預算的人來說,這是比較中最有用的一點,而且它的適用範圍遠超出這兩個模型:單價和每項任務成本是不同的數字,而其中只有一個會出現在定價頁面上。Google 仍保留 3.7 Flash 作為較便宜的選項,這無異於默認了這一轉變。
Union Alpha 取而代之提供的是什麼
Union Alpha 於 2026 年 9 月 16 日出現在第三方目錄中,並運行於OrcaRouter 的免費方案。它是匿名的——沒有實驗室、沒有權重、沒有授權條款、沒有知識截止日期——並在所述約一週的期間內免費,有速率限制,且未公布預覽後價格。
即使其來源不可驗證,其端點仍可驗證:262,144 token 上下文、131,072 token 最大輸出、文字與圖像輸入但僅文字輸出、工具呼叫與 JSON 輸出、temperature、top_p、max_tokens,且完全沒有任何推理控制項。工具選擇實際上僅支援 "auto"。
恰好只有一項獨立測量。SMF Clearinghouse 在關閉推理的情況下執行了 157 項 Official A 測試,得分為 136/157——86.6%,零錯誤,在二十六個中排名第十。推理表現完美,30/30;工具 2/2;程式設計 26/30;數學 24/30。寫作則為 2/5。
那並不是一個糟糕的結果,只是不能相提並論罷了。Official A 是一套涵蓋 157 項測試的廣泛通用套件;AA Coding 和 GPQA Diamond 則是不同的測量工具,衡量的是不同難度下的不同事物。把 136/157 跟 GPQA Diamond 上的 95.3 並列,然後宣布誰勝出,正是那種讓廠商數字變得毫無價值的洗白手法。


沒有人能真正完成的成本比較
這是這個已解說的範例,而且它刻意不完整。
拿一個你每個月執行上千次的任務來說。在 Gemini 3.8 Flash 的高推理模式下,官方公布的每項任務約 $0.58 這個數字,換算下來大約是每月 $580。這是一個真實、站得住腳的數字,建立在實測的 token 消耗量之上。
在 Union Alpha 上,同樣的一千項任務今天只要 $0。三週後要花多少則不得而知,因為並不存在預覽後的價格。它們在可靠性上的代價同樣不得而知,因為該模型受到速率限制、只在單一端點上運行、沒有備援供應商,而且一旦超過沒有人公開的用量上限,就會以 HTTP 429 回應。
所以,誠實的答案是:Union Alpha 贏得了唯一可用的成本比較,卻失去了預測它的能力。對一次性的評比來說,這沒問題。但對預算項目來說,這不是一個數字——而是一個附帶 URL 的希望。
每個所屬之處
Gemini 3.8 Flash 適合用在任何你需要可量測基準的地方:搭配視訊或音訊輸入的長脈絡文件作業、以 AA Coding 分數 76.3 這項指標為準的程式編寫任務,以及任何附帶預算的工作負載,因為你可以在投入之前先算出成本,而且你知道它會在 2027 年 1 月 1 日翻倍。
Union Alpha 應該放在探索性位置——嘗試一款具備視覺能力、輸出上限是 Gemini 兩倍的 256K 模型,用在即使端點消失也對你毫無成本的工作上。
之所以要讓它們跑在同一個端點後面,而不是做成兩套整合,是因為這項比較的形態會一變再變。路由 DSL 讓你能把兩者組成單一呼叫——以 Gemini 3.8 Flash 作為受測路徑,Union Alpha 作為實驗分支——而不是把某個你日後必然想重新檢視的決定寫死,等到免費期間結束或 Google 的優惠導入價到期時才回頭調整。這兩個日期都不遠,而且兩者都會改變算盤。
什麼能解決這件事?
在同時收錄 Gemini 3.8 Flash 的排行榜上,有一筆標註日期的 Union Alpha 紀錄。那就是唯一缺少的一塊。在那之前,站得住腳的說法不是「Union Alpha 和 Gemini 3.8 Flash 一樣好」——而是「Union Alpha 免費一週,而且還沒有人拿它跟 Google 公佈的任何東西做過比較。」這兩句話非常不同,而目前只有其中一句是真的。
這對組合中經過實測的那一半記錄於此:Gemini 3.8 Flash 模型頁面載明 $0.75/$3.75 的費率、90% 的快取輸入折扣,以及決定長篇報告作業的 65,536 個 token 輸出上限。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
