
Union Alpha 對決 Qwen3.8 Flash:一分之差,就是一切
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha 和 Qwen3.8 Flash 在唯一同時評測過兩者的測試上只差一分。在 SMF Clearinghouse Official A 套件——157 項測試、關閉推理——中,Union Alpha 得分 136,而 Qwen3.8-Flash-Next 的本地執行得分 137。那是這兩款模型最接近的正面對決結果,也是這份比較中最具誤導性的數字,因為這兩筆紀錄並非在相同條件下執行,而且其中只有一個是你現在真的能租用的模型。
一分差距能告訴你什麼、不能告訴你什麼
先從它證明了什麼談起。Union Alpha 並非一般意義上的虛張聲勢——一套涵蓋 157 項測試、零錯誤、完美推理(30/30)與完美工具使用(2/2)的廣泛測試套件,不是空洞端點所能產出的東西。它的程式設計結果為 26/30、數學為 24/30,使其處於可信範疇;而它的寫作分數為 2/5,則讓它遠不及通用散文寫作。
現在來談那些但書,它們可是撐起全局的關鍵。
Qwen3.8 Flash 這一項是在本機執行的 Qwen3.8-Flash-Next——也就是開放權重的檢查點——而非託管的 Qwen3.8 Flash API。本機推論意味著用你自己的量化、你自己的推論堆疊、你自己的工具呼叫解析器。這些都不保證會與託管端點回傳的結果一致,而執行這項測試的人正是基於這個理由,將該比較標記為非決定性的。
單一測試套件並不等於一份評測剖面。官方 A 涵蓋面廣,但每個類別都偏淺:工具類別只有 2 項測試。一個只有兩項測試的工具類別拿到 2/2,是好徵兆,而非代理式可靠性的證據,而 Union Alpha 被明確定位為代理式與編碼模型。這項工具所測量的,是與該主張相鄰的東西。
而那一點本身位於一個 157 項測試套件的雜訊之中。把 136 和 137 當作「它們位於同一區間」,而不是當作排名。
並肩
• 上下文視窗 — Union Alpha 262,144 個 token 對比 Qwen3.8 Flash 提供 1,000,000 個 token(262,144 原生,透過 YaRN 擴展)。
• 最大輸出 — Union Alpha 131,072 個 token,對比 Qwen3.8 Flash 的 131,000 個 token。實際上旗鼓相當。
• 輸入 — Union Alpha 上的文字與圖像,對比 Qwen3.8 Flash 上的文字、圖像與影片。
• 價格 — 在 Union Alpha 預覽期間為 $0,而 Qwen3.8 Flash 則為每百萬輸入 $0.150、每百萬輸出 $0.470、每百萬快取讀取 $0.018、每百萬快取寫入 $0.230。
• 推理控制 — Union Alpha 上完全沒有,相較之下 Qwen3.8 Flash 則具備預設開啟且可停用的思考模式。
• 首個 token 時間 — Union Alpha 10.00 秒 p50,對比 Qwen3.8 Flash 6.62 秒 p50,兩者皆是在同一段七天期間內於我們的端點上測得。原始解碼速度比外界評價所暗示的更接近:每秒 170 個 token 對上 103 個。
• 來源出處 — 匿名營運方,未公開權重;相較之下,阿里巴巴/Qwen 已將 Qwen3.8-Flash-Next 的權重開源於 Hugging Face 與 ModelScope。

Qwen3.8 Flash:一場押注效率的 6B 活躍參數豪賭
Qwen3.8 Flash 於 2026 年 8 月 26 日推出,是開放權重 Qwen3.8-Flash-Next 檢查點的正式代管版本,該檢查點由阿里巴巴同步發布。它是 125B 參數的混合專家模型,每個 token 約啟用 6B 參數,另有 51B 的 N-gram 嵌入參數,建構於結合 Gated DeltaNet 與稀疏注意力索引器的混合注意力之上。
廠商的說法聚焦於訓練經濟效益:阿里巴巴宣稱其執行成本約為 Qwen3.7-Plus 的九分之一,並聲稱在具備高快取命中率的 100 萬 token 工作負載上,prefill 最高快 7.6 倍、decode 最高快 4.9 倍。這些都是廠商公布的數據,尚未經過獨立重現。
其基準測試表也同樣是由廠商自行提報且未經重現:SWE-bench Pro 62.5、DeepSWE v1.1 58.7、SWE-bench Multilingual 81.0、NL2Repo 48.1、CoWorkBench 73.9、JobBench 55.7、RealWorldQA 88.5、LVBench 76.6、AndroidWorld 84.5。值得拿來回敬行銷宣傳的數字,是 Humanity's Last Exam 的 35.9,它在同一項比較中低於 Claude Opus 4.6 的 40.0。
在我們自家的模型頁面上,公開基準測試區塊仍顯示「待定」——目前還沒有任何第三方為它評分。我們手上確實有的是自家的流量數據:首個 token 的中位延遲時間為 6.62 秒、輸出速率為每秒 103 個 token,以及 4.5% 的錯誤率。這個錯誤率高到值得留意,而且這種數字唯有在你實際測量運作中的端點、而非閱讀發布貼文時才會浮現。

Union Alpha:沒有擁有者的模型
Union Alpha 於 2026 年 9 月 16 日出現在第三方目錄中,並在OrcaRouter 的免費方案上提供。它沒有具名實驗室、沒有權重、沒有授權條款、沒有參數數量,也沒有架構說明。其供應商欄位顯示「Stealth」。
至少它的端點是可辨識的:262,144-token 上下文、131,072-token 最大輸出、文字與圖像輸入但僅限文字輸出、工具呼叫、JSON 輸出、temperature、top_p 與 max_tokens,而且完全沒有推理控制項。工具選擇實際上只接受「auto」。其免費使用期被描述為約一週、有速率限制,且尚未公布預覽後的定價。
所述宣稱——「在廣泛的通用任務上達到前沿水準的表現」——係由營運方自行報告且未經審核。136/157 的 Official A 結果是唯一存在的獨立量測。

速度正是它們不再相像的地方
表面上的吞吐量數字並沒有如你所預期的那樣把它們區分開來,而箇中原因值得深入了解。
在我們自己過去七天的路由遙測中,Qwen3.8 Flash 以每秒 103 個輸出 token 進行串流,首個 token 時間的 p50 為 6.62 秒,錯誤率為 4.5%。以相同方式測量,Union Alpha 的串流速度為每秒 170 個 token。就原始解碼速度而言,這個匿名模型是兩者中較快的一個。
它做不到的事,就是啟動。Union Alpha 的 p50 與 p95 首字延遲(time-to-first-token)雙雙卡在 10.00 秒,意味著至少半數請求要等上十秒以上,第一個 token 才會出現,而同一段區間內它的錯誤率為 7.7%——大約是 Qwen 的 1.7 倍。前述幾節所依據的那次 157 項測試的 Official A 執行,耗費了 4.6 小時的實際時鐘時間,延遲中位數為 91.9 秒,每項測試平均 104.8 秒,並有四項測試觸及測試框架的 300 秒逾時上限。在發布當天跑過它的獨立測試者,所回報的吞吐量遠低於我們端點顯示的數字,而這正是服務仍在吸收首日龐大負載時會出現的情況。
所以實務上的差異不是解碼速度,而是首個 token 時間與可靠性。Union Alpha 不能用於任何互動式用途——沒有自動完成、沒有行內輔助、沒有緊密的代理迴圈——因為十秒的靜默與卡死難以區分。它適合非同步工作:隔夜批次作業、長文件處理、離線評估執行,在這些情境中沒有什麼在等待第一個 token,而 7.7% 的失敗率會透過重試被吸收。
Qwen3.8 Flash 以每秒 103 個 token、首個 token 中位延遲 6.62 秒的表現來看,也稱不上快。誠實地說,兩者都慢,而且只有其中一個大約每 13 次請求會失敗 1 次。
效率論證,以及誰有權提出它
阿里巴巴提出了一套訓練成本論點:訓練成本僅為 Qwen3.7-Plus 的九分之一,每個 token 有六十億活躍參數,因此服務成本低廉。這是一項關於某個模型的主張——該模型的權重確實存在,且其系譜有明確記載。
Union Alpha 的效率敘事是暗示而非明說——一個 256K 的匿名模型,可免費呼叫。免費不等於便宜。有人在為那些 GPU 付費,預覽版有明訂的結束時間,而營運方自己承認他們在調校速度,這暗示服務的經濟模式尚未底定。一個免費一週、之後卻無法定價的模型,其效率主張會隨著這個窗口結束而失效。
嘗試未知,而不對它下注
這個特定對決之所以值得記在心裡,是因為它是對一個未經證實的模型所能做的最省成本測試。Qwen3.8 Flash 是已知數:具名供應商、開放權重、已公布的(雖帶有廠商色彩的)基準測試、每詞元 $0.150/$0.470 的真實價格。Union Alpha 則是未知數,定價為零,其全部的競爭主張都建立在單一 157 項測試的結果上。
與其做選擇,不如把未知項目放在容錯移轉規則後面。OrcaRouter 以 0% 加成直接透傳供應商定價,並支援跨供應商的自動容錯移轉,因此一個被限流或消失的 Union Alpha 端點會自動落到仍在回應的模型,而不是在凌晨三點變成一個失敗的任務。兩個模型都使用同一把金鑰,所以這個實驗的代價只是一次設定變更,而不是多一次整合——而且兩者都不必是你需要辯護的決定,因為當免費窗口關閉時,你可以直接切換路由。
裁決
Qwen3.8 Flash 是值得在其上建構的模型。六十億個活躍參數、開源的同系列權重、100 萬 token 的上下文視窗、影片輸入、實測每秒 103 個 token 的可用速度,以及可預估的公開定價。它的基準測試由廠商自行提報,其錯誤率值得持續留意,但它屬於某個人,而那個人正在出貨。
Union Alpha 是值得衡量的模型。在 Official A 上的一分之差確實很有意思——這暗示無論這東西是什麼,它都不是玩具——而且以 $0 的價格、131K 的輸出上限和視覺輸入,它值得你花一週的注意力。但單一測試套件上的一分之差,由一個錯誤率 7.7% 的匿名操作者所產生,是值得調查的理由,而不是切換的理由。
值得關注的是,向來讓這件事塵埃落定的,始終是同一樣東西:一個名字。Ox Alpha,這個系列的前作,在以智譜的 GLM-5.3-Flash 現身六天後才被揭曉。如果 Union Alpha 也得到一個名字,那麼這場比較就不再是關於一分,而是開始關於價格。
已知項目的定價與說明文件皆已到位:Qwen3.8 Flash 模型頁面顯示 $0.150/$0.470 的費率、1M token 的服務上下文與 131K 的輸出上限,而公開基準測試結果仍待公布。
