
Ling-3.1-flash 對決 Gemini 3.8 Flash:256K 試用模型對上 1M token 正式上線版
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
把 Ling-3.1-flash 和 Gemini 3.8 Flash 並排比較,落差不在於智慧,而在於狀態。Ling-3.1-flash 是 Ant Group 約 560B 參數的混合專家模型,於 2026 年 9 月 29 日至 30 日發表;它提供免費兩週試用、256K 服務上下文、32,768 token 輸出上限、僅接受文字輸入,且未公布權重、授權或價格。Gemini 3.8 Flash 是 Google 的 Flash 等級推理模型,於 2026 年 9 月 2 日發布;它是正式開放使用(GA)的 API,具備完整的 1,048,576 token 視窗、65,536 token 輸出、多模態輸入,以及公開價目表。從紙面上看,那是兩個模型的比較;實際上,那是把一個你今天就能在其上開發的模型,拿來和一個你這個月只能測試的模型相比。
那不是輕視 Ling-3.1-flash 的理由。一個免費、具備代理式傾向的 560B MoE,值得任何人投入兩週的評估時間。但它改變了正面對決的目的:不是「我該標準化採用哪一個」,而是「這個試用模型是否夠好,值得我在十五天後對答案進行對沖」。這些是不同的問題,而它們在以下每個軸向上的答案都不同。
在任何基準測試決定勝負之前,就已決定一切的三件事
大多數比較都從分數開始。這一個則應該從可用性開始,因為那裡的差距並不是程度問題。
• 定價 — Ling-3.1-flash 在試用期間免費,且完全未公布試用期後的價目表。Gemini 3.8 Flash 在促銷期間的定價為每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元,並將於 2027 年 1 月 1 日恢復為 1.50 / 7.50 美元。上述為廠商公布的牌價;兩者皆可能有所變動。
• 背景 — Ling-3.1-flash 在試用階段提供 262,144 個 token,並以 1,000,000 作為最終目標。Gemini 3.8 Flash 目前提供完整的 1,048,576 個 token。如果你的工作負載取決於百萬 token 視窗,這兩者之中目前只有一個擁有它。
• 權重 — Ling-3.1-flash 尚未公開任何權重:沒有儲存庫、沒有授權條款、沒有檢查點,只有表明試用後會開源的意向。Gemini 3.8 Flash 是閉源的,而且永遠都會是,但它是你今天就能明確無歧義呼叫的託管 API。
合起來讀,這三點共同說明了一件事:Ling 模型最顯眼的優勢,不是促銷性質(免費),就是未來性(100 萬上下文、開放權重);而 Gemini 模型的優勢則是合約性質的。這種不對稱貫穿了接下來的一切。
Ling 模型真正勝出的地方
兩個地方,而且兩者都是真實的。
首先是評估期間的成本。對這種規模的模型來說,兩週免費試用不是可以隨手打發的行銷噱頭——它是找出 560B 混合專家模型能否處理你的提示詞最便宜的方法。Gemini 3.8 Flash 無論價格如何,都不是免費的,而針對幾千次呼叫進行嚴謹評估,確實得花上真金白銀。
第二點是開放性路線。Ling-3.1-flash 是某個確實以 MIT 授權釋出權重的模型的後繼者,而 Ant 已公開表示也打算將這一個開源。若此事成真、並採用寬鬆授權,你就能得到 Gemini 3.8 Flash 永遠無法提供的東西:自行架設、微調或蒸餾一個 560B 基礎模型的選項。但最關鍵的癥結在於——你是在押注一個承諾,而上一代的承諾是在延遲兩週後才兌現的,並非保證。
在 Gemini 3.8 Flash 遠未接近失敗的地方
撇開審判與開放性問題不談,營運上的比較便明顯倒向 Google 那一方。
• 輸入 —— Gemini 3.8 Flash 可接受文字、圖像、影片、檔案與音訊。Ling-3.1-flash 只接受文字並回傳文字。對於文件、螢幕截圖或影片工作流程而言,這不是偏好問題,而是能力邊界。
• 輸出上限 — 65,536 個 token 對比 32,768 個。當你一次生成報告、程式碼檔案或長篇結構化輸出時,這一點立刻變得重要。
• 吞吐量 — 獨立測試顯示,Gemini 3.8 Flash 的輸出速度中位數接近每秒 249 個 token,而 OrcaRouter 自家的七天遙測數據在首個 token 的 p50 為 4.95 秒時,測得每秒 552 個 token。據報導,Ling-3.1-flash 的試用託管服務約為每秒 63 個 token。Gemini 模型屬於不同的速度等級。
• 參考深度 — Gemini 3.8 Flash 背後有大量獨立量測結果支撐;Ling-3.1-flash 的數字則全屬第一方資料,且出自全新的端點,目前尚無第三方重新複驗。
• 多模態代理——任何必須讀取螢幕截圖、PDF 或通話錄音的任務,在架構上就是一項 Gemini 任務,而非取決於品質。

基準測試,以及為什麼這兩組資料無法真正互相比較
Ling-3.1-flash 的廠商回報成績,是在五項代理基準測試中取得 81.0 的總分,其中 Terminal-Bench 4.0 為 40.4%、SWE-Atlas 為 55.9%、HealthBench Professional 為 65.35%;Ant 自家的說法則在 GDPVal-AA v2.1 上再加上 1,673 Elo,並在 FrontierSWE 上達到 75.16。這些全都是 Ant 自家測得的數字。沒有公布任何測試框架,更關鍵的是,也沒有釋出權重供任何人重新執行這套測試。
Gemini 3.8 Flash 的情況則性質不同。在 Artificial Analysis 目前的 Intelligence Index 版本(v4.3.2)中,它在高推理努力下得分 40.9,中等為 39.8,低為 33.5——值得特別指出的是,該指數最近已修訂,因此今年秋季早些時候發表關於此模型的數字是在不同版本上計算出來的,不能直接與這些數字相比。Google 本身對此模型的宣稱包括 HLE-Verified 上的 54.9,以及 Terminal-Bench 2.1 上落在 80 幾分高段的強勁結果。獨立與廠商數字並列,兩者皆成立,但不可互換。
有一個值得做的明確交叉比較,因為兩者都屬於同一個基準測試系列。在 Terminal-Bench 4.0 上,Ling-3.1-flash 的廠商數據是 40.4%。Claude Sonnet 5.5——一個中階模型,而非旗艦——在同一版本上得分 70.6%。那一列是反對將 Ant 的卡解讀為「接近前沿」的最強論據:該模型在 Ant 選擇強調的代理式指標上具有競爭力,而在存在外部數字的終端編碼指標上明顯落後。

選擇的實際樣貌
如果你需要在接下來兩週內打造出某個東西,答案很明確,沒有懸念,而這並不是在貶低 Ling-3.1-flash。Gemini 3.8 Flash 是兩者之中唯一提供穩定端點、公開定價、完整的百萬 token 視窗、多模態輸入,以及你能夠閱讀的授權條款的一個。它是可用於生產環境的 Flash 層級模型。
Ling-3.1-flash 是一個評估標的。它目前的價值在於這項評估是免費的,而且這個模型很有意思:一個 560B 的 MoE,每個 token 卻只有約 25B 處於作用中,是對稀疏性的一場押注;而 Ant 將它定位在 Flash 等級模型所競逐的代理、搜尋與辦公室自動化等工作負載上。在試用期內用它跑你自己的提示詞很值得,正因為 Ant 之外還沒有人做過這件事——你將會是最早擁有非廠商觀點的人之一。
本月合理的決策樹:把正式環境的流量導向 Gemini 3.8 Flash,用免費試用期拿 Ling-3.1-flash 去跑你最棘手的提示詞,並把開放權重這個問題留作真正的分岔點。若權重以寬鬆授權釋出,價格又落在 Flash 級距附近,Ling-3.1-flash 就會成為名副其實的第二選擇——一個你可以自己架設的選項,而 Gemini 永遠不可能如此。若權重附帶條件,試用期就此結束,比較也隨之告終。
用同一個鍵同時執行兩者,並坦白說明還缺少什麼
Gemini 3.8 Flash 即日起已收錄於 OrcaRouter 目錄中,模型 ID 為 google/gemini-3.8-flash,採用 Google 自家的定價,零加成——因此當優惠費率在一月回復原價時,你在這裡支付的價格會自動隨之調整,而不需要重新簽約。DeepSeek-V4.1-Flash 是另一個值得在同一項實驗中評估的廉價 Flash 等級模型,同樣以供應商的定價收錄於同一目錄中,因此要針對試用模型與既有 Flash 等級選項進行三方測試,只需一組 API 金鑰,並在它們之間自動容錯移轉即可完成。
Ling-3.1-flash 並不在我們的目錄中,而對我們的公開模型 API 進行查詢後,無論是它還是前一代,都回傳 not-found,所以誠實的說法是:試用只會在它能運作的地方進行——透過供應商自家的介面與第三方推論平台——而我們不主張自己託管了它。這正是這份比較中最可能迅速改變的部分:一個處於免費試用、價格尚未公布的模型,正是那種只要 Ant 及其託管方一發布價目表,就會立刻登上路由層的東西;而零加成直通意味著,那一天到來時,這裡的價格就是那裡的價格。
所以,結論比參數量所暗示的更狹窄。Ling-3.1-flash 是更具野心的模型,也是更有趣的研究成果;Gemini 3.8 Flash 則是你實際上能拿來出貨的那一款。在授權條款和價格出現之前,這就是差異的全貌——而這不是一列基準測試成績就能定案的事。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
