產生的編輯主視覺卡片,標題為「Ling-3.1-flash 已上線,限時兩週免費」,副標題為「560B MoE 今日實際上提供什麼」。四張圓角卡片寫著「參數:總計 560B/約 25B 啟用」、「上下文:262,144 個 token」、「輸出上限:32,768 個 token」以及「權重:未公佈」,上方頁尾一行寫著「廠商陳述的規格;未公佈試用期後的價格。」
Guides & Insights

Ling-3.1-flash 現已上線,限時兩週免費:560B MoE 究竟能提供什麼?

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash,這個由 Ant Group 的 inclusionAI 實驗室於 2026 年 9 月 29 日至 30 日發表的約 5,600 億參數混合專家模型,本週不再只是一則新聞稿:它如今已在正式運作的商用 API 上回應請求。該模型正在第三方推論閘道上進行為期兩週的免費試用,也出現在 Ant 自家的 Ling Studio 產品中——這讓問題從「它是否存在」轉為「它實際上提供什麼服務」。答案比標題數字所暗示的更狹窄。Ling-3.1-flash 是文字輸入、文字輸出;它提供 262,144 個 token(256K)的上下文,儘管公告指出 1M 是最終目標;其輸出上限為 32,768 個 token;而且沒有人公布你在第 15 天、當免費窗口關閉且權重理應隨後釋出時,將要支付的價格。

公告卡與實際上線端點之間的落差,是值得緊抓不放的重點,因為這波發布的大多數報導都把規格讀得彷彿該模型今天就會帶著這些規格出貨。事實並非如此。Ling-3.1-flash 是這間實驗室三個月內第二款以獨立追蹤器 LLM Releases 直白歸入「權重未釋出」的方式問世的模型,而 Ant 所說這款模型是什麼,與開發者現在實際能呼叫什麼之間的差異,正是預算或試行專案可能悄悄出錯的地方。

從公告發布到今天,有什麼變化?

這則公告本身就是一篇規格貼文:總參數約 560B、每個 token 約啟用 25B、上下文最多可達 1M 個 token、三項掛頭牌的評測數字,外加一項承諾——「我們計劃在不久後開源這個模型」。這些統統都沒變。變的是可用性。公告發布後一天之內,該模型就能透過商用邊緣服務存取,而免費試用所暴露的,正是付費版會用的同一個真實端點:相同的 API 介面、相同的純文字模態、同樣為長時間跨度的代理工作而設的思考模式切換開關。

對任何正在決定是否要投入工程時間的人來說,本週的重點全在試用上,而這件事有利有弊。兩週的免費推論,是真正低成本的方式,能看看模型在你自己的提示詞上表現如何——對這個規模的模型來說,這很罕見。但免費是一種推廣狀態,不是價格。目前任何地方都還沒有公布 Ling-3.1-flash 試用期後的價目表,所以你在免費方案上建立的任何成本模型都只是暫代,直到 Ant 及其託管商給出數字為止。

規格表,以及那三個仍只是承諾的數字

• 參數 — 總計 560B,每個 token 約 25B 啟用。這是廠商宣稱的數據,且大約是前一代 124B 總計 / 5.1B 啟用的四倍。稀疏比例維持在接近 1/22,因此啟用量並未大幅更精簡——這個模型只是比它所接替的模型大得多。

• 上下文 —— 今日供應的是 262,144 個 token。「最高可達 1M」是視窗啟用後的目標;這不是試用端點會提供給你的內容,而且這是本次發布最常見的誤讀。

• 輸出 — 最多 32,768 個 token。對代理迴圈來說很合理,但如果你打算一次生成長篇文件,就會偏緊。

• 模態 — 文字輸入、文字輸出。這是文字模型。視覺、音訊和檔案輸入不在這次發布範圍內,且尚未公布相關日期。

• 推理——一種具備明確思考模式切換的混合堆疊,與前一代所用的模式相同,目標在於多步驟代理與工具呼叫作業,而非單輪對話。

• 權重與授權——尚未發布。這是最重要的一項數據,卻也是目前完全沒有任何數值的一項:截至今日,沒有 Hugging Face 儲存庫、沒有授權條文,也沒有可下載的檢查點。

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

基準卡,以它所需的折扣來解讀

Ant 自家的報告指出,Ling-3.1-flash 在五項代理基準測試中取得 81.0 的總分,其中 Terminal-Bench 4.0 為 40.4%、SWE-Atlas 為 55.9%、HealthBench Professional 為 65.35%;該公司自家的說法還加上 GDPVal-AA v2.1 的 1,673 Elo 以及 FrontierSWE 的 75.16。這些數字每一個都是第一方數據。沒有測試框架、沒有提示集,也沒有權重可供其他人重新執行這套測試,這是此階段模型的標準但書——而在這裡值得直白地說:未經重現的廠商分數,是關於某個模型的一項主張,而不是對它的測量。

這張卡也提供了資訊,只是方式可能並非其作者本意。40.4% 的 Terminal-Bench 4.0 結果明顯落後於前沿梯隊;Claude Sonnet 5.5 是中量級模型而非旗艦,卻在同一版本的該基準測試上拿下 70.6%。誠實的解讀並不是 Ling-3.1-flash 很弱——對一個以成本為定位的模型來說,40.4% 在代理式終端機項目上是個體面的數字——而是公告當天在社群媒體上流傳的「在關鍵基準測試上接近前沿」這種說法,一碰到具體列項就站不住腳。模型表現最強的基準測試 HealthBench Professional,分數 65.35,也正是附帶那條尷尬註腳的一項:Ant 表示它是在一個名為 AQ 的環境中接受評估,且該模型的醫療保健能力「目前只能在 AQ 中體驗」,卻未在任何公開地方定義 AQ 是什麼。一個附帶未具名環境的頭條分數只是展示,不是可重現的結果。

為什麼大型模型以試用形式登場才是真正的新聞

這裡更有意思的地方在於發布的順序,而非參數本身。Ling-3.0-flash 直接開放權重。這一個則是先推試用,權重、授權條款與官方定價全都暫不公布,並公開承諾要等到免費期結束後才會開源。那是一套商業發布的劇本,卻披著開放模型公告的外衣,而這是真正值得追蹤的轉變:如果權重以寬鬆授權釋出,社群就能拿到一個 560B 的基礎模型來微調與蒸餾;如果它們附帶商業條件,那麼這兩週的試用本身就是產品,而「開源」一說只是行銷。無論如何,這個選擇會落在試用期之內,而這才是該緊盯的事,而非任何單一列的基準測試成績。

它在哪裡執行,以及誠實的路由概況

目前,Ling-3.1-flash 僅能透過廠商自家的產品介面,以及正在進行試用的第三方推論平台取得——情況就僅止於此。它今天並不在 OrcaRouter 的型錄中;用我們的公開模型 API 查詢 Ling-3.1-flash、Ling-3.0-flash 和 Ling-3.0 視覺變體,全都回傳 not-found,我們不會假裝不是如此。當 Ant 端點真的正式推出並公布定價時,OrcaRouter 所採用的直通模式——供應商定價原樣轉嫁、零加成,因此廠商降價當天我們這邊就會生效——正是最適合定價仍尚未寫定的模式的安排。

你今天就能做、不必等授權決定的,是對一個尚未經過驗證的模型執行真正重要的比較:拿它跟你現在就能呼叫的 Flash 層級模型對照。Gemini 3.8 Flash 和 DeepSeek-V4.1-Flash 都以供應商定價列在我們的目錄上,共用一個 API 金鑰,兩者之間可自動容錯移轉。對一個權重與價目表都還未知的免費試用模型而言,這才是穩妥的持有方式——試用期間還能多一個可路由過去的候選,同時也有一條不取決於第十五天會發生什麼事的正式上線路徑。

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

本週該做什麼

如果這個模型和你的工作有關,試用就是現在就行動、而不是等開放權重問題明朗的理由——在 560B MoE 上免費推論兩週,是你所能取得最便宜的評估,而且「它在我的提示上是否站得住腳」的答案今天就能知道,儘管「我能否自行託管它」的答案還不能。趁這個機會之窗還開著,依序檢查三件事:

• 跑你自己的實際工作負載,而不是那張跑分卡。公開的數字是 Ant 挑選出來的任務;真正決定你技術棧的,是你自己的提示詞。

• 測試你實際會用到的上下文。這個端點提供的是 262,144 個 token,不是 1M。如果你的設計依賴那個更大的視窗,那你的設計就是建立在一個承諾之上。

• 不要以「免費」為基礎建立成本模型。免費是為期兩週的狀態。在價目表公布之前,請規劃將預設切回付費的 Flash 層級模型,並將 Ling-3.1-flash 視為增補容量。

這項公告是真的,模型也正在運作,而這在一週前還無法這麼說。但「已發布且開放」與「正在試用」是不同的狀態,而這次明確屬於後者——一份 560B 規格、一個 256K 端點、一張僅由廠商提供的基準測試成績單,以及一個為期兩週的倒數計時,而這是整個發布中唯一確定的截止期限。

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新