產生的編輯式主視覺卡片,標題為「Ling-3.1-flash vs Qwen3.8-Flash」,副標為「同一個問題的兩種答案:你要如何打造一個高速層級?」左側面板標題為「擴大規模並發表」,附帶說明文字「總計約 560B · 活躍約 25B · 1M 上下文」,以及一個標籤寫著「權重:即將推出」。右側面板標題為「縮小規模並出貨」,附帶「總計 125B · 活躍 6B · 預覽 Qwen4」,以及一個標籤寫著「權重:已在 Hugging Face 上」。
Engineering & Research

Ling-3.1-flash 對比 Qwen3.8-Flash:打造快速層級的兩種方式,而只有一種真正推出

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

今年秋天,兩家中國實驗室著眼於同一個問題——如何打造一個便宜、快速,且好到足以放進代理迴圈裡的模型——卻得出截然相反的答案。螞蟻集團於 2026 年 9 月 30 日發表的 Ling-3.1-flash,是約 5,600 億參數的混合專家模型,每個 token 啟用約 250 億個參數,上下文視窗號稱最高達 100 萬個 token,並表示有意「很快」開源。阿里巴巴 Qwen 團隊於 2026 年 8 月 26 日發布的 Qwen3.8-Flash,則是 1,250 億參數的多模態混合專家模型,每個 token 啟用約 60 億個參數,權重已以 Qwen3.8-Flash-Next 之名在 Hugging Face 上發布,是正式上線於 QwenCloud API 的生產模型,每百萬輸入 token 收費 0.15 美元、每百萬輸出 token 收費 0.47 美元,並在 SGLang 中首日支援。一家實驗室把規模做大並對外宣布。另一家則把規模縮小並實際出貨。這樣的差異,比兩家實驗室所發布的任何基準測試結果都更具啟發性。

這也是為什麼這項比較必須謹慎解讀。Ling-3.1-flash 沒有權重、沒有授權條款、沒有模型卡、沒有 API 價格,也沒有獨立評測;所有已公開的紀錄就只有一篇發布公告、一張廠商自家的基準測試圖表,以及它在 Ant 自家 Ling Studio 產品中的一個位置。Qwen3.8-Flash 這些全都有,而且還早了四週被非阿里巴巴員工實際運行。比較架構上的選擇是公允的;比較能力則還言之過早。

這兩個設計決策,以及它們為何分歧

Qwen 的賭注是:快速層級在結構上應該與旗艦模型截然不同,而不只是規模比它小。Qwen3.8-Flash 在其 1,250 億個參數中只啟用 60 億個——稀疏度約 95%——而它的能力來自運算資源被導向何處,而非來自原始的廣度。阿里巴巴已明確表示,其底層架構結合了 Gated DeltaNet、Qwen Sparse Attention 與 N-gram 嵌入表,是 Qwen4 世代的早期預覽,刻意提早發布,好讓推論引擎、量化工具與部署模式能在昂貴的模型建構於其上之前先行成熟。結果是一個在設計上就做到每 token 成本低廉的模型:每個 token 只需約 60 億參數的運算量,而阿里巴巴設定的價格是每百萬 token 輸入 0.15 美元、輸出 0.47 美元。

就目前公告所披露的內容來看,Ant 的押注更接近搭配極長上下文的傳統擴展路線。Ling-3.1-flash 維持了很高的啟用參數比例——每 token 約 5,600 億個參數中有 250 億個處於啟用狀態,也就是大約每二十二個中有一個——並宣稱具備最多 100 萬 token 的上下文窗口,是前一代 Ling 所提供的四倍。Ling Studio 應用程式將其描述為專為「通用型代理、搜尋、例行辦公工作,以及軟體/程式碼開發」而打造,這屬於快速層級的定位,但其參數經濟學卻屬於一個重得多的模型。在相同輸入下,一個 token 經過 250 億個啟用參數的運算成本,大約是經過 60 億個參數的四倍,而這還不涉及任何定價決策。

兩種做法都沒有錯,也都是對「是什麼限制了便宜模型」這個問題站得住腳的答案。Qwen 賭的是稀疏化與全新注意力堆疊就是上限。Ant 賭的是上限在於脈絡與世界知識,而且它負擔得起運算。對讀者而言,區分兩者的不是設計哲學,而是交付方式:一個是你能下載並實測的設計,另一個是你只能讀到介紹的設計。

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

每一個要你付出什麼代價,以及那在實務上代表什麼意思

價格差距並不細微,也稱不上接近。Qwen3.8-Flash 公布的价格為每百萬輸入 token 0.15 美元、每百萬輸出 0.47 美元,以及每百萬快取讀取 0.018 美元——阿里巴巴的公告、供應商的正式上線模型卡,以及我們所提供服務的路由模型頁面上都是同樣的數字,當你對照三個來源查核時,這就是 0% 加價直通該有的樣子。Ant 完全沒有公布 Ling-3.1-flash 的任何費率——沒有 API 價格、沒有快取折扣,也沒有任何可比的資訊。Ling 系列唯一公布的數字是上一代的,其定價為每百萬輸入 0.075 美元、輸出 0.22 美元,約為 Qwen 輸入費率的一半,也不到其輸出費率的一半。如果新的 Ling 層級定價接近舊版的水準,帳面上它會比 Qwen3.8-Flash 更便宜;但如果定價接近其 25B 活躍參數所暗示的算力成本,就不會如此。無論哪種說法都只是猜測,因為那個數字根本不存在。

在上下文方面,Ling 的說法確實更大。螞蟻為 Ling-3.1-flash 標稱最高可達 100 萬個 token;Qwen3.8-Flash 在正式環境 API 上預設搭載 100 萬 token 的上下文,開放權重則具備 262,144 token 的原生視窗,且可延伸。Ling 的數字上有兩點但書,而且兩者都尚未塵埃落定。首先,「最高可達 100 萬」是規格,不是實測——沒有人發表過這款模型的長上下文檢索行為,因為螞蟻以外的任何人都無法呼叫它。其次,前一世代 Ling 在宣傳視窗與其背後的架構說法之間,也存在完全相同的落差,而答案直到權重、格式與上下文限制終於公布時才揭曉。頭條宣傳的 100 萬是個承諾。Qwen3.8-Flash 上的 100 萬則是實際提供的預設值,你可以拿螞蟻的說法與之對照。

為什麼「preview」是這件事其中一邊誠實的字眼

阿里巴巴自己對 Qwen3.8-Flash 的定位是:它是一款以正式產品名稱發布的架構預覽版——開放權重之所以帶有「Next」後綴,正是為了避免有人把這個原型與經過調校的服務模型混為一談。這樣的定位並非靠行銷宣傳,而是由後續事件所印證:SGLang 在 Qwen3.8-Flash-Next 發布當天就推出首日支援,該模型也同時完成了 Transformers、vLLM 與 TokenSpeed 的配置,此後權重更被各大量化社群採用。版本很快就不足為奇,而這正是一款正式推出模型應有的樣貌。

Ant 的公告也有著相同的模式,只是早了一步:在發布前先公布規格,並明確表示該模型很快就會開源。這是一種合理的發布方式——Ling-3.0-flash 在七月正是循著這條路徑,而權重則在大約兩週後的 8 月 7 日以 MIT 授權釋出。但這兩個專案今日的狀態無法相提並論,再多的圖表解讀也無法彌補這個差距。值得具體說明的是,局外人能為兩者各自帶來什麼。

今天對 Ling-3.1-flash 而言,可獨立查證的事項有:公告確實存在,日期為 9 月 30 日;參數、活躍參數與上下文數字皆出自螞蟻自身;該模型出現在螞蟻的 Ling Studio 產品中;以及尚未發布任何權重、授權條款或模型卡。對 Qwen3.8-Flash 而言,可獨立查證的事項有:權重可以 BF16 與 FP8 格式下載;授權條款可供閱讀;API 價格已公布;以及阿里巴巴的基準測試聲稱自 8 月下旬以來一直可供重現。第二份清單較長,而這就是整個比較的縮影。

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

這兩者實際上會如何被評估

Ant 發布了一張基準測試卡,將 Ling-3.1-flash 與 GPT-5.6 Sol、Claude Opus 5、Kimi K3、兩個 GLM 變體以及 DeepSeek-V4.1-Flash 進行對比,主要數據為:在 GDPVal-AA v2.1 上獲得 1,673 Elo,在 FrontierSWE 上獲得 75.16,在 HealthBench Professional 上獲得 65.35。在任何人爭論這些數字之前,那張卡上存在兩個問題。第一個是比較集:Ant 選擇的兩個前沿模型都落後一個世代,因為 Claude Opus 5.5 和 GPT-6 Sol 已於 2026 年 9 月 22 日上線,且現在可路由,這意味著該卡是將一個十月模型與七月的前沿進行基準測試,而非當前的前沿。第二個是卡本身的註腳,指出 HealthBench Professional 的結果來自「AQ 環境」,且該模型的醫療保健能力目前只能在 AQ 中體驗——一個沒有任何公開文件定義的環境。一個主要分數若其評估環境未命名,即使在原則上也無法重現。

相較之下,Qwen3.8-Flash 的類似宣稱是在權重已經釋出之後才提出的,而阿里巴巴把自身的定位押在一個任何人都能驗證的主張上:能力來自稀疏比例,而非參數數量。四週的使用並不構成定論,但已足以讓這些宣稱不再毫無爭議——而這正是一個模型所需的有用狀態。

今天到底該拿這個怎麼辦

對開發者而言,實際的分野很簡單。Ling-3.1-flash 並不是你本週就能採用的元件:沒有可呼叫的端點、沒有可託管的權重、沒有可查核的授權條款,也沒有可納入預算的價格。無論最終模型是什麼樣子,現在最有用的做法是設定一個觸發條件——權重發布、授權條款寬鬆、在 FrontierSWE 上有接近 75.16 的獨立評分——然後再回來檢視。前一代自身的歷史顯示,權重可能在公告後兩週就到來,所以那個觸發條件可能很快就會觸發。

Qwen3.8-Flash 已經是一個元件。它以路由模型的形式在我們的目錄上線,採用供應商定價、零加成——路由卡上標示每百萬輸入 $0.15、輸出 $0.47,快取讀取則為 $0.018,與阿里巴巴公布的數字一致,這才是 0% 加成政策在實務上的意義,而不是簡報上的說法。在單一金鑰之下,它與 Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 並列,因此 Ant 所邀請的那種比較——讓候選模型對上當前前沿——只要把設定指向兩條路由就能執行,而不必維護兩套整合,並由自動容錯移轉來應付供應商週末出狀況的時候。這就是架構討論與實際實驗之間的差別。

判決如下,就目前所能給出的而言:Qwen 押下了更大膽的架構賭注,而且有自信早早發表,讓大家把它拆解檢視。螞蟻押的則是更重的注——更多參數、每 token 更多活躍計算量、更長上下文——而到目前為止,發表的是圖表,不是模型。那張圖表看起來不錯。那張圖表也是大家唯一有的東西。

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新