
Ling-3.1-flash 對比 Qwen3.8-Flash:打造快速層級的兩種方式,而只有一種真正推出
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 262 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
今年秋天,兩家中國實驗室著眼於同一個問題——如何打造一個便宜、快速,且好到足以放進代理迴圈裡的模型——卻得出截然相反的答案。螞蟻集團於 2026 年 9 月 30 日發表的 Ling-3.1-flash,是約 5,600 億參數的混合專家模型,每個 token 啟用約 250 億個參數,上下文視窗號稱最高達 100 萬個 token,並表示有意「很快」開源。阿里巴巴 Qwen 團隊於 2026 年 8 月 26 日發布的 Qwen3.8-Flash,則是 1,250 億參數的多模態混合專家模型,每個 token 啟用約 60 億個參數,權重已以 Qwen3.8-Flash-Next 之名在 Hugging Face 上發布,是正式上線於 QwenCloud API 的生產模型,每百萬輸入 token 收費 0.15 美元、每百萬輸出 token 收費 0.47 美元,並在 SGLang 中首日支援。一家實驗室把規模做大並對外宣布。另一家則把規模縮小並實際出貨。這樣的差異,比兩家實驗室所發布的任何基準測試結果都更具啟發性。
這也是為什麼這項比較必須謹慎解讀。Ling-3.1-flash 沒有權重、沒有授權條款、沒有模型卡、沒有 API 價格,也沒有獨立評測;所有已公開的紀錄就只有一篇發布公告、一張廠商自家的基準測試圖表,以及它在 Ant 自家 Ling Studio 產品中的一個位置。Qwen3.8-Flash 這些全都有,而且還早了四週被非阿里巴巴員工實際運行。比較架構上的選擇是公允的;比較能力則還言之過早。
這兩個設計決策,以及它們為何分歧
Qwen 的賭注是:快速層級在結構上應該與旗艦模型截然不同,而不只是規模比它小。Qwen3.8-Flash 在其 1,250 億個參數中只啟用 60 億個——稀疏度約 95%——而它的能力來自運算資源被導向何處,而非來自原始的廣度。阿里巴巴已明確表示,其底層架構結合了 Gated DeltaNet、Qwen Sparse Attention 與 N-gram 嵌入表,是 Qwen4 世代的早期預覽,刻意提早發布,好讓推論引擎、量化工具與部署模式能在昂貴的模型建構於其上之前先行成熟。結果是一個在設計上就做到每 token 成本低廉的模型:每個 token 只需約 60 億參數的運算量,而阿里巴巴設定的價格是每百萬 token 輸入 0.15 美元、輸出 0.47 美元。
就目前公告所披露的內容來看,Ant 的押注更接近搭配極長上下文的傳統擴展路線。Ling-3.1-flash 維持了很高的啟用參數比例——每 token 約 5,600 億個參數中有 250 億個處於啟用狀態,也就是大約每二十二個中有一個——並宣稱具備最多 100 萬 token 的上下文窗口,是前一代 Ling 所提供的四倍。Ling Studio 應用程式將其描述為專為「通用型代理、搜尋、例行辦公工作,以及軟體/程式碼開發」而打造,這屬於快速層級的定位,但其參數經濟學卻屬於一個重得多的模型。在相同輸入下,一個 token 經過 250 億個啟用參數的運算成本,大約是經過 60 億個參數的四倍,而這還不涉及任何定價決策。
兩種做法都沒有錯,也都是對「是什麼限制了便宜模型」這個問題站得住腳的答案。Qwen 賭的是稀疏化與全新注意力堆疊就是上限。Ant 賭的是上限在於脈絡與世界知識,而且它負擔得起運算。對讀者而言,區分兩者的不是設計哲學,而是交付方式:一個是你能下載並實測的設計,另一個是你只能讀到介紹的設計。

每一個要你付出什麼代價,以及那在實務上代表什麼意思
價格差距並不細微,也稱不上接近。Qwen3.8-Flash 公布的价格為每百萬輸入 token 0.15 美元、每百萬輸出 0.47 美元,以及每百萬快取讀取 0.018 美元——阿里巴巴的公告、供應商的正式上線模型卡,以及我們所提供服務的路由模型頁面上都是同樣的數字,當你對照三個來源查核時,這就是 0% 加價直通該有的樣子。Ant 完全沒有公布 Ling-3.1-flash 的任何費率——沒有 API 價格、沒有快取折扣,也沒有任何可比的資訊。Ling 系列唯一公布的數字是上一代的,其定價為每百萬輸入 0.075 美元、輸出 0.22 美元,約為 Qwen 輸入費率的一半,也不到其輸出費率的一半。如果新的 Ling 層級定價接近舊版的水準,帳面上它會比 Qwen3.8-Flash 更便宜;但如果定價接近其 25B 活躍參數所暗示的算力成本,就不會如此。無論哪種說法都只是猜測,因為那個數字根本不存在。
在上下文方面,Ling 的說法確實更大。螞蟻為 Ling-3.1-flash 標稱最高可達 100 萬個 token;Qwen3.8-Flash 在正式環境 API 上預設搭載 100 萬 token 的上下文,開放權重則具備 262,144 token 的原生視窗,且可延伸。Ling 的數字上有兩點但書,而且兩者都尚未塵埃落定。首先,「最高可達 100 萬」是規格,不是實測——沒有人發表過這款模型的長上下文檢索行為,因為螞蟻以外的任何人都無法呼叫它。其次,前一世代 Ling 在宣傳視窗與其背後的架構說法之間,也存在完全相同的落差,而答案直到權重、格式與上下文限制終於公布時才揭曉。頭條宣傳的 100 萬是個承諾。Qwen3.8-Flash 上的 100 萬則是實際提供的預設值,你可以拿螞蟻的說法與之對照。
為什麼「preview」是這件事其中一邊誠實的字眼
阿里巴巴自己對 Qwen3.8-Flash 的定位是:它是一款以正式產品名稱發布的架構預覽版——開放權重之所以帶有「Next」後綴,正是為了避免有人把這個原型與經過調校的服務模型混為一談。這樣的定位並非靠行銷宣傳,而是由後續事件所印證:SGLang 在 Qwen3.8-Flash-Next 發布當天就推出首日支援,該模型也同時完成了 Transformers、vLLM 與 TokenSpeed 的配置,此後權重更被各大量化社群採用。版本很快就不足為奇,而這正是一款正式推出模型應有的樣貌。
Ant 的公告也有著相同的模式,只是早了一步:在發布前先公布規格,並明確表示該模型很快就會開源。這是一種合理的發布方式——Ling-3.0-flash 在七月正是循著這條路徑,而權重則在大約兩週後的 8 月 7 日以 MIT 授權釋出。但這兩個專案今日的狀態無法相提並論,再多的圖表解讀也無法彌補這個差距。值得具體說明的是,局外人能為兩者各自帶來什麼。
今天對 Ling-3.1-flash 而言,可獨立查證的事項有:公告確實存在,日期為 9 月 30 日;參數、活躍參數與上下文數字皆出自螞蟻自身;該模型出現在螞蟻的 Ling Studio 產品中;以及尚未發布任何權重、授權條款或模型卡。對 Qwen3.8-Flash 而言,可獨立查證的事項有:權重可以 BF16 與 FP8 格式下載;授權條款可供閱讀;API 價格已公布;以及阿里巴巴的基準測試聲稱自 8 月下旬以來一直可供重現。第二份清單較長,而這就是整個比較的縮影。

這兩者實際上會如何被評估
Ant 發布了一張基準測試卡,將 Ling-3.1-flash 與 GPT-5.6 Sol、Claude Opus 5、Kimi K3、兩個 GLM 變體以及 DeepSeek-V4.1-Flash 進行對比,主要數據為:在 GDPVal-AA v2.1 上獲得 1,673 Elo,在 FrontierSWE 上獲得 75.16,在 HealthBench Professional 上獲得 65.35。在任何人爭論這些數字之前,那張卡上存在兩個問題。第一個是比較集:Ant 選擇的兩個前沿模型都落後一個世代,因為 Claude Opus 5.5 和 GPT-6 Sol 已於 2026 年 9 月 22 日上線,且現在可路由,這意味著該卡是將一個十月模型與七月的前沿進行基準測試,而非當前的前沿。第二個是卡本身的註腳,指出 HealthBench Professional 的結果來自「AQ 環境」,且該模型的醫療保健能力目前只能在 AQ 中體驗——一個沒有任何公開文件定義的環境。一個主要分數若其評估環境未命名,即使在原則上也無法重現。
相較之下,Qwen3.8-Flash 的類似宣稱是在權重已經釋出之後才提出的,而阿里巴巴把自身的定位押在一個任何人都能驗證的主張上:能力來自稀疏比例,而非參數數量。四週的使用並不構成定論,但已足以讓這些宣稱不再毫無爭議——而這正是一個模型所需的有用狀態。
今天到底該拿這個怎麼辦
對開發者而言,實際的分野很簡單。Ling-3.1-flash 並不是你本週就能採用的元件:沒有可呼叫的端點、沒有可託管的權重、沒有可查核的授權條款,也沒有可納入預算的價格。無論最終模型是什麼樣子,現在最有用的做法是設定一個觸發條件——權重發布、授權條款寬鬆、在 FrontierSWE 上有接近 75.16 的獨立評分——然後再回來檢視。前一代自身的歷史顯示,權重可能在公告後兩週就到來,所以那個觸發條件可能很快就會觸發。
Qwen3.8-Flash 已經是一個元件。它以路由模型的形式在我們的目錄上線,採用供應商定價、零加成——路由卡上標示每百萬輸入 $0.15、輸出 $0.47,快取讀取則為 $0.018,與阿里巴巴公布的數字一致,這才是 0% 加成政策在實務上的意義,而不是簡報上的說法。在單一金鑰之下,它與 Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 並列,因此 Ant 所邀請的那種比較——讓候選模型對上當前前沿——只要把設定指向兩條路由就能執行,而不必維護兩套整合,並由自動容錯移轉來應付供應商週末出狀況的時候。這就是架構討論與實際實驗之間的差別。
判決如下,就目前所能給出的而言:Qwen 押下了更大膽的架構賭注,而且有自信早早發表,讓大家把它拆解檢視。螞蟻押的則是更重的注——更多參數、每 token 更多活躍計算量、更長上下文——而到目前為止,發表的是圖表,不是模型。那張圖表看起來不錯。那張圖表也是大家唯一有的東西。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
