
Claude Haiku 5.5 對上 Ling 3.0 Flash:其中一款模型已經有了後繼者
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
先從那個古怪的事實說起,因為它正該左右這項決定。Ling 3.0 Flash——螞蟻集團以 MIT 授權於 2026 年 8 月釋出的 1,240 億參數開放權重模型——如今已被標記為棄用,並指名 Ling 3.1 Flash 為其後繼者。Claude Haiku 5.5 於 2026 年 10 月 7 日問世,就在本文撰寫的兩天前,而 Anthropic 已承諾在 2027 年 10 月之前不會將其退役。兩款模型落在同一價格帶,其中一款卻已被指向自己的繼任者。
那種不對稱並不是對品質的評斷。Ling 3.0 Flash 是真正快速的模型,擁有開放權重與不尋常的架構,而且在數個面向上徹底勝過 Anthropic 這個層級。但這確實意味著這項比較有其保存期限,而任何把兩者視為同樣耐久的文章,都是在賣你那個會過期的部分。
兩次發布,兩個截然不同的時代
這裡的獨立數據來自 Artificial Analysis;廠商自行提供的說法則來自模型卡與相關文件,並且都有標示。
• 發布 — Ling 3.0 Flash 於 2026 年 8 月 4 日推出,Hugging Face 儲存庫日期為 8 月 2 日。Claude Haiku 5.5 於 2026 年 10 月 7 日。
• 授權條款 — Ling 3.0 Flash 採用 MIT 授權,這大概是開放權重中最寬鬆的了。Claude Haiku 5.5 則是專有軟體,僅提供 API。
• 狀態 — Ling 3.0 Flash 帶有指向 Ling 3.1 Flash 的棄用標記。Claude Haiku 5.5 為現行版本,並附有不退役承諾,保證至 2027 年 10 月。
• 採用 — Ling 3.0 Flash 儲存庫已累積 11,797 次下載與 427 個讚。這是真實但不算大的足跡,也是衡量第三方工具圍繞該模型成長多少的合理指標。
這個時間差的意義,比六週所顯示的還要重大。Ling 3.0 Flash 推出時,其所屬系列早已在演進;Claude Haiku 5.5 則是以該系列最新成員之姿推出,而該系列並未宣布後繼產品。
架構是值得再讀一遍的部分

Ling 3.0 Flash 是一款混合專家模型,總參數達 1,240 億,每個 token 啟用 51 億。這個比例正是整個經濟效益的立論所在:你容納的是大型模型的記憶體佔用,支付的卻是小模型的運算成本。已公布的配置相當具體,而且它並非標準 Transformer 的換皮版本:
• 分層架構 — 35 個 KDA 層,搭配 7 個 Gated MLA 層,比例為 5:1,另加 2 個稠密層。已發表的訓練配方會分階段將上下文視窗從 8K 推進到 32K,再到 256K,而非從頭訓練長視窗。
• 專家 — 512 個路由專家,搭配 1 個共享專家,每個 token 啟用 8 個,隱藏大小為 2,560,專家中間層大小為 768,稠密中間層大小為 6,144。詞彙量為 157,184 個 token。
• 服務 — 這張卡的參考部署使用 SGLang,搭配--context-length 262144,並回報指出,搭配 Mooncake 快取的 HiCache 在長輸入下可將首個 token 的時間縮短 60–80% 或更多。這是廠商回報的數據,且文中已如此註明。
這一切都不是噱頭。5.1B 的活躍參數規模,正是 Ling 3.0 Flash 能以它所達到的吞吐量提供服務的原因;而快取方面的成果,則是它在長提示詞上的首個詞元延遲仍保持堪用的原因。Claude Haiku 5.5 的做法恰恰相反:一個透過 API 提供的單一稠密專有模型,具備 1,000,000 詞元的上下文視窗,並由自適應思考針對每次請求決定要做多少工作。這是對同一個成本問題的兩種連貫解答。
數字,並排

• 獨立評分 — Claude Haiku 5.5 在 Intelligence Index 上獲得 43 分,在 182 個中排名第二。Ling 3.0 Flash 獲得 20 分,在其同級別 65 個中排名第三。
• 每百萬個 token 的輸入價格 — Claude Haiku 5.5 在 100,000 個 token 以內為 $0.10,超過則為 $0.50。Ling 3.0 Flash 為 $0.075,並享 80% 快取折扣。
• 每百萬個輸出詞元的價格 — Claude Haiku 5.5 為 $0.50(最多 100,000 個詞元),超過則為 $2.50。Ling 3.0 Flash 為 $0.22。
• 混合成本 — Ling 3.0 Flash 每百萬個 token 為 $0.05,相較之下,Claude Haiku 5.5 依該排行榜本身的混合計算為 $0.08。
• 速度 — Ling 3.0 Flash 每秒輸出 333.6 個 token,在同級 65 個模型中排名第一,而 Claude Haiku 5.5 為 240.4。首個 token 時間幾乎不相上下:2.50 秒,對比該排行榜對 Anthropic 模型的測量值。
• 上下文 — Ling 3.0 Flash 為 262,000 個 token;Claude Haiku 5.5 為 1,000,000 個。
• 輸入模態 — Ling 3.0 Flash 僅限文字。Claude Haiku 5.5 則支援文字與圖像。
• 權重 — Ling 3.0 Flash 為 MIT 授權且可下載。Claude Haiku 5.5 則為專有授權。
Ling 的賣點在於速度和價格,而非深度。
43 與 20 之間 23 點的 Index 差距是頭條重點,而且它指向的方向與這類比較中的每一次都相同:Claude Haiku 5.5 是較強的模型,而且差距並不小。但 Ling 欄乾淨俐落地贏下兩個列,而這兩者都是會出現在帳單或延遲預算上的類型。
首先,吞吐量。每秒 333.6 個 token 是同級別中榜單上最快的,比 Claude Haiku 5.5 快約 39%,再加上更低的混合成本,這意味著在 Ling 3.0 Flash 上執行大量生成——分類掃描、資料標註、高流量的結構化擷取——可測量地更便宜。當任務定義明確、失敗模式顯而易見時,即使某個模型在 Index 上落後 23 點,仍可能是正確的選擇。
其次,80% 的快取折扣。對於具有龐大穩定前綴與少量變動尾端的工作負載,Ling 3.0 Flash 的有效輸入費率會遠低於標價,而模型卡中的快取設計正是針對這種模式。Claude Haiku 5.5 的 $0.01 快取讀取費率在絕對數字上較便宜,但其快取寫入費用為 $0.125,而且該模型在 100,000 個輸入 token 處設有階梯式定價,Ling 則沒有。
抵銷因素在於冗長度,而這同樣適用於 Anthropic 模型。Artificial Analysis 在 Ling 3.0 Flash 上執行 Index 時,記錄到 2.6 億個輸出 token,而中位數為 1 億,並將其標記為冗長。對於按 token 計價的模型,這會侵蝕費率優勢——輸出費率便宜 2.3 倍,卻部分被一個會寫更多 token 的模型所消耗,實際優勢比模型卡所暗示的更小。
廠商基準測試聲稱什麼,又隱瞞了什麼
Ling 3.0 Flash 自家的卡片報告了一組亮眼的數據:MathArena AIME 2026 為 93.2,HMMT February 2026 為 87,SWE-Bench Pro 為 56.6,SWE-Bench Multilingual Resolved 為 72.4,以及 Humanity's Last Exam 為 22.7。這些全都是廠商自行報告的,這裡沒有一項經過獨立複現。它們也不是在同一套測試框架上與 Claude Haiku 5.5 相較量——Anthropic 公布的是它自己的一組(GDPval-AA v2.1 為 1620,OSWorld 2.1 為 72.4%,Terminal-Bench 4.0 為 39.2%),而兩家廠商跑的是不同的測試套件。唯一共同的量測是獨立排行榜,而在那裡,答案是明確無疑的。
值得與數學成績並列一提的是:那個 22.7 的 HLE 數字,明顯低於 Anthropic 回報 Claude Haiku 5.5 在不使用工具情況下的 45.9。由於測試框架不同,這並非直接可比,但這道差距也不是框架選擇就能解釋得掉的。

後繼者問題
對於任何規劃週期超出當前季度的人來說,這才是決定比較結果的關鍵,而它與基準測試毫無關係。
Ling 3.0 Flash 已被棄用,建議改用 Ling 3.1 Flash。這並不代表它會停止運作——開放權重不會過期,而 MIT 授權也無法被撤銷。但這確實代表它周遭的生態系將會轉移:推論框架的支援、量化版本的發布、錯誤修正與社群工具,全都會跟隨當前模型;而被棄用的模型只能分到這些關注的尾端。如果你今天以 Ling 3.0 Flash 為基礎進行開發,你就是在已凍結、已完結的權重上開發;這對穩定工作負載來說沒問題,但對任何你期望會持續改進的東西來說就很棘手。
Claude Haiku 5.5 擁有一組恰好相反的保證:你拿不到權重,但能得到一個商業利益在於讓模型保持快速、持續修補並持續提供服務的供應商,外加承諾在 2027 年 10 月之前不會退役,以及一旦該期限結束時會公布遷移路徑。
這條路線的兩側,透過一把鑰匙
坦白說,供應情況是這樣:OrcaRouter 並未提供 Ling 3.0 Flash,也未提供 Claude Haiku 5.5。Ling 3.0 Flash 是透過原廠自家的發行管道及數個第三方平台提供;Claude Haiku 5.5 則可在 Anthropic 的 API 與主要雲端平台上取得。
這就留下了兩個模型都點出的路由問題。拿下 43 分、擁有 1M 上下文窗口的 Claude Haiku 5.5 是自然的升級目標;每秒 333 個詞元的 Ling 3.0 Flash 則是自然的批量路線。一條把高流量、規格明確的工作送往快速層,並把任何未通過長度或品質檢查的工作升級到更強模型的路由, 正是路由器所組合出的安排 ——在 OrcaRouter 上, Anthropic 的 Claude Haiku 4.5、Claude Sonnet 5.5 與 Claude Opus 5.5 今天已在目錄中, alongside DeepSeek V4.1 Flash 與 GLM 5.3 Flash 等大型開放權重選項,因此升級路線與批量路線現在都能建構並進行負載測試。一組金鑰, 底層自動容錯移轉,供應商定價以 0% 加成原樣傳遞,因此價格變動當天即時生效。
兩者中的哪一個,以及持續多久?
如果工作是開放式的、如果你需要圖像或百萬 token 的視窗、如果你想要供應商對正常運行時間負責,或者如果你在規劃下一季之後,就選 Claude Haiku 5.5。它領先 23 個指數點,它是現行的而非已棄用的,而且價格差異小到讓分數差距佔據主導。
如果工作負載是大量、規格明確且對延遲敏感的,如果重點在於 MIT 授權或開放權重,或者如果你的帳單實際上主要來自穩定前綴的 80% 快取折扣,那就選 Ling 3.0 Flash。它是更快的模型,也是每 token 更便宜的那個,而且它確實擅長處理 20-Index 模型所能應付的任務。只要心裡有數:你採用的是已完成的模型,而非持續維護的模型,而且它所指向的後繼者已經存在。
