一張為「Claude Haiku 5.5 對決 Ling 3.0 Flash」生成的主視覺卡片,內含兩個由一條細分隔線隔開的面板:左側標示「Claude Haiku 5.5」,帶有「指數 43」與「目前」;右側標示「Ling 3.0 Flash」,帶有「指數 20」與「已棄用」。頁尾一行寫著「分數依 Artificial Analysis 計算。」OrcaRouter 標誌合成於右下角。
Engineering & Research

Claude Haiku 5.5 對上 Ling 3.0 Flash:其中一款模型已經有了後繼者

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

先從那個古怪的事實說起,因為它正該左右這項決定。Ling 3.0 Flash——螞蟻集團以 MIT 授權於 2026 年 8 月釋出的 1,240 億參數開放權重模型——如今已被標記為棄用,並指名 Ling 3.1 Flash 為其後繼者。Claude Haiku 5.5 於 2026 年 10 月 7 日問世,就在本文撰寫的兩天前,而 A​nthropic 已承諾在 2027 年 10 月之前不會將其退役。兩款模型落在同一價格帶,其中一款卻已被指向自己的繼任者。

那種不對稱並不是對品質的評斷。Ling 3.0 Flash 是真正快速的模型,擁有開放權重與不尋常的架構,而且在數個面向上徹底勝過 Anthropic 這個層級。但這確實意味著這項比較有其保存期限,而任何把兩者視為同樣耐久的文章,都是在賣你那個會過期的部分。

兩次發布,兩個截然不同的時代

這裡的獨立數據來自 Artificial Analysis;廠商自行提供的說法則來自模型卡與相關文件,並且都有標示。

• 發布 — Ling 3.0 Flash 於 2026 年 8 月 4 日推出,Hugging Face 儲存庫日期為 8 月 2 日。Claude Haiku 5.5 於 2026 年 10 月 7 日。

• 授權條款 — Ling 3.0 Flash 採用 MIT 授權,這大概是開放權重中最寬鬆的了。Claude Haiku 5.5 則是專有軟體,僅提供 API。

• 狀態 — Ling 3.0 Flash 帶有指向 Ling 3.1 Flash 的棄用標記。Claude Haiku 5.5 為現行版本,並附有不退役承諾,保證至 2027 年 10 月。

• 採用 — Ling 3.0 Flash 儲存庫已累積 11,797 次下載與 427 個讚。這是真實但不算大的足跡,也是衡量第三方工具圍繞該模型成長多少的合理指標。

這個時間差的意義,比六週所顯示的還要重大。Ling 3.0 Flash 推出時,其所屬系列早已在演進;Claude Haiku 5.5 則是以該系列最新成員之姿推出,而該系列並未宣布後繼產品。

架構是值得再讀一遍的部分

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash 是一款混合專家模型,總參數達 1,240 億,每個 token 啟用 51 億。這個比例正是整個經濟效益的立論所在:你容納的是大型模型的記憶體佔用,支付的卻是小模型的運算成本。已公布的配置相當具體,而且它並非標準 Transformer 的換皮版本:

• 分層架構 — 35 個 KDA 層,搭配 7 個 Gated MLA 層,比例為 5:1,另加 2 個稠密層。已發表的訓練配方會分階段將上下文視窗從 8K 推進到 32K,再到 256K,而非從頭訓練長視窗。

• 專家 — 512 個路由專家,搭配 1 個共享專家,每個 token 啟用 8 個,隱藏大小為 2,560,專家中間層大小為 768,稠密中間層大小為 6,144。詞彙量為 157,184 個 token。

• 服務 — 這張卡的參考部署使用 SGLang,搭配--context-length 262144,並回報指出,搭配 Mooncake 快取的 HiCache 在長輸入下可將首個 token 的時間縮短 60–80% 或更多。這是廠商回報的數據,且文中已如此註明。

這一切都不是噱頭。5.1B 的活躍參數規模,正是 Ling 3.0 Flash 能以它所達到的吞吐量提供服務的原因;而快取方面的成果,則是它在長提示詞上的首個詞元延遲仍保持堪用的原因。Claude Haiku 5.5 的做法恰恰相反:一個透過 API 提供的單一稠密專有模型,具備 1,000,000 詞元的上下文視窗,並由自適應思考針對每次請求決定要做多少工作。這是對同一個成本問題的兩種連貫解答。

數字,並排

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• 獨立評分 — Claude Haiku 5.5 在 Intelligence Index 上獲得 43 分,在 182 個中排名第二。Ling 3.0 Flash 獲得 20 分,在其同級別 65 個中排名第三。

• 每百萬個 token 的輸入價格 — Claude Haiku 5.5 在 100,000 個 token 以內為 $0.10,超過則為 $0.50。Ling 3.0 Flash 為 $0.075,並享 80% 快取折扣。

• 每百萬個輸出詞元的價格 — Claude Haiku 5.5 為 $0.50(最多 100,000 個詞元),超過則為 $2.50。Ling 3.0 Flash 為 $0.22。

• 混合成本 — Ling 3.0 Flash 每百萬個 token 為 $0.05,相較之下,Claude Haiku 5.5 依該排行榜本身的混合計算為 $0.08。

• 速度 — Ling 3.0 Flash 每秒輸出 333.6 個 token,在同級 65 個模型中排名第一,而 Claude Haiku 5.5 為 240.4。首個 token 時間幾乎不相上下:2.50 秒,對比該排行榜對 Anthropic 模型的測量值。

• 上下文 — Ling 3.0 Flash 為 262,000 個 token;Claude Haiku 5.5 為 1,000,000 個。

• 輸入模態 — Ling 3.0 Flash 僅限文字。Claude Haiku 5.5 則支援文字與圖像。

• 權重 — Ling 3.0 Flash 為 MIT 授權且可下載。Claude Haiku 5.5 則為專有授權。

Ling 的賣點在於速度和價格,而非深度。

43 與 20 之間 23 點的 Index 差距是頭條重點,而且它指向的方向與這類比較中的每一次都相同:Claude Haiku 5.5 是較強的模型,而且差距並不小。但 Ling 欄乾淨俐落地贏下兩個列,而這兩者都是會出現在帳單或延遲預算上的類型。

首先,吞吐量。每秒 333.6 個 token 是同級別中榜單上最快的,比 Claude Haiku 5.5 快約 39%,再加上更低的混合成本,這意味著在 Ling 3.0 Flash 上執行大量生成——分類掃描、資料標註、高流量的結構化擷取——可測量地更便宜。當任務定義明確、失敗模式顯而易見時,即使某個模型在 Index 上落後 23 點,仍可能是正確的選擇。

其次,80% 的快取折扣。對於具有龐大穩定前綴與少量變動尾端的工作負載,Ling 3.0 Flash 的有效輸入費率會遠低於標價,而模型卡中的快取設計正是針對這種模式。Claude Haiku 5.5 的 $0.01 快取讀取費率在絕對數字上較便宜,但其快取寫入費用為 $0.125,而且該模型在 100,000 個輸入 token 處設有階梯式定價,Ling 則沒有。

抵銷因素在於冗長度,而這同樣適用於 Anthropic 模型。Artificial Analysis 在 Ling 3.0 Flash 上執行 Index 時,記錄到 2.6 億個輸出 token,而中位數為 1 億,並將其標記為冗長。對於按 token 計價的模型,這會侵蝕費率優勢——輸出費率便宜 2.3 倍,卻部分被一個會寫更多 token 的模型所消耗,實際優勢比模型卡所暗示的更小。

廠商基準測試聲稱什麼,又隱瞞了什麼

Ling 3.0 Flash 自家的卡片報告了一組亮眼的數據:MathArena AIME 2026 為 93.2,HMMT February 2026 為 87,SWE-Bench Pro 為 56.6,SWE-Bench Multilingual Resolved 為 72.4,以及 Humanity's Last Exam 為 22.7。這些全都是廠商自行報告的,這裡沒有一項經過獨立複現。它們也不是在同一套測試框架上與 Claude Haiku 5.5 相較量——Anthropic 公布的是它自己的一組(GDPval-AA v2.1 為 1620,OSWorld 2.1 為 72.4%,Terminal-Bench 4.0 為 39.2%),而兩家廠商跑的是不同的測試套件。唯一共同的量測是獨立排行榜,而在那裡,答案是明確無疑的。

值得與數學成績並列一提的是:那個 22.7 的 HLE 數字,明顯低於 A​nthropic 回報 Claude Haiku 5.5 在不使用工具情況下的 45.9。由於測試框架不同,這並非直接可比,但這道差距也不是框架選擇就能解釋得掉的。

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

後繼者問題

對於任何規劃週期超出當前季度的人來說,這才是決定比較結果的關鍵,而它與基準測試毫無關係。

Ling 3.0 Flash 已被棄用,建議改用 Ling 3.1 Flash。這並不代表它會停止運作——開放權重不會過期,而 MIT 授權也無法被撤銷。但這確實代表它周遭的生態系將會轉移:推論框架的支援、量化版本的發布、錯誤修正與社群工具,全都會跟隨當前模型;而被棄用的模型只能分到這些關注的尾端。如果你今天以 Ling 3.0 Flash 為基礎進行開發,你就是在已凍結、已完結的權重上開發;這對穩定工作負載來說沒問題,但對任何你期望會持續改進的東西來說就很棘手。

Claude Haiku 5.5 擁有一組恰好相反的保證:你拿不到權重,但能得到一個商業利益在於讓模型保持快速、持續修補並持續提供服務的供應商,外加承諾在 2027 年 10 月之前不會退役,以及一旦該期限結束時會公布遷移路徑。

這條路線的兩側,透過一把鑰匙

坦白說,供應情況是這樣:OrcaRouter 並未提供 Ling 3.0 Flash,也未提供 Claude Haiku 5.5。Ling 3.0 Flash 是透過原廠自家的發行管道及數個第三方平台提供;Claude Haiku 5.5 則可在 Anthropic 的 API 與主要雲端平台上取得。

這就留下了兩個模型都點出的路由問題。拿下 43 分、擁有 1M 上下文窗口的 Claude Haiku 5.5 是自然的升級目標;每秒 333 個詞元的 Ling 3.0 Flash 則是自然的批量路線。一條把高流量、規格明確的工作送往快速層,並把任何未通過長度或品質檢查的工作升級到更強模型的路由, 正是路由器所組合出的安排 ——在 OrcaRouter 上, Anthropic 的 Claude Haiku 4.5、Claude Sonnet 5.5 與 Claude Opus 5.5 今天已在目錄中, alongside DeepSeek V4.1 Flash 與 GLM 5.3 Flash 等大型開放權重選項,因此升級路線與批量路線現在都能建構並進行負載測試。一組金鑰, 底層自動容錯移轉,供應商定價以 0% 加成原樣傳遞,因此價格變動當天即時生效。

兩者中的哪一個,以及持續多久?

如果工作是開放式的、如果你需要圖像或百萬 token 的視窗、如果你想要供應商對正常運行時間負責,或者如果你在規劃下一季之後,就選 Claude Haiku 5.5。它領先 23 個指數點,它是現行的而非已棄用的,而且價格差異小到讓分數差距佔據主導。

如果工作負載是大量、規格明確且對延遲敏感的,如果重點在於 MIT 授權或開放權重,或者如果你的帳單實際上主要來自穩定前綴的 80% 快取折扣,那就選 Ling 3.0 Flash。它是更快的模型,也是每 token 更便宜的那個,而且它確實擅長處理 20-Index 模型所能應付的任務。只要心裡有數:你採用的是已完成的模型,而非持續維護的模型,而且它所指向的後繼者已經存在。