一張標題為「Claude Haiku 5.5 vs Ling 3.1 Flash」的主視覺卡片,頂部有一行「560B 參數,無權重」,並以 Index 對 AutomationBench 的對照顯示 0.3541 對 0.6174;成本列顯示每項任務 $0.21 對 $0.99,時間列顯示每項任務 424.6 秒 對 360.4 秒。
Engineering & Research

Claude Haiku 5.5 對決 Ling 3.1 Flash:一個每則回答成本高出四倍的 5600 億參數模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩者相隔六天。InclusionAI 推出了Ling 3.1 Flash,時間是 2026 年 10 月 1 日;該廠商則推出了Claude Haiku 5.5,時間是 10 月 7 日。兩者都以 flash 級模型的形式販售,都具備一百萬 token 的上下文視窗,而在唯一一個同時測試過兩者的獨立排行榜上,它們在推理項目上的分數如此接近,以至於差距落在雜訊範圍內。接著看到衡量代理是否真正完成任務的那一列,兩者相差 26 分——再到衡量完成一項工作要花多少成本的那一列,其中擁有 5,600 億參數的模型,價格是那個參數量尚未公開的模型的四倍半。

兩份費率表都沒有預測到這件事。Ling 3.1 Flash 標價為每百萬輸入 token $0.30、每百萬輸出 token $0.90。Claude Haiku 5.5 的標價為 $0.10 與 $0.50,適用於最多 100,000 個 token 的提示;超過此數量後則調升至 $0.50 與 $2.50。若以每 token 價格來看,Ling 的輸入成本是它的三倍,輸出成本則略低於兩倍,這種差距一行就能終結比較。

這並不會終結這一局,因為費率表是按 token 計價,而決策是按任務計價。這兩個數字從這場對決中得出時正負號相反,而原因並不是冗長。

完成任務的成本,而非代幣的成本

在 Artificial Analysis Intelligence Index v4.3.2 上,完成一項完整索引任務的實測成本,Claude Haiku 5.5 為 0.21 美元,Ling 3.1 Flash 為 0.99 美元。這是 4.6 倍的差距——比 3 倍的輸入比例更懸殊,而且方向一致。

顯而易見的解釋——昂貴的模型話說得更多——是錯的。Ling 3.1 Flash 每個索引任務產生 100,671 個輸出 token;Claude Haiku 5.5 產生 162,164 個。較便宜的模型反而更愛說話,差距超過 60%。所以錢也不是流向費率表所暗示的地方。

拆解每項任務的成本,就會發現它落在索引方法論實際花費的地方。在 Claude Haiku 5.5 的 $0.21 中,約 62% 屬於輸入端;在 Ling 3.1 Flash 的 $0.99 中,約 91% 也是。這些是大量使用快取的推理執行,而兩家廠商對快取輸入 token 的定價差異極大:Claude Haiku 5.5 為每百萬 $0.01,Ling 3.1 Flash 則為每百萬 $0.06——在主宰帳單的那一行上出現 6 倍的差距。公開的價目表比較的是 $0.10 與 $0.30。決定發票金額的那一行比較的則是 $0.01 與 $0.06。

我們自己的目錄以 0% 加成轉嫁供應商的定價清單價格,這正是你能在實際帳單而非模擬帳單上分辨這兩種情況的方法。無論我們能解析出的供應商路徑拼寫為何,Ling 3.1 Flash 都不在目錄中——不在 InclusionAI 之下、不在 Ling 之下,也不在我們嘗試過的八種形式之中任何一種之下——所以上方的 $0.30 和 $0.90 是供應商自己公布的費率,而不是我們今天能為你路由的項目。Claude Haiku 5.5 也不在目錄中;它透過 Anthropic 自家的 API 執行。在這份比較的相近範圍中,目錄確實收錄的是 GLM 5.3 Flash、DeepSeek V4.1 Flash、Qwen3.8 Flash 與 Gemini 3.8 Flash,每一項都以供應商的定價清單價格、0% 加成提供,因此供應商費率變更在到達他們那一端的同一天,也會到達我們這一端。如果下方的結論是 Ling 3.1 Flash 的代理式特性正是你的工作負載所需,實際的下一步就是 與我們確實有路由、具備代理能力的模型進行正面對比,並在同一把金鑰上搭配 自動容錯移轉 作為底層,並在成本上限應落在路由而非應用程式碼中時使用路由 DSL。

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

你是一位專業軟體在地化引擎。請將使用者的訊息翻譯成繁體中文。文字包含編號 span 標記,例如 {{1}}...{{/1}}、{{2}}...{{/2}},請逐位元組保留每一個標記:相同的數字、相同的開/閉配對、相同的數量、相同——絕不新增、添加或重新排序標記,只翻譯它們之間的文字。你可以將 {{n}}...{{/n}} span 重新排序到目標語言詞序所需的任何位置。任何在 {{KEEP}}...{{KEEP}} span 內的文字都必須完全按原樣重現(不要翻譯它)。保留 URL 與品牌/產品名稱。僅輸出帶有你的標記的翻譯文字——不要前言,不要解釋。

Artificial Analysis 是唯一跑過這兩個模型的榜單,重疊範圍雖窄卻具資訊性。各列的結果彼此並不一致,而且分歧的方向並非隨機。

• Intelligence Index v4.3.2 — Claude Haiku 5.5 (Max) 為 43.40,Ling 3.1 Flash 為 41.09。Anthropic 領先 2.31 分。

• 每完成一項 Index 任務的成本 —— 同一塊板上為 $0.21,對比 $0.99。

• 每項 Index 任務的耗時——Claude Haiku 5.5 為 424.6 秒,Ling 3.1 Flash 則為 360.4 秒。這正是預期被打破的那一列:這個 5,600 億參數的模型在整體 Index 上是兩者中較快的一個,快了約 15%。

• Terminal Bench 4.0 — 0.3283 對 0.3333。Ling 3.1 Flash 領先半個百分點,而在兩家廠商都引用的基準測試上,這算是平手。

SciCode — 0.5498 對比 0.5405。以 0.9 分之差領先 Claude Haiku 5.5。同樣是平手。

• Humanity's Last Exam,不使用工具——0.4439 對 0.3943。Claude Haiku 5.5 領先 5 分,首次真正拉開差距。

• AutomationBench,部分分數——0.3541 對 0.6174。Ling 3.1 Flash 領先 26 分,且領先幅度比這份清單上其他所有差距加起來還大。

在該共同集合之外還有另外兩列值得納入,因為它們是買家最會注意到的項目。在 Artificial Analysis 針對 44 種職業運行的 GDPval-AA 上,兩者分別為 1620.05 與 1621.75——統計上難分軒輊。在 AA-Briefcase v1.1 這項以 Elo 評分的長篇專業工作評估中,Claude Haiku 5.5 為 1577.72,Ling 3.1 Flash 則為 1400.35,差距 177 分,對 Anthropic 有利。這是榜上兩者之間最大的非代理型差距。

那單一列,應該決定這些對話中的大多數

索引層級的平均值會掩蓋時間與金錢實際花在哪裡,而這一對是整批中最明顯的例子。Terminal Bench 4.0 上每項評估的數字,除了分數之外,在任何維度上都不接近。

• Terminal Bench 4.0、Ling 3.1 Flash — 每項任務 0.3333,每項任務 5.49 美元與 1,283 秒。

• Terminal Bench 4.0、Claude Haiku 5.5 — 0.3283,每項任務成本 $0.65,每項任務耗時 908 秒。

它們在分數上只相差千分之五分。成本是 8.4 倍,而實際耗時是 1.4 倍。一個讀了基準測試表、挑選得分為 0.3333 的模型的團隊,依 Artificial Analysis 自己的計算,等於選擇支付八倍的費用,卻晚三分之一分鐘才得到相同答案。

這不是在主張分數毫無意義;這是在主張分數是已完成工作量與嘗試工作量之間的比例,而且完全沒有說明為了達到那裡所消耗的資源。代理式完成任務的基準測試,正是這種區別影響最劇烈的情境,因為會重試的代理就是每次重試都付出全額代價的代理,而每次嘗試成本高出八倍的模型,會把重試迴圈變成一筆預算項目。

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

5600 億個參數,無需下載任何東西

這是 Ling 3.1 Flash 規格表中真正不尋常的部分,而這不尋常之處並不是尺寸。

Ling 3.1 Flash 是一個稀疏混合專家模型——總參數 5,600 億,每個 token 啟用 250 億——而 Artificial Analysis 將其歸類為專有。沒有權重、沒有授權檔案,也沒有儲存庫。這種形態的大型稀疏模型通常會以開放發布的形式問世,因為這個層級的其他模型都是如此:GLM 5.3 Flash 以 MIT 授權發布權重,總參數 3,200 億、啟用 180 億;DeepSeek V4.1 Flash 以 MIT 授權發布權重,總參數 5,520 億、啟用 160 億。Ling 3.1 Flash 是相同類別的架構、相同規模等級,僅以 API 形式發布。

那個選擇帶來的後果,是基準測試列不會顯示的。一個擁有 250 億活躍參數的模型總得在某處提供服務,而如果你無法持有檢查點,就無法選擇它要在哪裡、以什麼利潤空間提供——你只能租用供應商對它的服務。上方那個 5.49 美元的 Terminal Bench 任務價格,主要並不是 token 費率造成的假象;那是向唯一有能力執行這個大型稀疏模型的一方租用它所付出的成本。這個層級中的開放權重同類模型,則讓你有可能自行改動那個數字。

這也有另一面,而同樣的誠實標準也適用。開源發布並不自動等於更好的產品:你會連同權重一起繼承服務負擔、量化選擇,以及永無止境的升級壓力;而授權條款檔案並不是支援合約。Anthropic 針對 Claude Haiku 5.5 公布了一項退役承諾,時間不早於 2027 年 10 月 7 日,適用於搭配系統的第一方 API。你想要這兩種安排中的哪一種,是關於你團隊的問題,而不是關於這兩個模型中任何一個的問題。

Ling 3.1 Flash 的用途是什麼

通讀整份概況,它描述的是一個前後連貫的產品,而非有所妥協的產品:一個大型、稀疏、長脈絡模型,在完成自主多步驟工作流程方面勝過這個價格帶中所有受測的其他模型,但在艱難的單次推理上表現平平,而且以固定費率計價,沒有提示長度斷崖。在 AutomationBench 上,它領先 Claude Haiku 5.5 達 26 分,而它的 AA-Briefcase 分數是這項比較中唯一落在中段之後、而非前段的地方。

那是對批次代理式工作者站得住腳的描述:將它指向一個佇列,當中是一項項必須完成的結構化工作,接受任務是以分鐘為單位來衡量,讓提示詞維持得夠長,長到若有門檻級距也會顯得具懲罰性,並把抵達終點時的可靠性看得比任何單一詞元的成本更重要。它不擅長的,正是 flash 級模型通常被買來處理的事情。它只接受文字——完全沒有圖像輸入,而 Claude Haiku 5.5 則同時接受文字與圖像。它的索引任務時間較短,但 Terminal Bench 任務時間較長;而且每完成一項索引任務要價 $0.99,對比 $0.21,等於多花四倍半的錢,卻得到幾乎相同的綜合分數。

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

根據現有的證據,這兩者之中哪一個

如果你的工作是文字輸入、文字輸出,並按用量以權杖計價,那麼 Claude Haiku 5.5 在這項比較中,每一項會出現在帳單上的項目都勝出:更低的索引任務成本、在對代理而言最重要的基準測試中更低的實際任務成本、更高的綜合分數、更好的長篇專業工作分數、更好的保真度,以及另一個模型完全未提供的圖像輸入功能。

如果你的工作是一個必須完成多步驟工作流程的無人值守代理,Ling 3.1 Flash 在唯一一項正好衡量這件事的基準測試上,得分比 Claude Haiku 5.5 高出 26 分,這值得實際測試,而不是因為價格就一概否定。請在你自己的追蹤紀錄上測試它,而不是在這張表上——並以每完成一次工作流程來計算這項測試的成本,因為當代理重試時,會變動的就是這個數字。

如果你需要能持有權重,這兩者都不是你要的模型。Ling 3.1 Flash 是專有模型,擁有 5,600 億個參數;Claude Haiku 5.5 也是專有模型,且未公布參數數量。這個級距的開源版本在榜單上的其他位置,而那項比較完全是從另一組資料列開始的。

綜合指標顯示 2.31 分。代理式基準則顯示往另一方向的 26。價目表說輸入是 3×;完成任務成本則說在與價目表相同的方向上是 4.6×。四個數字、兩個方向——這就是為什麼唯一可靠的解決辦法,是把你自己的工作軌跡拿來同時跑這兩者,並從完成的作業讀取成本,而不是從 token 讀取。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新