一張標題卡比較 GPT-5.6 Luna 與 Claude Haiku 4.5,顯示 Luna 的智慧指數為 38、100 萬詞元上下文視窗,以及每百萬詞元 0.20 美元輸入與 1.20 美元輸出的定價,對比 Haiku 4.5 的智慧指數 18、20 萬詞元上下文,以及 1.00 美元輸入與 5.00 美元輸出的定價。
Guides & Insights

GPT-5.6 Luna 與 Claude Haiku 4.5:低價層級,兩種截然不同的帳單

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-5.6 LunaClaude Haiku 4.5是兩個不同前沿模型家族中的平價層級,而兩者之間的差距,完全取決於你看的是哪一個數字。就標價而言,這是一面倒的碾壓:每百萬輸入 token 為 $0.20 對 $1.00。但若換成 Artificial Analysis 的「每完成一項 Intelligence Index 任務的成本」,則是 $0.18 對 $0.21——差距約 14%。同樣兩個模型,兩個誠實的答案,而它們之所以出現分歧,正是你在做選擇之前最該弄懂的一件事。

簡短來說:Luna 在帳面規格上是更強大的模型,在吞吐量上也更快,但它會花很長時間思考,並據此計費。Haiku 4.5 較舊、涵蓋範圍較小,而且在單次請求的成本上可預測得多。這兩者哪一項更重要,取決於你的工作負載,而非模型本身。

一覽

供應商OpenAIAnthropic

已發布 — 2026年7月9日 vs 2025年10月15日

上下文視窗 — 100 萬個 token 對比 20 萬個 token

最大輸出 — 128K tokens 對比 64K tokens

輸入 — 文字、圖像和檔案 vs 文字、圖像和 PDF

每百萬個 token 的價格 — 輸入 $0.20 / 輸出 $1.20,對比輸入 $1.00 / 輸出 $5.00

Artificial Analysis Intelligence Index — 38,在 177 個中排名第 4,對比 18,在 200 個中排名第 138(兩者皆為推理配置)

每項 Intelligence Index 任務的成本 — $0.18 對 $0.21

輸出速度 — 109.4 tokens/sec 對比 84.7 tokens/sec

推理控制 — 一個從「無」到「最大」的努力程度調節盤,相較之下,延伸思考須手動啟用,且沒有努力參數

可靠的知識截止時間 — 2026 年 2 月對比 2025 年 2 月(訓練資料截至 2025 年 7 月)

退休承諾 — 未公布 vs 不早於 2026 年 10 月 15 日

GPT-5.6 Luna 真正勝出之處

Screenshot of an Artificial Analysis head-to-head between GPT-5.6 Luna (max) and Claude 4.5 Haiku (Reasoning). The Intelligence Index row reads 38 against 18, AA-Briefcase 1339 against 614, GDPval-AA v2 1489 against 854, AutomationBench-AA 50% against 3%, Terminal-Bench v4.0 12% against 0%, SciCode 54% against 42%, Humanity's Last Exam 39% against 10%, GDPpdf 24% against 4%, CritPt 21% against 0%, AA-Omniscience -10 against -4, and AA-LCR v1.1 84% against 74%. The Cost section shows a blended price per 1M tokens of $0.174 against $0.77.

能力方面,差距懸殊。智能指數 38 對 18,這絕非勢均力敵。在 Artificial Analysis 依據推理、知識、數學與程式設計評測所建構的綜合指標上,Luna 的排名高於 Haiku,而且它還是每 token 成本較低的模型。若有人上次是在九月之前的指數上比較這兩個系列——當時 Luna 的分數為 51 和 52——就應留意,整個量表已在 2026 年 9 月重新評分,而 Luna 的優勢在重新評分後依然保持。

上下文,五倍之多。1M token 的視窗對上 200K,本身就能決定一整類工作是否可行:整個儲存庫的完整處理、長篇文件集、以及在 Haiku 上非得先摘要不可的冗長代理工作紀錄。如果你的應用程式取決於它必須承載多少上下文,那麼比較到此為止。

輸出餘裕加倍。128K 的最大輸出詞元相較於 64K,對於長篇生成,以及對於會回傳結構化計畫、而非單行答案的代理迴圈而言,都至關重要。

吞吐量。就串流介面而言,每秒 109.4 個輸出 token 對上 84.7 確實是實質的差距,不過這與回應速度並非同一回事——請參閱下方的延遲一節。

價格,就在標籤上。輸入便宜五倍、輸出大約便宜四倍,這不是四捨五入的誤差;而對短輸出的工作來說,這就是整個決策。

Claude Haiku 4.5 仍佔有一席之地的場景

可預測的成本。Haiku 4.5 的推理是需要手動開啟的延伸思考。關閉時,它會直接回答,計費也可預測。GPT-5.6 Luna 的努力程度旋鈕最高可調到最大值,而每往上調一級,就代表以輸出費率產生更多輸出權杖。對於想要事先訂出成本上限的團隊來說,即使 Haiku 的標價較高,還是會覺得它更容易估算。

非推理設定的執行成本確實相當低廉。Artificial Analysis 給予 Claude 4.5 Haiku 非推理設定的 Intelligence Index 分數為 15,且未公布每項任務的成本數據,而對於要求僅是「正確解析這些內容」的工作而言,它算是合理的選擇——意圖分類、欄位擷取、路由決策、審核分流。在這類任務上,15 與 38 之間的指數差距多半無關緊要,因為這兩個模型都沒有被要求思考。

快取與批次折扣已相當成熟。Haiku 4.5 提供 90% 的提示快取讀取折扣,以及 Batch API 的 50% 折扣。Luna 的快取經濟效益與其相當,因此這更接近平手,而非優勢——但若你的流程已經透過 Anthropic 的工具進行批次處理,那麼從 Haiku 遷移的成本就是一項實際成本,而且它不會出現在任何基準測試上。

實戰營運紀錄Haiku 4.5 自 2025 年 10 月起便已投入正式環境運作,並公開承諾最快也要到 2026 年 10 月 15 日才會退役。Luna 則問世僅兩個月。對於模型只是其中一個細節、而非產品本身的工作負載來說,十一個月的正式運作歷史,具有某種基準測試無法表達的價值。

在唯一衡量真實性的那條軸線上,它是更真實的模型。Artificial Analysis 的正面對決顯示,Luna 幾乎在每一項能力上都領先——AA-Briefcase 1,339 對 614,GDPval-AA v2 1,489 對 854,AutomationBench-AA 50% 對 3%,Humanity's Last Exam 39% 對 10%,GDPpdf 24% 對 4%。唯一的例外是 AA-Omniscience,它會懲罰在知識題上自信地給出錯誤答案:Luna 在該項得分為 -10,而 Haiku 為 -4。負分意味著幻覺懲罰超過了準確度加分,而 Luna 所受的懲罰更大。較高的綜合指數並不等同於更可靠的答案,而在唯一一項專為區分這兩者而設計的評測上,較舊的模型表現更好。

真實工作負載下的成本計算

假設有一條每個月消耗 1 億個輸入 token,並產生 2,000 萬個輸出 token 的管線。

GPT-5.6 Luna — 100 × $0.20 = $20,加上 20 × $1.20 = $24,每月總計 $44。

Claude Haiku 4.5 — 100 × $1.00 = $100,加上 20 × $5.00 = $100。每月總計 $200。

在那些比例下,Luna 大約便宜 4.5 倍,而這是大多數比較所公布的計算方式。現在改變一個假設。如果把 Luna 的推理強度調高,它的輸出 token 就會增加,而輸出是昂貴的那一側——以 $1.20 計算,其成本是輸入的六倍。把 Luna 推到在相同工作量下輸出 150M 個輸出 token 的程度,就像它在 Artificial Analysis 的評估集上那樣,那麼 $44 就會輕鬆變成超過 $180。4.5 倍的優勢會崩塌、趨近持平。

這堂課的啟示並不是 Luna 很貴,而是 Luna 的價格優勢取決於它有多話多,而那是你能控制的參數。在擷取與分類這類任務上把推理調低,折扣就是真的。若什麼都開到最高,你等於用一個已不再近似其標價的價格,買下了能力更強的模型。

延遲,以及一個你不該信任的數字

這兩個模型已公布的首次詞元(time-to-first-token)數據幾乎毫無用處,而箇中原因值得深入了解。在 Artificial Analysis 上,這兩個模型的推理配置都顯示出數十秒甚至數百秒的首次詞元延遲,因為測試框架要等到模型完成推理後才會輸出詞元。這個數字衡量的是評估設置,而非模型的回應速度。

路由遙測是更好的來源,因為它衡量的是正式環境中的模型。OrcaRouter 自家的數據顯示,GPT-5.6 Luna 的首個 token 中位數為 1.83 秒,第 95 百分位數為 10.00 秒;相較之下,Claude Haiku 4.5 的中位數為 3.81 秒,第 95 百分位數為 9.47 秒。正確解讀的話,這表示兩者比排行榜所顯示的更接近:Luna 在典型請求上勝出,而兩者的尾端表現相差約在半秒內。如果你關心的是最糟情況而非平均值,兩者之間幾乎沒有差別。

該選哪一個

選擇 GPT-5.6 Luna如果你要處理長上下文、如果這項任務能受益於真正的推理、如果輸出很長或具有結構,或者你想在價格區間的最低端取得最強大的模型,就選它。如果你技術堆疊的其他部分本來就採用 Open​AI 系列的行為模式,它也是更自然的選擇。

那就選擇 Claude Haiku 4.5如果你的工作是短輸出、高流量,如果你需要一個能在請求執行前就明確說出的成本上限,如果你的管線已經圍繞 Anth​hropic 的批次處理與快取機制打造,或者比起才問世兩個月的模型,你更重視具備實際生產歷程與公開生命週期的模型,

兩者都不要選——如果一項任務靠小型推理模型或微調過的分類器就能勝任。這兩個層級所吸收的流量中,有相當大一部分是分類與擷取工作,用更專精的模型來跑會更便宜;而最便宜的模型,永遠是你不需要的那一個。

在同一組金鑰上執行兩者

Screenshot of the OrcaRouter model page for Claude Haiku 4.5, showing the model identifier anthropic/claude-haiku-4.5, a release date of 2025-10-15, a 200K-token context window, 64K maximum output, input pricing of $1.00 per million tokens, output pricing of $5.00, a median time to first token of 3.81 seconds and a 95th percentile of 9.47 seconds.

一旦兩者都能透過單一端點存取,這種對決就不再是二選一。在 OrcaRouter 上,Claude Haiku 4.5 與 GPT-5.6 Luna 位於同一個相容 OpenAI 的基礎 URL 之後——一個 API 就能存取 200+ 個模型,一組金鑰、一行帳單、無須第二份合約,而且除了模型識別碼之外無須變更程式碼。對於你尚未確定的層級選擇,這能把遷移變成一個設定值。

這裡有兩項功能真正發揮作用。跨供應商的自動容錯移轉,意味著低成本層級能承載正式環境流量,而不必依賴單一供應商——當模型便宜到讓你每小時送出數千次呼叫,而非只送一次重要呼叫時,這就很有用。而路由 DSL 則讓你用多個模型組合成一次呼叫:把大多數單純的請求路由到 Luna,將其餘的升級至 GPT-5.6 Terra,並把 Haiku 4.5 留在池中作為備援,以便在你想要第二家供應商的答案而非重試時使用。

在把 GPT-5.6 Luna 或 Claude Haiku 4.5 其中任何一個投入正式生產路徑之前,請先查核兩者即時的每詞元(per-token)費率——兩者的費率都是以 0% 加成原樣轉嫁,因此供應商一調價、當天就會跟著變動,而第三方價格追蹤工具往往會落後數天到數週。

真正值得回答的問題

GPT-5.6 Luna 真的比 Claude Haiku 4.5 便宜五倍嗎?就輸入 token 而言,是的——0.20 美元對上 1.00 美元。但就完成同一項受評估任務的成本而言,並非如此:0.18 美元對上 0.21 美元。這兩種說法之間的落差,來自 Luna 的冗長。完成同樣的工作,它產生的輸出 token 大約是 Haiku 的兩倍,而輸出 token 的成本是輸入 token 的六倍。面對簡短的回答時,標價大致上還算誠實;但碰上推理繁重的工作就不是了。

我能在這兩者上用同樣的方式調整成本嗎?不行,而這正是兩者之間最常被忽略的差異。Luna 提供了一個推理強度調整鈕,設定範圍從 none 到 max,因此每次請求的成本與品質取捨都是明確的。Haiku 4.5 的擴展思考只有兩種情況:啟用(並搭配 token 預算),或是未啟用——沒有 effort 參數。如果每次请求的成本控制對你而言很重要,這兩者之中只有一個能給你這根槓桿。

那如果是每天要處理數百萬次呼叫的高流量分類器呢?這兩個模型都不需要為此進行推理。以關閉擴展思考的方式執行 Haiku 4.5,或將 Luna 的 effort 設為 none 來執行,然後比較延遲與輸出長度,而不是比較綜合指數——到了那個時候,相關問題會是第一個 token 多快送達,以及答案會用掉多少 token,而智慧基準測試已無法區分兩者。

A two-column comparison scoreboard for GPT-5.6 Luna and Claude Haiku 4.5. Luna's column reads Intelligence Index 38, context window 1M tokens, price $0.20/$1.20, cost per index task $0.18, output speed 109.4 tokens per second, reasoning control an effort dial from none to max. Haiku 4.5's column reads Intelligence Index 18, context window 200K tokens, price $1.00/$5.00, cost per index task $0.21, output speed 84.7 tokens per second, reasoning control extended thinking on or off.

哪一個一年後還會在這裡?Claude Haiku 4.5 附有一項公開承諾:在 2026 年 10 月 15 日之前不會退役。Open​AI 並未公布 GPT-5.6 Luna 的對等日期,而且 GPT-5.6 系列之上已經有更新的世代 GPT-6 Astra。這兩點都不是避開 Luna 的理由,但如果你的路線圖假設的是十一個月的規劃期,那就是把模型識別碼留在設定中、而非寫死在程式碼裡的理由。

的即時每 token 費率GPT-5.6 Luna,在同一組金鑰上以 0% 加價原樣傳遞,且無須另立第二個計費關係。

即時每 Token 費率,適用於 Claude Haiku 4.5,並於同一端點提供,因此無需第二份合約即可比較這兩個層級。