
GPT-5.6 Luna 與 Claude Haiku 4.5:低價層級,兩種截然不同的帳單
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
GPT-5.6 Luna 與 Claude Haiku 4.5是兩個不同前沿模型家族中的平價層級,而兩者之間的差距,完全取決於你看的是哪一個數字。就標價而言,這是一面倒的碾壓:每百萬輸入 token 為 $0.20 對 $1.00。但若換成 Artificial Analysis 的「每完成一項 Intelligence Index 任務的成本」,則是 $0.18 對 $0.21——差距約 14%。同樣兩個模型,兩個誠實的答案,而它們之所以出現分歧,正是你在做選擇之前最該弄懂的一件事。
簡短來說:Luna 在帳面規格上是更強大的模型,在吞吐量上也更快,但它會花很長時間思考,並據此計費。Haiku 4.5 較舊、涵蓋範圍較小,而且在單次請求的成本上可預測得多。這兩者哪一項更重要,取決於你的工作負載,而非模型本身。
一覽
• 已發布 — 2026年7月9日 vs 2025年10月15日
• 上下文視窗 — 100 萬個 token 對比 20 萬個 token
• 最大輸出 — 128K tokens 對比 64K tokens
• 輸入 — 文字、圖像和檔案 vs 文字、圖像和 PDF
• 每百萬個 token 的價格 — 輸入 $0.20 / 輸出 $1.20,對比輸入 $1.00 / 輸出 $5.00
• Artificial Analysis Intelligence Index — 38,在 177 個中排名第 4,對比 18,在 200 個中排名第 138(兩者皆為推理配置)
• 每項 Intelligence Index 任務的成本 — $0.18 對 $0.21
• 輸出速度 — 109.4 tokens/sec 對比 84.7 tokens/sec
• 推理控制 — 一個從「無」到「最大」的努力程度調節盤,相較之下,延伸思考須手動啟用,且沒有努力參數
• 可靠的知識截止時間 — 2026 年 2 月對比 2025 年 2 月(訓練資料截至 2025 年 7 月)
• 退休承諾 — 未公布 vs 不早於 2026 年 10 月 15 日
GPT-5.6 Luna 真正勝出之處

能力方面,差距懸殊。智能指數 38 對 18,這絕非勢均力敵。在 Artificial Analysis 依據推理、知識、數學與程式設計評測所建構的綜合指標上,Luna 的排名高於 Haiku,而且它還是每 token 成本較低的模型。若有人上次是在九月之前的指數上比較這兩個系列——當時 Luna 的分數為 51 和 52——就應留意,整個量表已在 2026 年 9 月重新評分,而 Luna 的優勢在重新評分後依然保持。
上下文,五倍之多。1M token 的視窗對上 200K,本身就能決定一整類工作是否可行:整個儲存庫的完整處理、長篇文件集、以及在 Haiku 上非得先摘要不可的冗長代理工作紀錄。如果你的應用程式取決於它必須承載多少上下文,那麼比較到此為止。
輸出餘裕加倍。128K 的最大輸出詞元相較於 64K,對於長篇生成,以及對於會回傳結構化計畫、而非單行答案的代理迴圈而言,都至關重要。
吞吐量。就串流介面而言,每秒 109.4 個輸出 token 對上 84.7 確實是實質的差距,不過這與回應速度並非同一回事——請參閱下方的延遲一節。
價格,就在標籤上。輸入便宜五倍、輸出大約便宜四倍,這不是四捨五入的誤差;而對短輸出的工作來說,這就是整個決策。
Claude Haiku 4.5 仍佔有一席之地的場景
可預測的成本。Haiku 4.5 的推理是需要手動開啟的延伸思考。關閉時,它會直接回答,計費也可預測。GPT-5.6 Luna 的努力程度旋鈕最高可調到最大值,而每往上調一級,就代表以輸出費率產生更多輸出權杖。對於想要事先訂出成本上限的團隊來說,即使 Haiku 的標價較高,還是會覺得它更容易估算。
非推理設定的執行成本確實相當低廉。Artificial Analysis 給予 Claude 4.5 Haiku 非推理設定的 Intelligence Index 分數為 15,且未公布每項任務的成本數據,而對於要求僅是「正確解析這些內容」的工作而言,它算是合理的選擇——意圖分類、欄位擷取、路由決策、審核分流。在這類任務上,15 與 38 之間的指數差距多半無關緊要,因為這兩個模型都沒有被要求思考。
快取與批次折扣已相當成熟。Haiku 4.5 提供 90% 的提示快取讀取折扣,以及 Batch API 的 50% 折扣。Luna 的快取經濟效益與其相當,因此這更接近平手,而非優勢——但若你的流程已經透過 Anthropic 的工具進行批次處理,那麼從 Haiku 遷移的成本就是一項實際成本,而且它不會出現在任何基準測試上。
實戰營運紀錄Haiku 4.5 自 2025 年 10 月起便已投入正式環境運作,並公開承諾最快也要到 2026 年 10 月 15 日才會退役。Luna 則問世僅兩個月。對於模型只是其中一個細節、而非產品本身的工作負載來說,十一個月的正式運作歷史,具有某種基準測試無法表達的價值。
在唯一衡量真實性的那條軸線上,它是更真實的模型。Artificial Analysis 的正面對決顯示,Luna 幾乎在每一項能力上都領先——AA-Briefcase 1,339 對 614,GDPval-AA v2 1,489 對 854,AutomationBench-AA 50% 對 3%,Humanity's Last Exam 39% 對 10%,GDPpdf 24% 對 4%。唯一的例外是 AA-Omniscience,它會懲罰在知識題上自信地給出錯誤答案:Luna 在該項得分為 -10,而 Haiku 為 -4。負分意味著幻覺懲罰超過了準確度加分,而 Luna 所受的懲罰更大。較高的綜合指數並不等同於更可靠的答案,而在唯一一項專為區分這兩者而設計的評測上,較舊的模型表現更好。
真實工作負載下的成本計算
假設有一條每個月消耗 1 億個輸入 token,並產生 2,000 萬個輸出 token 的管線。
• GPT-5.6 Luna — 100 × $0.20 = $20,加上 20 × $1.20 = $24,每月總計 $44。
• Claude Haiku 4.5 — 100 × $1.00 = $100,加上 20 × $5.00 = $100。每月總計 $200。
在那些比例下,Luna 大約便宜 4.5 倍,而這是大多數比較所公布的計算方式。現在改變一個假設。如果把 Luna 的推理強度調高,它的輸出 token 就會增加,而輸出是昂貴的那一側——以 $1.20 計算,其成本是輸入的六倍。把 Luna 推到在相同工作量下輸出 150M 個輸出 token 的程度,就像它在 Artificial Analysis 的評估集上那樣,那麼 $44 就會輕鬆變成超過 $180。4.5 倍的優勢會崩塌、趨近持平。
這堂課的啟示並不是 Luna 很貴,而是 Luna 的價格優勢取決於它有多話多,而那是你能控制的參數。在擷取與分類這類任務上把推理調低,折扣就是真的。若什麼都開到最高,你等於用一個已不再近似其標價的價格,買下了能力更強的模型。
延遲,以及一個你不該信任的數字
這兩個模型已公布的首次詞元(time-to-first-token)數據幾乎毫無用處,而箇中原因值得深入了解。在 Artificial Analysis 上,這兩個模型的推理配置都顯示出數十秒甚至數百秒的首次詞元延遲,因為測試框架要等到模型完成推理後才會輸出詞元。這個數字衡量的是評估設置,而非模型的回應速度。
路由遙測是更好的來源,因為它衡量的是正式環境中的模型。OrcaRouter 自家的數據顯示,GPT-5.6 Luna 的首個 token 中位數為 1.83 秒,第 95 百分位數為 10.00 秒;相較之下,Claude Haiku 4.5 的中位數為 3.81 秒,第 95 百分位數為 9.47 秒。正確解讀的話,這表示兩者比排行榜所顯示的更接近:Luna 在典型請求上勝出,而兩者的尾端表現相差約在半秒內。如果你關心的是最糟情況而非平均值,兩者之間幾乎沒有差別。
該選哪一個
選擇 GPT-5.6 Luna如果你要處理長上下文、如果這項任務能受益於真正的推理、如果輸出很長或具有結構,或者你想在價格區間的最低端取得最強大的模型,就選它。如果你技術堆疊的其他部分本來就採用 OpenAI 系列的行為模式,它也是更自然的選擇。
那就選擇 Claude Haiku 4.5如果你的工作是短輸出、高流量,如果你需要一個能在請求執行前就明確說出的成本上限,如果你的管線已經圍繞 Anthhropic 的批次處理與快取機制打造,或者比起才問世兩個月的模型,你更重視具備實際生產歷程與公開生命週期的模型,
兩者都不要選——如果一項任務靠小型推理模型或微調過的分類器就能勝任。這兩個層級所吸收的流量中,有相當大一部分是分類與擷取工作,用更專精的模型來跑會更便宜;而最便宜的模型,永遠是你不需要的那一個。
在同一組金鑰上執行兩者

一旦兩者都能透過單一端點存取,這種對決就不再是二選一。在 OrcaRouter 上,Claude Haiku 4.5 與 GPT-5.6 Luna 位於同一個相容 OpenAI 的基礎 URL 之後——一個 API 就能存取 200+ 個模型,一組金鑰、一行帳單、無須第二份合約,而且除了模型識別碼之外無須變更程式碼。對於你尚未確定的層級選擇,這能把遷移變成一個設定值。
這裡有兩項功能真正發揮作用。跨供應商的自動容錯移轉,意味著低成本層級能承載正式環境流量,而不必依賴單一供應商——當模型便宜到讓你每小時送出數千次呼叫,而非只送一次重要呼叫時,這就很有用。而路由 DSL 則讓你用多個模型組合成一次呼叫:把大多數單純的請求路由到 Luna,將其餘的升級至 GPT-5.6 Terra,並把 Haiku 4.5 留在池中作為備援,以便在你想要第二家供應商的答案而非重試時使用。
在把 GPT-5.6 Luna 或 Claude Haiku 4.5 其中任何一個投入正式生產路徑之前,請先查核兩者即時的每詞元(per-token)費率——兩者的費率都是以 0% 加成原樣轉嫁,因此供應商一調價、當天就會跟著變動,而第三方價格追蹤工具往往會落後數天到數週。
真正值得回答的問題
GPT-5.6 Luna 真的比 Claude Haiku 4.5 便宜五倍嗎?就輸入 token 而言,是的——0.20 美元對上 1.00 美元。但就完成同一項受評估任務的成本而言,並非如此:0.18 美元對上 0.21 美元。這兩種說法之間的落差,來自 Luna 的冗長。完成同樣的工作,它產生的輸出 token 大約是 Haiku 的兩倍,而輸出 token 的成本是輸入 token 的六倍。面對簡短的回答時,標價大致上還算誠實;但碰上推理繁重的工作就不是了。
我能在這兩者上用同樣的方式調整成本嗎?不行,而這正是兩者之間最常被忽略的差異。Luna 提供了一個推理強度調整鈕,設定範圍從 none 到 max,因此每次請求的成本與品質取捨都是明確的。Haiku 4.5 的擴展思考只有兩種情況:啟用(並搭配 token 預算),或是未啟用——沒有 effort 參數。如果每次请求的成本控制對你而言很重要,這兩者之中只有一個能給你這根槓桿。
那如果是每天要處理數百萬次呼叫的高流量分類器呢?這兩個模型都不需要為此進行推理。以關閉擴展思考的方式執行 Haiku 4.5,或將 Luna 的 effort 設為 none 來執行,然後比較延遲與輸出長度,而不是比較綜合指數——到了那個時候,相關問題會是第一個 token 多快送達,以及答案會用掉多少 token,而智慧基準測試已無法區分兩者。

哪一個一年後還會在這裡?Claude Haiku 4.5 附有一項公開承諾:在 2026 年 10 月 15 日之前不會退役。OpenAI 並未公布 GPT-5.6 Luna 的對等日期,而且 GPT-5.6 系列之上已經有更新的世代 GPT-6 Astra。這兩點都不是避開 Luna 的理由,但如果你的路線圖假設的是十一個月的規劃期,那就是把模型識別碼留在設定中、而非寫死在程式碼裡的理由。
的即時每 token 費率GPT-5.6 Luna,在同一組金鑰上以 0% 加價原樣傳遞,且無須另立第二個計費關係。
即時每 Token 費率,適用於 Claude Haiku 4.5,並於同一端點提供,因此無需第二份合約即可比較這兩個層級。
