
Claude Fable 5.1 對比 Grok 4.6:九個指數點與八倍的輸出價格——這個差距實際上買到了什麼
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Claude Fable 5.1 和 Grok 4.6 是界定當前這一代價格區間上下界的兩款封閉前沿模型。Anthropic 的新旗艦模型於 2026 年 9 月 1 日發布,每百萬輸入代幣收費 10.00 美元,每百萬輸出代幣收費 50.00 美元;在目前版本的 Artificial Analysis 智慧指數中,它得分 53,是該指數追蹤的 201 個模型中的第一名。SpaceXAI 的 Grok 4.6 自 8 月 12 日推出以來,同樣單位收費 2.00 美元和 6.00 美元,得分 44,在 201 個模型中排名第二十。兩者相差 9 個指數點;輸出價格相差 8 倍。特定工作量應該在意哪一個數字,才是問題的全部;而這兩個數字指向不同的方向,取決於你要求模型做什麼。
資料來源,事先聲明:Artificial Analysis 在九月重新為其 Intelligence Index 評分,因此此處的數字取自當前版本,於 2026 年 9 月 10 日擷取,而非許多八月報導仍在引用的舊量表。不同版本的指數分數無法相互比較,這就是為什麼以下數字可能看起來比你讀到的任一模型發表時的數據來得低。所有標示為「廠商通報」的數據皆來自發布實驗室自己的評測表,且未經中立第三方複現驗證。這項警告在此處的影響程度並不均等——Grok 4.6 已歷經一個月的外部檢視,而 Claude Fable 5.1 才發布九天,外界對其主打數據的大部分了解仍來自 Anthropic 的單方面說法。
兩間實驗室,兩種不同的商品在特價
Anthropic 九月的釋出是一次能力展示,並附上安全敘事。Claude Fable 5.1 是 Claude Mythos 5.1 的正式公開雙生版本;後者是受安全限制的姊妹模型,僅提供給通過審查的網路安全與生命科學機構——基礎模型相同,但防護欄不同。Anthropic 所銷售的是獨立評測榜首、100 萬 token 的上下文視窗、單次回應最多 128K 輸出 token,以及圍繞 Claude Code 和 Claude 應用程式建構的代理生態系統。其訴求很直接:當任務艱難到錯誤答案的成本高於 token 成本時,這就是你呼叫的模型。
SpaceXAI 正在銷售某種更狹窄、且隨著時間推移更具侵略性的東西——仍屬前沿級別的最廉價模型,其定價低到讓在其他任何平台上建構代理程式都顯得奢侈鋪張。Grok 4.6 並非規模升級:它與 Grok 4.5 使用相同的基礎,只是多了更長的補充訓練與更重的強化學習,供應商宣稱這換來了「可與 GPT-5.6 Sol 和 Claude Fable 5 媲美的智慧」。以 2/6 美元的價格,且仍位居指數前二十名,這就是全部的重點。這同時也是策略,而不只是價格。SpaceXAI 擁有 Cursor,在模型發布前一天推出了 Grok Bot 瀏覽器代理程式,並經營自家的消費級聊天應用程式;以大宗商品價格提供的前沿模型,正是驅動這一切的燃料。伊隆·馬斯克公開的盤算——AI 營收將超越公司所有其他業務部門、10 GW 的運算能力——也指向同樣的方向。這款模型的定價並非為了最大化 API 利潤。
規格表,逐項檢視
• 每100萬個Token的價格 — Claude Fable 5.1 輸入$10.00 / 輸出$50.00,對比 Grok 4.6 輸入$2.00 / 輸出$6.00。
• 快取輸入 — Claude Fable 5.1 每 1M 為 $0.25,Grok 4.6 則為 $0.50;Artificial Analysis 列出的有效快取折扣為 98%,對比 75%。
• 長上下文定價 — Claude Fable 5.1 的視窗計價一路持平到 100 萬 token;Grok 4.6 一旦超過 200K 輸入 token,就會把整個請求重新定價為 $4.00 / $12.00 / $1.00,因此它的折扣恰好在長代理運行所在的區段變薄。
• 上下文與輸出 — Claude Fable 5.1 配備 1M token 的上下文視窗與最高 128K 的輸出 token;Grok 4.6 則提供 500K 上下文視窗、可從 low 調至 xhigh 的推理強度設定,以及速率雙倍的更快變體。
• 獨立評分、速度與成本——Artificial Analysis 將 Claude Fable 5.1 評為目前的 Intelligence Index 得分 53(在 201 個模型中排名第 1),輸出速度每秒 67.2 個 token,每個索引任務成本 $7.63;Grok 4.6 則得分 44(排名第 20),每秒 52.8 個 token,每個任務成本 $1.86。兩者在該衡量標準下都被評為「非常冗長」或「有些冗長」——Claude 模型輸出 1.9 億個 token,而 Grok 則為 9,400 萬個。
• 廠商基準測試宣稱 — Anthropic 聲稱 Claude Fable 5.1 在 Terminal-Bench-Science 0.1 上達到 52.6%(是 Claude Fable 5 的 24.7% 的兩倍以上),在 Terminal-Bench 4.0 上達到 55.8%,在 GDPval-AA v2 上達到 1,853。SpaceXAI 聲稱 Grok 4.6 在 DeepSWE v1.1 上達到 65.9%,在 CursorBench v3.2 上達到 69.9%,同時自我報告在 Terminal-Bench v3.0 上達到 26%——這是供應商自家表格中明顯偏弱的一行。
• 各自運行的位置 — Anthropic 的 API、Claude 應用程式、Claude Code、Amazon Bedrock、Google Cloud 與 Microsoft Foundry,對比 SpaceXAI API、Cursor、Grok Build、Grok Bot 代理程式、Grok 消費者應用程式及 Amazon Bedrock GovCloud。
• 發布 — Claude Fable 5.1 於 2026 年 9 月 1 日;Grok 4.6 於 2026 年 8 月 12 日。

九個指數點實際上代表什麼
在目前的獨立指數上,九月的排名明確無誤:Claude Fable 5.1 以 53 分居首,在 201 個模型中排名第一;Grok 4.6 以 44 分排名第二十。重新評分的指數需要一項說明,因為這正是那種會讓發布週的數字在事後看來有誤的情況:Artificial Analysis 在九月重新調整了其 Intelligence Index,而兩個模型的公布成績在調整後都隨之下修。九分的差距是真實的,但該指數是一個加權綜合指標——大幅偏向智能體任務,編碼、科學推理與通用能力位列其後——因此它將各面向參差不齊的表現壓縮成了單一數字。
各維度的證據更為嘈雜,但也更有參考價值。Anthropic 自家的 Terminal-Bench-Science 0.1 數據——52.6%,足足是前一代 24.7% 的兩倍多——正好對準代理式買家所在意的長期科學與研究工作流程;而在這項特定基準上,目前沒有任何模型能與之匹敵。SpaceXAI 的廠商表格在軟體工程方面表現最強(DeepSWE v1.1 為 65.9%、CursorBench v3.2 為 69.9%),在以終端機為主的代理迴圈方面則最弱;其中 Grok 4.6 在 Terminal-Bench v3.0 上的 26%,低於 GPT-5.6 Sol Max 的 34.6% 和 Claude Fable 5 Max 的 34.1%。兩份表格皆為廠商自行申報、未經第三方重現;它們呈現的是各家實驗室自認的強項,而非最終的勝負。

廉價代幣的細則條款
Grok 4.6 的價格優勢確實存在,而且在短、中上下文情境下更是巨大:輸出密集型工作負載每個生成的 token 花費,比在 Claude Fable 5.1 上低了約 83%。但這份費率表有三個前沿模型評比通常會略過的邊角。
第一個是 200K 門檻。跨越 200,000 個輸入 token 會將整個請求重新定價為 $4/$12,而不只是超出門檻的部分。對於會持續累積上下文的大型 agent 任務——正是這兩款模型主打的負載類型——有效費率會在毫無預警的情況下翻倍,不再是 Claude 價格的五分之一。第二個是速度更快的變體,其費用是基礎費率的兩倍,而且是官方公布的唯一能改善該模型低於平均輸出速度的方法。第三個是伺服器端工具呼叫,按每千次呼叫另行計費。
Claude Fable 5.1 九月的定價變動則走向另一個方向。名目上的 $10/$50 沒有變動,但快取讀取價格下降了 75%,降至每百萬 tokens 0.25 美元,而這正是長時間 agent 工作階段實際花費金錢的地方:一再重讀工具輸出、檔案內容與先前的回合。Artificial Analysis 顯示由此產生的有效快取折扣為 98%,相較之下 Grok 為 75%。每百萬個重讀 tokens 支付 25 美分,會以官方標價從未呈現的方式,改變長達數小時 agent 的成本計算。
誠實的制衡因素是冗長程度,而這正是實際成本差距並非八倍的原因。由於 Claude 模型完成相同索引任務所產生的 token 數量大約是 Grok 的兩倍——1.9 億對比 Grok 的 9,400 萬——Artificial Analysis 的每任務成本指標顯示,Claude Fable 5.1 為 7.63 美元,而 Grok 4.6 為 1.86 美元。這大約是四倍的差距,而非八倍,這才是編列預算時應參考的數字。
永遠不會上桌的差異
延遲表現正是這兩款模型在互動式產品上的分歧所在,而結果與價格標籤所暗示的恰好相反。Artificial Analysis 測得 Claude Fable 5.1 每秒輸出 67.2 個 token,高於同級平均水準;Grok 4.6 則為 52.8,被該評測列為低於平均。Grok 的指數摘要也直言其速度遜於同儕,這正是 SpaceXAI 以雙倍價格販售更快版本的原因。依據同一份獨立評測,Anthropic 的模型也是兩者中較為冗長的一方。於是,便宜的模型反而較慢,昂貴的模型則寫得超出必要:兩項成本彼此拉扯,而且都不會出現在價目表上。
今天先兩邊都聯繫,但不對任何一方做出承諾。
九個百分點的差距、每次任務成本相差四倍、價格表上滿是各種方案,其實際後果是:大多數團隊應該同時運行兩者,而有趣的問題在於切換點落在哪裡。這樣做比聽起來便宜:Claude Fable 5.1 和 Grok 4.6 都在 OrcaRouter 上以供應商的列表價格提供,零加價——上面的 $2/$6 和 $10/$50 就是發票上出現的數字,而且任何供應商的價格變動都會當天傳遞,而不是被轉售商的利潤吸收。一個端點同時涵蓋兩者,因此升級模式是一條路由規則,而不是第二份合約:將大量、範圍明確的工作交給 Grok 4.6,當任務需要推理上限時升級到 Claude Fable 5.1,並讓自動故障轉移處理較便宜模型吞吐量太慢、趕不上截止期限的情況。路由 DSL 在一個地方表達了這個鏈條,模型融合則讓一組模型在任務重要到需要多個意見時共同回答。於是,價格差距不再是你一次性做出的決定,而成為一條你隨著工作負載組合變化而不斷調整的線。

該由誰來選擇哪一個
選擇 Claude Fable 5.1 的情況是:當錯誤或放棄回答的成本遠大於 token 成本時——例如長時間的代理型研究、困難推理、受監管的工作(Anthropic 的安全防護範圍及其分階段零資料保留控制很重要),以及任何在 Claude Code 內執行的任務。選擇 Grok 4.6 的情況是:當工作量大、範圍明確且可容忍高吞吐量時——例如批次編碼、擷取、生成、回合短到足以維持在 200K 重新定價線內的代理迴圈——以及當你正在建置以模型為元件、且每個任務的成本就是整個商業模式的代理時。
在任一選項定案之前,有兩個懸而未決的變數值得觀察。SpaceXAI 已再次為近期即將推出的 Grok 4.7 預熱;若它沿用相同價格等級卻具備更高效能,今天的超值之選將在數週內變成中階之選。與此同時,Anthropic 展現出約略每月一次的更新節奏,且願意在不動招牌費率的情況下調降快取定價,這暗示這場對弈的下一步可能落在成本面,而非指標面。這兩個變數都不會改變模型今天的行為,但兩者都是將模型 ID 保留為設定值的理由。在具備轉嫁計價與容錯轉移的單一端點上,這本來就是預設行為,而非一項專案工程。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
