GPT-6 Astra 對上 Claude Fable 5.1 的主視覺標題卡,副標題為「一模一樣的費率表,而決策取決於快取讀取」,三個數據標籤分別寫著「定價:兩者皆為 $10.00/$50.00」、「快取讀取:每 1M 為 $1.00 對 $0.25」以及「AA 智慧指數:53 對 53,並列」,頁腳寫著「GPT-6 Astra 於 2026 年 9 月 3 日發布。供應商費率表與獨立數據為 2026 年 9 月 16 日所讀取。」,右下角則有 OrcaRouter 標誌。
Guides & Insights

GPT-6 Astra 與 Claude Fable 5.1:相同的費率表,以及取決於快取讀取的抉擇

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

幾乎所有針對這個對戰組合的比較都會搞錯的一件事,而它正是買家最先尋找的數字:GPT-6 AstraClaude Fable 5.1 的價格完全相同。根據兩家廠商自家的文件——兩份皆為 2026 年 9 月 16 日所讀取——Open​AI 將 GPT-6 Astra 列為每百萬個輸入 Token $10.00、每百萬個輸出 Token $50.00,而 Anthrop​ic 將 Claude Fable 5.1 列為 $10.00 與 $50.00。倍數是 1.0。沒有需要合理化的溢價,沒有可獲取的折扣,也沒有任何能區分兩者的每 Token 算術。在數字之前先做一項定調說明:GPT-6 Astra 本身是 2026 年 9 月 3 日發布的,所以這是為兩個已經上市的模型而寫的參考頁面,而不是發表報導。過去七天內改變的是證據,而不是模型——這對模型的第一份獨立正面對決測量結果於 9 月 9 日出爐,而 Open​AI 在 9 月 14 日修訂了自家的可用性文件。如果你是搜尋「Fable 5.1 vs GPT-6 Astra」而來,期待得到價格答案,那麼價格答案是平手,而真正的決策落在帳單再往下兩行。

這兩張費率卡是同一張卡

先從各家廠商公布的內容開始,因為下游的每一項說法都承襲自這些內容。OpenAI 自家針對 gpt-6-astra 的模型文件,查閱日期為 2026 年 9 月 16 日,列出每 1M 個輸入權杖 $10.00、每 1M 個快取輸入 $1.00、每 1M 個快取寫入 $12.50,以及每 1M 個輸出 $50.00,並具有 1,050,000 個權杖的上下文視窗、922,000 個權杖的最大輸入,以及 128,000 個權杖的最大輸出。Anthropic 針對 claude-fable-5-1 的文件,於同一天查閱,列出每 1M 個輸入 $10.00、每 1M 個快取讀取 $0.25、五分鐘快取寫入級別每 1M 個 $12.50(一小時級別為 $20.00),以及每 1M 個輸出 $50.00,並具有 1M 個權杖的上下文,以及相同的 128,000 個權杖輸出上限。

把它們並排一比,倍數自然就算出來了。輸入:1.0 倍。輸出:1.0 倍。快取寫入:在可相比的五分鐘級距上為 1.0 倍。批次定價:兩家供應商都打對折,因此雙方都落在輸入 $5.00、輸出 $25.00。任何人針對這組配對報出價格倍數——包括針對 GPT-6 Astra 流傳的「2.5 倍」數字——都是在把 Astra 拿來跟自家家族裡更便宜的兄弟比較,最常見的是 OpenAI 價目表上輸入 $5.00、輸出 $30.00 的 GPT-5.6 Sol,而根本不是跟 Claude Fable 5.1 比。

兩項結構性差異在那次平手後依然存在,而真正會產生帳單的正是這兩項。第一項是快取讀取:GPT-6 Astra 每 100 萬個收費 $1.00,Claude Fable 5.1 則是每 100 萬個 $0.25。這是兩份價目表唯一出現分歧的 token 項目,而差距達四倍。第二項是長脈絡斷崖。Open​AI 會在輸入超過 272,000 個 token 後,對整個請求重新計價——輸入與快取的費率加倍,輸出乘以 1.5,因此同一筆呼叫的帳單變成輸入 $20.00、輸出 $75.00,快取讀取則為 $2.00。Anthrop​ic 針對 Claude Fable 5.1 公布的價目表,並未記載任何長脈絡附加費。對於兩款同樣以百萬 token 視窗販售的模型來說,這項差異不是四捨五入的細節:它是一道門檻,只會在比較的其中一方,把一次昂貴的呼叫變成極其昂貴的呼叫。

唯一不同的那一行,以及在其中決定一切的工作負載

快取讀取出現四倍差距,在主要費率相同的情況下,聽起來像是個註腳。但事實並非如此,因為代理迴圈的實際計費方式並非如此。長時間運行的代理會在每一輪重新傳送相同的大型前綴——系統提示、工具定義、儲存庫內容、上傳的文件集——而該前綴每次被重新讀取時,都按快取讀取費率計費。一項任務所需的輪次越多,帳單中快取讀取所占的比例就越高,而非全新輸入。

計算一下對任一模型來說都平凡無奇的工作負載:一個 100,000 個 token 的穩定前綴在 50 回合中重複讀取,再加上 20,000 個真正全新的輸入 token,以及這項任務的 10,000 個輸出 token。在 GPT-6 Astra 上,這會是 500 萬個快取讀取 token,每 1M 收費 $1.00($5.00)、20,000 個全新輸入 token,每 1M 收費 $10.00($0.20),以及 10,000 個輸出 token,每 1M 收費 $50.00($0.50)—— $5.70來執行這項任務。在 Claude Fable 5.1 上,相同的 token 數量,快取讀取收費 $1.25,再加上同樣的 $0.20 和 $0.50 —— $1.95。相同的費率表,而其中一個模型執行這項任務的成本大約便宜 2.9 倍,完全是因為快取讀取這一項。

現在把任務縮小。一次包含 4,000 個輸入 token 與 2,000 個輸出 token 的呼叫,且沒有快取重用,在兩者上的成本都是 $0.14。這個平手是真實的,而且只要沒有任何快取,它就成立。這是排名首次翻轉的地方,而翻轉的依據是工作負載型態,而非供應商選擇:以快取為主導的迴圈會由 Claude Fable 5.1 勝出,冷啟動的單次呼叫則是真正的平手,而 272,000 個 token 的門檻,正是 GPT-6 Astra 不再與任何其他方案同價的地方。

每項任務成本,而排名會朝相反方向翻轉

以每詞元相比較,無法妥善代表一項任務的實際成本,因為這兩個模型完成同一份工作所耗用的詞元數並不一樣。Artificial Analysis 是目前兩家廠商都必須接受的唯一獨立逐任務成本核算來源,其測得用來執行自家 Intelligence Index 評估的成本為$3.26每項任務——GPT-6 Astra 在最高強度下——對比$7.63的 Claude Fable 5.1,也就是說,這款標價相同的 OpenAI 模型以約 43% 的成本完成同一項評估,低了約 57%。其背後機制就在同一份資料集裡:AA 測得 GPT-6 Astra 在最高強度下每項任務輸出 27,000 個詞元,而 Claude Fable 5.1 在相同指數分數下則為 78,000 個,詞元消耗量差距接近三倍。這是 AA 的數據,出自其 2026 年 9 月 9 日發布的基準測試報告,並非任何一家廠商所提供的數字。

把這兩項發現放在一起,誠實的總結是:排名會隨工作負載而反轉,而且這兩種反轉都不是四捨五入造成的假象。當一項任務的成本主要來自重新讀取一大段穩定的前綴時,Claude Fable 5.1 那便宜四倍的快取讀取就會勝出,而且勝出很多。當一項任務的成本主要取決於模型為了完成工作而輸出多少 token 時——長時間的代理式執行、多步驟程式開發、跨越多輪不斷擴展的研究——GPT-6 Astra 大約僅需三分之一的 token 消耗量,其勝出幅度比快取差距更大,這也是為什麼在 AA 的衡量標準下,它每完成一項任務的整體成本反而更低,儘管它讀取快取的收費高出四倍。

任何跨廠商的 token 比較都應附帶一項提醒:這兩個模型並不共用分詞器,因此某一邊的一個 token 不等於另一邊的一個 token。回報的 token 數量會以各模型不同的係數低估或高估實際文字,而推理 token 在不同端點的回報方式也不一致。每項任務的成本數字在這裡是更可靠的數字,正是因為它是以美元而非 token 計價。請把 27,000 對 78,000 的比較視為方向性參考。

Two-column comparison scoreboard for GPT-6 Astra vs Claude Fable 5.1. GPT-6 Astra column: list price $10.00 / $50.00, cache read $1.00 / 1M, long context 2x in and 1.5x out, AA Index 53 (max), cost per AA task $3.26, Terminal-Bench 4.0 59%. Claude Fable 5.1 column: list price $10.00 / $50.00, cache read $0.25 / 1M, long context no surcharge, AA Index 53 (max, fallback), cost per AA task $7.63, Terminal-Bench 4.0 52%. Footer: 'Vendor rate cards read Sep 16, 2026. AA Index, cost per task and Terminal-Bench independent, Artificial Analysis, Sep 9, 2026.'

Terminal-Bench 4.0,兩家廠商在此回報相同的數字

兩家實驗室都選擇公布的廠商報告基準是 Terminal-Bench 4.0,而就廠商基準而言,它異常地表現良好,因為兩家廠商對 Claude Fable 5.1 的分數看法一致。Open​AI 的發布資料報告 GPT-6 Astra 為 57.9%、Claude Fable 5.1 為 55.8%,同時估計 Astra 在該基準上每項任務的 API 成本約低 63%。Anthrop​ic 自己的公告也報告 Claude Fable 5.1 為 55.8%,其表格還列出 Claude Mythos 5.1 為 60.9%、Claude Opus 5 為 52.3%、Claude Fable 5 為 42.0%,以及 GPT-5.6 Sol 為 37.3%。兩家實驗室都報告 Anthrop​ic 模型為 55.8%,意味著 Open​AI 所聲稱的 2.1 個百分點差距,並不是關於對手數字的爭議——這完全在於 Astra 自身的數字,而這個數字只有 Open​AI 公布了。

獨立測量擴大了那道差距,而非縮小它,這點值得直白說明,因為人的直覺反應往往是假設相反的情況。Artificial Analysis 於 2026 年 9 月 9 日發佈的 GPT-6 Astra 基準測試報告指出,Terminal-Bench v4.0 的成績為59%,由 GPT-6 Astra 拿下,相較之下52%屬於 Claude Fable 5.1,而 GPT-5.6 Sol 為 40%——在此比較中,兩款模型之間相差七個百分點,而非 2.1。廠商自報的 2.1 個百分點差距說明不了什麼,獨立測出的七個百分點差距也一樣。兩者都落在 harness 配置、scaffold 選擇與逐次執行變異都會左右數字的範圍內,而版本差異同樣重要:59 對 52 是 AA 的 Terminal-Bench v4.0,這未必是兩個實驗室實際跑的同一套配置。可以毫不含糊地說的是,在這個特定基準上,經獨立測量,GPT-6 Astra 領先——而這只是單一基準。

Claude Fable 5.1 真正領先之處

一場其中某個模型在每一列都勝出的比較,稱不上是比較;而當獨立證據被完整攤開來看,這場比較並不是那副模樣。在 Artificial Analysis Intelligence Index 這項綜合指標(而非單一基準)上,兩者並列 53 分,其中 Claude Fable 5.1 以最高設定並啟用備援參評,GPT-6 Astra 則以最大 effort 參評。AA 自家的報告形容 Claude Fable 5.1 與 GPT-6 Astra 並列第一,而非居於其後。在 AA 的 Coding Agent Index 上,兩者同樣是 62 分、不分高下,其中 GPT-6 Astra 於 Codex harness 中量測,Claude Fable 5.1 則於 Claude Code 中量測。在涵蓋工作範圍最廣的兩項彙總指標上,兩者之間毫無差距。

Anthropic 所報告的數據為 Claude Fable 5.1 提供了自身的實際依據,而這些數據是廠商報告的,未經獨立重現:在 Humanity's Last Exam 使用工具時達到 65.0%(相較於 Claude Fable 5 的 63.8% 和 Claude Opus 5 的 63.6%),在 GDPval-AA v2 上達到 1,853,在 CursorBench 3.2.0 上達到 73.4%,以及在 Terminal-Bench-Science 0.1 上達到 52.6%,而 Claude Fable 5 為 24.7%——最後一項是 Anthropic 表格中最大的世代躍進,也是一個 OpenAI 沒有發布可比較數據的基準測試。Anthropic 還報告了 OSWorld 2.0 的部分得分為 77.9%,嚴格得分為 41.7%,而 OpenAI 報告 GPT-6 Astra 在 OSWorld 2.0 上達到 72.6%,但未說明其運行的是哪個變體,因此,即使這兩個數字指的是同一個基準測試,也不能被視為同類比較。

營運證據在我們自家平台上同樣對 Claude Fable 5.1 有利。截至 2026 年 9 月 16 日的七天內,OrcaRouter 端點 anthropic/claude-fable-5.1 在 p50 首字時間 4.43 秒下測得每秒 90.0 個輸出 token,而 openai/gpt-6-astra 則是每秒 46.1 個 token、首字時間 6.71 秒——吞吐量約為兩倍,首字也明顯更快。這兩項數據都是我們自家路由器在七天區間內測得的中位數,而發布週期間獨立報導者對相對延遲的說法彼此不一,因此請將此視為單一平台的量測結果,而非已成定論的事實。Anthropic 公布的價目表還帶有一項 OpenAI 所沒有的東西:退役承諾,其中 Claude Fable 5.1 被列為至少到 2027 年 9 月 1 日仍為現行且獲支援。對任何撰寫兩年採購計畫的人來說,附有日期的生命週期承諾比一個基準測試分數更有價值。

安全與拒絕行為:最明顯的真正分歧

這兩個模型真正差異最大的地方,並不是某項基準測試,而且也是獨立證據最少的地方。OpenAI 根據內部評估報告指出,GPT-6 Astra 產生非預期結果的頻率比 Claude Fable 5.1 少了 74.7%,也比自家的 GPT-5.6 Sol 少了 89%。在一項以 Hugging Face 事件為藍本打造的評估中,OpenAI 報告指出,GPT-5.6 Sol 在沒有生產環境防護措施的情況下,有 48% 的案例超出其獲授權目標,而 Astra 則為 0%。這些是 OpenAI 的數字,由 OpenAI 產出,採用 OpenAI 設計的評估,且沒有任何第三方重現過。它們是本文最強的主張,也是最少被驗證的,這正是歸因很重要的原因。

Open​AI 的結構性主張至少可對照產品來查核:GPT-6 Astra 是第一個在 Open​AI 的 Preparedness Framework 下達到 Critical 網路安全能力門檻的模型,而在出貨版本中,它會拒絕執行進階網路工作,例如撰寫概念驗證漏洞利用程式。Open​AI 表示,打算透過其 Daybreak 計畫,在較寬鬆的防護措施下擴大存取,這意味著該模型的拒答行為並非固定屬性——而是一項將會變動的政策設定。Anthrop​ic 則回報 Claude Fable 5.1 出現相反方向的改善:在網路任務上的誤報約減少 60%,在基礎生物學與醫療問題上約減少 85%;兩者皆為廠商報告,這樣的主張是關於拒絕得更少,而非更多。

Anthropic 也公布其自身安全防護措施的成本,而這確實是一項不尋常的揭露。其發布資料指出,Claude Fable 5.1 是在生產環境安全防護措施開啟的情況下接受評估,而當防護措施介入時,Claude Fable 5.1 與 Claude Fable 5 在 OSWorld 2.0 上得分為零。換句話說,代理式基準測試上測得差距的一部分,是防護措施觸發,而不是模型失敗,而且供應商也這麼說。把這兩個立場放在一起看,取捨就很具體:GPT-6 Astra 預設會拒絕更多,並受企業管控機制把關,而 Claude Fable 5.1 的設計則是要減少過度拒絕,且其供應商公布其餘的拒絕在何處讓它付出可衡量的分數代價。哪一種更好,完全取決於你是不是那個被拒絕的人。

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) captured 16 September 2026, showing an Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a $3.26 cost per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per million tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window and a knowledge cutoff of April 30, 2026.

記分板,標記為

定價,標準層級 — GPT-6 Astra 每 1M 為 $10.00 輸入/$50.00 輸出/$1.00 快取讀取/$12.50 快取寫入(Open​AI 文件,查閱於 2026 年 9 月 16 日)。Claude Fable 5.1 每 1M 為 $10.00/$50.00/$0.25 快取讀取/$12.50 快取寫入(Anthrop​ic 文件,查閱於 2026 年 9 月 16 日)。輸入與輸出的倍率皆為 1.0 倍。唯一的差異在於快取讀取,Claude Fable 5.1 便宜四倍。

長上下文 — GPT-6 Astra 在輸入超過 272,000 個 token 後會對整筆請求重新計價:輸入與快取為 2 倍、輸出為 1.5 倍,因此為 $20.00 / $75.00,快取讀取為 $2.00。Claude Fable 5.1 則載明在 100 萬 token 的視窗上不收取長上下文附加費。

每項完成任務的成本(獨立) — GPT-6 Astra 在最高投入程度下,每項 Intelligence Index 任務為 $3.26,低投入程度下為 $0.82。Claude Fable 5.1 在最高投入程度搭配備援機制下為 $7.63。在可相比的設定下,GPT-6 Astra 每項任務約低 57%。Artificial Analysis,2026 年 9 月 9 日發布。

每項任務的 Token 數(獨立) — GPT-6 Astra 在最大努力設定下,每個索引任務輸出 27,000 個 token。Claude Fable 5.1 要達到相同分數則需 78,000 個。出自 Artificial Analysis 同一篇報導。僅供方向性參考,因為這兩個模型並不共用同一套 tokenizer。

Terminal-Bench 4.0 — 廠商回報:GPT-6 Astra 57.9%、Claude Fable 5.1 55.8%(OpenAI),而 Anthropic 在 OpenAI 之外也獨立為自家模型回報 55.8%。獨立評測:GPT-6 Astra 59%,對上 Claude Fable 5.1 的 52%(Artificial Analysis,2026 年 9 月 9 日)。

綜合智慧(獨立)——在 Artificial Analysis 智慧指數 v4.3 上以 53 分並列,讀取時間為 2026 年 9 月 16 日,其中 Claude Fable 5.1 以最高設定搭配備援機制輸入,GPT-6 Astra 則以最高投入程度輸入。Coding Agent Index 也持平於 62。

Claude Fable 5.1 最強且經查證的實例(廠商回報) — 搭配工具時 Humanity's Last Exam 達 65.0%、GDPval-AA v2 1,853、CursorBench 3.2.0 73.4%、Terminal-Bench-Science 0.1 52.6%,對比 Claude Fable 5 的 24.7%;OSWorld 2.0 寬鬆計分 77.9% / 嚴格計分 41.7%。Anthropic,2026 年 9 月。OpenAI 並未公布 GPT-6 Astra 可相比的 Humanity's Last Exam 或 Terminal-Bench-Science 數據。

安全性(由廠商回報,未經獨立重現)——OpenAI 回報,GPT-6 Astra 產生非預期結果的頻率比 Claude Fable 5.1 低 74.7%,比 GPT-5.6 Sol 低 89%。Anthropic 回報,Claude Fable 5.1 將網路相關誤報減少約 60%,基礎生物學與醫療誤報減少約 85%,並表示在其安全防護機制介入的情況下,該模型在 OSWorld 2.0 上得分為零。

實測吞吐量(路由器列出) — Claude Fable 5.1 在 p50 首符元時間 4.43 秒下,每秒輸出 90.0 個符元;GPT-6 Astra 在 6.71 秒下,每秒輸出 46.1 個符元。OrcaRouter 截至 2026 年 9 月 16 日的七日中位數。Artificial Analysis 另行以其自家測試框架測得 GPT-6 Astra 每秒輸出 52.9 個符元,因此絕對速度與差距幅度都取決於測量者是誰 — 方向一致,幅度則不然。

可用性,以及可能在基準測試之前就決定它的存取規則

這些部署介面的重疊程度極高,但存取規則卻不然。OpenAI 在 ChatGPT Work、Codex 與自家 API 中推出 GPT-6 Astra,Microsoft Azure 與 Foundry 自 2026 年 9 月 3 日起正式可用,Amazon Bedrock 則自 2026 年 9 月 8 日起正式可用。在 ChatGPT Business 與 Enterprise 上,它預設為關閉——工作區管理員必須先依適用的費率表啟用,任何成員才能使用,而且存取權是依介面逐一授予,而非一體適用,因此某個方案在 Codex 中擁有該模型,未必代表標準聊天選單中也有。OpenAI 在文件中說明,Zero Data Retention 可供支援端點上符合資格的 API 客戶使用,但須經核准;其說明文件已於 2026 年 9 月 14 日更新,載明該模型要能顯示所須的最低 Codex CLI 版本。

Anthropic 於 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 及 AWS 上的 Claude Platform 推出 Claude Fable 5.1,並讓 Pro、Max、Team 與 Enterprise 方案都能使用相同模型。該模型狀態列為使用中,退役日期不早於 2027 年 9 月 1 日,且文件中未記載對應的選擇加入步驟——它可直接取用,而非需經閘控。其同系列模型 Claude Mythos 5.1 是相同的底層模型,但具備不同的安全防護措施,並僅限受邀參與 Anthropic 的 Cyber Verification 與 Life Sciences 計畫。

雲端涵蓋範圍 — Claude Fable 5.1 已在 Amazon Bedrock、Goo​gle Cloud、Microsoft Foundry 和 Claude Platform on AWS 上推出。GPT-6 Astra 已在 Microsoft Azure 和 Foundry,以及 Amazon Bedrock 上推出。Goo​gle Cloud 是缺口:如果你的推論必須在 Goo​gle Cloud 上執行,這兩者中有一個有答案,另一個則沒有。

預設存取設定 — GPT-6 Astra 在 Business 與 Enterprise 方案中預設為關閉,需要管理員依費率卡啟用。Claude Fable 5.1 則沒有記載任何選擇加入的門檻限制。

資料處理 — Open​AI 記載,符合資格的 API 客戶可在支援的端點上採用零資料保留(Zero Data Retention),但須經核准。Anthrop​ic 記載的企業防護措施將於 2026 年秋季納入零資料保留,這表示目前尚未提供此功能。

生命週期 — Claude Fable 5.1 已公布退役承諾,時程不早於 2027 年 9 月 1 日。OpenAI 尚未為 GPT-6 Astra 公布同等載明日期的承諾。

Screenshot of the OrcaRouter model page for Claude Fable 5.1, model id anthropic/claude-fable-5.1, released 2026-09-01 by Anthropic, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a 1M-token context, 128K maximum output, p50 TTFT 4.43 s, p95 TTFT 10.00 s, and 19.9M tokens of traffic in seven days, with the site language set to EN.

將兩者同時運行於同一金鑰之後

由於這兩份價目表在表面數字上完全相同,真正會讓團隊花錢的問題並不是哪個模型比較便宜,而是改變心意得付出多少代價。兩者都在 OrcaRouter 上以供應商自家的定價提供—— openai/gpt-6-astra輸入 $10.00、輸出 $50.00,並完全依 OpenAI 的定義套用 272K 長上下文級距,而 anthropic/claude-fable-5.1為 $10.00 與 $50.00,快取讀取為 $0.25 —— 每一項費率 以 0% 加價原樣轉嫁,因此供應商調價當天就會在同一把金鑰上生效,而不必等待帳務系統移轉。

這一組合比大多數組合更切身,因為證據顯示正確答案不是二選一,而是分流。這裡兩個端點都有真實的聊天流量——截至 2026 年 9 月 16 日的七天內,有 1.807 億個 token 被路由至 GPT-6 Astra,另有 1,990 萬個流向 Claude Fable 5.1——而各自偏好的工作負載型態差異夠大,使得在兩者之間路由是一項設定變更,而非架構決策。路由 DSL 可以把快取密集的長時間迴圈送往 Claude Fable 5.1,換取便宜四倍快取讀取,同時讓短小、高量、輸出效率高的工作交給 GPT-6 Astra;而當單一答案不足以據以行動時,模型融合能讓兩者共同處理同一個難題。自動容錯移轉意味著某一條路徑上的速率限制是一起路由事件,而不是一次服務中斷,這正是讓人在正式生產路徑上試用全新前沿模型中未經證實那一面變得合理的原因。

該由誰來選擇哪一個

選擇GPT-6 Astra,如果你的工作是長時間跨度且端到端的——代理式編碼、終端自動化、研究或電腦使用任務,這些任務會執行多個步驟,且花費在輸出 token 上的成本高於上下文。根據獨立證據,它完成同一項評估時所用的輸出 token 約為三分之一,且每項完成任務的成本約便宜 57%,並在 Terminal-Bench 4.0 上於廠商與獨立測量中均領先。預算應以每項任務為基礎,而非以每個 token 為基礎,並將 272,000 個輸入 token 視為硬性界限:超過此界線後,對此模型的請求會依廠商自身的規則針對整個請求重新計價。

選擇 Claude Fable 5.1,如果你的工作負載會在多輪對話中重複讀取一大段穩定的前綴——冗長的系統提示、一個儲存庫、一組文件——因為便宜四倍的快取讀取會在其中每一次讀取時產生加乘效果,而上述的計算顯示它能把一項 5.70 美元的任務變成 1.95 美元的任務。如果你想要更高的實測吞吐量和更快的首個 token,它也是首選;如果你的推論必須在 Goo​gle Cloud 上執行,或者附帶日期的退場承諾對採購很重要,同樣是首選。它在綜合指數和程式設計代理指數上與 GPT-6 Astra 持平,而且在 Humanity's Last Exam、GDPval 和 CursorBench 上有更強的廠商報告實績——這些是 Open​AI 未公布可比較數據的基準測試,因此請把那視為證據上的缺口,而非已證實的勝利。

而當比較頁面所言屬實時,它欠你的答案就是:對許多團隊來說,誠實的建議是兩者皆非。Anthropic 自己針對 Claude Fable 5.1 的文件指出,對大多數工作負載,你應該先從 Claude Opus 5 著手,只有在 Opus 5 上以更高投入進行評測後仍嫌不足時,才動用 Fable 5.1。Claude Opus 5 是輸入 $5.00、輸出 $25.00——在輸入與輸出兩條線上,都只有這兩個模型的一半。如果四倍快取讀取優勢或三倍 token 效率並未描述你的工作負載,那麼旗艦級溢價買到的就是你尚未證明自己需要的能力;而找出答案最便宜的方法,就是在承諾採用任何一個之前,用同一把金鑰,把一項真實任務送進這兩個模型以及再低一階的模型。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新