
Grok 4.5 對決 GPT-6 Astra:標價六倍,帳單三倍
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
把 Grok 4.5 與 GPT-6 Astra 的價目表並排一比,差距荒謬得離譜:每百萬輸入 token 是 $2.00 對 $10.00,每百萬輸出 token 則是 $6.00 對 $50.00。把同樣這兩個模型送進 Artificial Analysis 的 Intelligence Index 跑一遍,差距就縮小到團隊真的能吵上一架的程度——每完成一項任務 $1.04 對 $3.26。標價上的倍數,輸入是 5 倍,輸出是 8.3 倍。但以真實 token 用量衡量的帳單倍數,只是略高於 3 倍。而這兩個模型差異最大的面向,上述兩者都不是。而是你等第一個 token 要等多久——獨立測得的數字是 10.94 秒對 342.30 秒。
那整場對決用一段話就能概括,而這就是為什麼本頁並不是對任何一方的加冕。GPT-6 Astra 是更聰明的模型,領先幅度明確且可重現。Grok 4.5 是較便宜的一方,這個差距真實存在,但遠比其價目表所暗示的要小得多。其餘的一切——速度、token 效率、上下文、程式設計基準——不是各有勝負,就是打成平手,再不然就是結果得用兩把不同的尺規來衡量。
這兩個都不是新模型
值得直說,因為許多比較頁面讀起來,彷彿兩者都是上週才出現的。
xAI 於 2026 年 7 月 8 日推出 Grok 4.5。它建構在 1.5 兆參數的 V9 基礎模型之上,並與 Cursor 以開發者工作階段資料共同訓練,而非僅靠靜態程式碼,這正是它享有代理式編碼美譽的來源。它具備 50 萬 token 的上下文視窗。其自家的供應商模型清單至今仍收錄它,與兩個後繼者並列——xAI 後來已推出 Grok 4.6 與 Grok 4.7——因此請將 Grok 4.5 視為 Grok 系列中的 $2/$6 價位層級,而非其頂點。
OpenAI 於 2026 年 9 月 3 日發表了 GPT-6 Astra,並在接下來幾天內分階段推出,而它至今仍是 OpenAI 的旗艦模型:100 萬詞元(token)的上下文視窗(OrcaRouter 的目錄列出 1,050,000 輸入與 128,000 最大輸出)、知識截止日為 2026 年 4 月 30 日,並明確定位於長時程的代理式工作——電腦操作、研究、科學與網路安全任務。就 OpenAI 自己的說法,這是首個通過其「Critical」網路安全門檻的模型,這也是為什麼企業存取預設為關閉,須由管理員啟用後才能使用。
兩者在各自供應商的 API 上均已正式推出。兩者都不是即將發布。這週唯一有變動的,是圍繞其中一款產品的家族,而這部分會留到本文最後再談,因為它改變的是推薦結論,而非比較本身。
費率表,包括那個沒人報價的層級
• 輸入,短上下文 — Grok 4.5 每 100 萬 $2.00 對比 GPT-6 Astra 每 100 萬 $10.00
• 輸出,短上下文 — Grok 4.5 每 100 萬 $6.00,對比 GPT-6 Astra 每 100 萬 $50.00
• 快取輸入 — Grok 4.5 每百萬 $0.30 對比 GPT-6 Astra 每百萬 $1.00
• 長上下文輸入 — Grok 4.5 每 100 萬 $4.00,相較於 GPT-6 Astra 每 100 萬 $20.00
• 長上下文輸出 — Grok 4.5 每 1M $12.00,對比 GPT-6 Astra 每 1M $75.00
• 上下文視窗 — Grok 4.5 500,000 tokens 對比 GPT-6 Astra 1,000,000 tokens
真正要緊的那項條款,幾乎沒有比較頁面會寫出來。在 Grok 4.5 上,一旦某個請求的提示達到 200,000 個 token,整個請求就會以較高費率重新計價——xAI 的文件明確指出,它會「對請求中的所有 token 按較高費率計費」,而不只是超過門檻的那些 token。所以 500,000 token 的區間確實存在,但其中大約最高的 60% 會以雙倍費率計費。OpenAI 的 Astra 定價頁面也列出同樣的短/長上下文雙欄結構,卻沒有說明其分界點落在哪裡,所以一旦你以規模化方式作業,就把長上下文那一欄視為適用的費率,並用你自己的帳單確認分界點。

Astra 的數字之上還疊著兩層服務級別乘數:Batch 與 Flex 以標準費率的一半計價,Fast 模式則以兩倍計價——短上下文下輸入 $20.00、輸出 $100.00。Grok 4.5 在 xAI 的價目表上沒有批次層級;它可運用的槓桿是快取折扣,以及以 2 倍計價的優先處理。
我們自己對這一切的立場是刻意地平淡無奇:OrcaRouter 以 0% 加成將供應商的定價原樣傳遞出去,因此上述兩份費率表在任一供應商調整它們的當天,就會在我們這邊同步生效,而快取權杖則依供應商的快取費率計費,而非全額價格。沒有第二個數字需要對帳。
工作負載的實際成本
標價在這裡不是好的參考依據,因為這兩個模型完成同一項工作所耗費的 token 數量並不相同。以一個程式碼代理任務為例,儲存庫上下文有 120,000 個 token,答案有 25,000 個 token。在 Grok 4.5 上,輸入是 $0.24,輸出是 $0.15,所以總共 $0.39。在 GPT-6 Astra 上則是 $1.20 和 $1.25,所以是 $2.45。差距達 6.3 倍。
現在把提示詞推過長上下文界線:輸入 300,000 個 token,輸出 20,000 個。Grok 4.5 收費為 $1.20 加 $0.24,即 $1.44。GPT-6 Astra 收費為 $6.00 加 $1.50,即 $7.50。差距壓縮到 5.2 倍,因為兩家供應商都將輸入費率加倍,而 Astra 的輸出倍數在最高層級收窄。
這兩者都不是 Artificial Analysis 所衡量的項目,而它的數字更有用。跑完整套 Intelligence Index 時,Grok 4.5 在高強度下每完成一項任務的平均成本是 $1.04,而 GPT-6 Astra 在最高強度下是 $3.26。當輸入價格相差 5 倍時,倍數卻降到 3.1 倍,原因是 token 效率:在整個指數中,Grok 4.5 產生了 77M 個輸出 token,而 Astra 產生了 60M 個。Astra 是較精簡的模型,因此它縮小了部分它在價格上拉開的差距。如果你一直在預算文件中引用「便宜五倍」,發票上會出現的數字是 3 倍。
速度不相上下。延遲則不然。
這是讓我們大感意外的發現,而且它違背了「便宜模型就是速度快的那個」這種直覺。
Artificial Analysis 測得 Grok 4.5 為每秒 55 個輸出 token,而 GPT-6 Astra 為 58。在同一版指標修訂上,這只是 5% 的差異,而且 AA 自己的摘要將兩者都描述為低於平均——比較中位數是每秒 74 個 token。如果吞吐量是你的選擇標準,這兩個模型分不出高下。直接明說,不要硬造出一個贏家:在唯一一個以相同方式為兩者測得的速度數字上,它們持平。
延遲把它們劇烈地分開。AA 指出,Grok 4.5 的首個回答 token 時間為 10.94 秒,端到端為 20.01 秒;GPT-6 Astra 則為 342.30 秒,端到端 350.91 秒。這大約是 31 倍,而在同步請求中,這差別就像轉圈等待圖示與去喝杯咖啡休息一樣。
在任何人为这件事编列预算之前,有两点必须诚实说明。第一,这些是包含推理在内的数字——AA 的「首个答案 token 时间」刻意把模型的思考时间计算在内——因此它们描述的是一项艰难任务,而不是一次聊天回合。第二,两者的努力程度并不一致:Astra 公布的条目是在 max effort 下,Grok 4.5 则是在 high effort 下,而努力程度设定正是会左右这个数字的那个旋钮。OrcaRouter 自家针对 GPT-6 Astra 的列表显示,在实际流量中,首个 token 时间的 p50 为 8.31 秒、p95 为 10.00 秒,这是完全不同的量测基准点——真实生产环境调用中的首个 token,而不是基准测试任务中的首个答案 token。两者不可相比,也不该被放在同一句话里当作比较。

程式設計基準測試:引用前先確認版本。
搜尋這個對決,你會找到 Grok 4.5 在 Terminal-Bench 2.1 上的 83.3%,對比 GPT-6 Astra 在 Terminal-Bench 4.0 上的 57.9%。那是掛著相同名稱的不同基準測試。它們無法互相比較,而把它們並列堆疊的比較頁面什麼也沒告訴你。
兩家廠商公布的大多數程式設計數據都有這個問題。xAI 針對 Grok 4.5 的數據表列出 SWE-bench Pro 64.7%、Terminal-Bench 2.1 83.3%、DeepSWE 1.0 62.0%,以及 DeepSWE 1.1 53%。OpenAI 針對 Astra 的數據表列出 Terminal-Bench 4.0 57.9%、OSWorld 2.0 72.6%、FrontierMath Tier 4 97.6%,以及 ARC-AGI-3 99.9%。這些全都是廠商自行回報的,而且幾乎沒有重疊。
有一個地方能讓這兩者真正在同一套測試框架下較量:Datacurve 的 DeepSWE v1.1,它讓每個模型都在相同的 mini-swe-agent 支架上執行 113 項原創且未受汙染的任務。在那裡,GPT-6 Astra 得分 74.1%,每項任務約 $6.52,而 Grok 4.5 則落在 53%。這是本頁最乾淨的單一結果,而且明顯對 Astra 有利。針對 Grok 4.5 還有一個額外但書:xAI 的 CursorBench 數據在發現先前的程式碼庫洩漏進訓練資料後,已被排除在公開比較之外,因此請將此模型的任何 CursorBench 數字視為不可用。
代理式行為與工具呼叫
這兩者以不同路線通往同一個目的地,而差異在於架構,而非分數。
GPT-6 Astra 面向開發者的功能,是假設你正在建構一個協調器。它支援非同步工具呼叫,因此等待某個工具不會阻擋模型繼續進行其他工作;透過 WebSockets 進行任務中途導引,讓執行中的作業能被重新導向而不必重新啟動;以及可在對話中途調整的推理投入程度。在 Codex 中,它新增了一套上下文保留機制,能在不同上下文視窗之間保留筆記,同時較早的上下文仍可搜尋。據報導,OpenAI 自家的系統卡指出,這個模型比前代更難監控,這正是應該把工具呼叫日誌與系統狀態——而非模型的敘述——當作你的稽核證據的理由。
Grok 4.5 的代理能力敘事,重點不在於新的基礎元件,而在於它的訓練地點。與 Cursor 在真實的多檔案編輯與除錯工作階段上進行共同訓練,是 xAI 歸功於其軟體任務符元效率的關鍵,也是該模型以預設形式出現在編程介面中,而非作為通用旗艦模型的原因。函式呼叫、結構化輸出、串流和提示快取全都支援;工具呼叫遵循 OpenAI 相容的格式,這就是為什麼將它放入現有客戶端只是變更基礎 URL 而已。
目前沒有雙方以相同投入程度出現的共同獨立代理式基準測試,因此我們不會在這裡憑空選出贏家。可以這麼說:Astra 的工具呼叫介面在長時程工作上比另一方更具表現力,而 Grok 4.5 的每任務 token 經濟性則對大量工作更具吸引力。
選 Grok 4.5 的話
• 您正在執行大量或高頻率的工作,此時每項任務的成本是決策的關鍵,而 AA Intelligence Index 上的 39 分已達到您的品質門檻。
• 您的提示詞都在 200,000 個 token 以下。這正是 Grok 4.5 價格優勢最大的區間,而且長上下文重新計價永遠不會觸發。
• 你要的是讓快取折扣真正發揮作用。每百萬個快取輸入詞元 $0.30,相較於 Astra 的 $1.00,重複前綴工作負載——冗長的系統提示、共用的儲存庫上下文——很快就能便宜下來。
• 你需要在困難任務上達到不到一分鐘的首個 token 延遲,且無法承受數分鐘的等待。
如果符合以下情況,就選擇 GPT-6 Astra
任務本身就是產品,而相較於一個錯誤答案,帳單不過是個四捨五入的誤差。在曲線的這一端,十四個指標點代表的是真實的能力差距,而非行銷話術。
• 你確實能在超過 500,000 個 token 的情況下持續運作。Astra 的視窗大約是 Grok 4.5 的兩倍,而且它是兩者之中唯一能在沒有重新定價條款的情況下達到這個水準的。
• 你需要電腦操作、深度研究,或網路安全態勢——包括 OpenAI 的「重大」(Critical)門檻所附帶、企業預設關閉的控制機制。
• 你正在撰寫協調器程式碼,想要非同步工具呼叫與執行中途引導,而不是直接的請求-回應呼叫。
本週有何變動,以及它為何會改變這項建議
於 2026 年 9 月 22 日,OpenAI 推出了 GPT-6 Sol 與 GPT-6 Luna,每百萬個 token 的價格分別為 2.00 美元/10.00 美元與 0.10 美元/0.50 美元,並表示這些費率是永久定價而非促銷價。Sol 是專為程式設計與分析打造的中階模型,輸入價格約為 Astra 的五分之一。
這對這個確切決策很重要。如果你當初拿 Grok 4.5 與 GPT-6 Astra 相比較的原因是價格,那麼在 OpenAI 這邊,誠實的比較對象已不再是 Astra——Astra 是旗艦,而 Sol 現在佔據的層級才是 Grok 4.5 真正競爭的所在。Grok 4.5 在輸出上仍然比 Sol 便宜(6.00 美元對 10.00 美元),在輸入上則與之持平(各 2.00 美元),因此它並未被取代;但本週之前寫成的比較,是把一款超值模型拿來跟旗艦相比,還把結果說成價格問題。
xAI 這邊也是如此:xAI 自家的模型清單在 grok-4.5 之外,還同時列出 grok-4.6 和 grok-4.7,因此 Grok 4.5 只是這個系列中的其中一個選項,而非當前的最前沿。

而這正是採用路由、而非挑選模型的真正理由。實務工作者文章中不斷出現的雙模型堆疊——把大宗工作送給便宜的模型,把困難的長尾升級給昂貴的模型——本身就是一項路由決策,而且是一項你可以用設定表達、而不必重寫的決策。OrcaRouter 把兩個模型放在同一個 API 與同一把金鑰之後,供應商定價以 0% 加成原樣轉嫁,跨供應商自動容錯移轉,並提供路由 DSL,讓你將低於門檻的工作送到 grok/grok-4.5,並升級到 openai/gpt-6-astra(當任務失敗或超過規模界線時)。你可以在小部分流量上試用昂貴路徑,而不必拿正式環境的管線去賭它。
簡短版本
GPT-6 Astra 是更好的模型。這完全不是勢均力敵,而如果本頁假裝不是如此,那它將毫無價值——在同一個索引修訂版上,53 對 39;在兩者都參加過的唯一一項程式設計基準測試上,74.1% 對 53%。
Grok 4.5 是價格較低的模型,但以每完成一項任務計算只便宜 3.1 倍,而非其價目表所暗示的 5 倍至 8.3 倍,因為 Astra 達到同樣成果所耗用的 token 較少。而在唯一一項對兩者以相同方式測得的速度數據上,兩者不相上下。
決策點不在於哪個模型勝出。而在於,14 點的指標差距,是否值得在你特定的工作負載上換來大約三倍的費用——以及你送出的每一個請求,答案是否都相同。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
