
什麼是 Grok 4.5?以代幣經濟性而非頂尖分數為賣點的 V9 旗艦
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok 4.5是該供應商——這家如今以 SpaceXAI 品牌出貨並行銷的公司——推出的 1.5 兆參數混合專家推理模型,於 2026 年 7 月 8 日發布。它接受文字與圖像輸入,回傳文字,具備 500,000 個 token 的上下文視窗,定價為每百萬個輸入 token 2.00 美元、每百萬個輸出 token 6.00 美元。正是這個模型把「每項完成任務的 token 數」放上了發表會投影片的醒目位置,而實驗室此後也以它為基礎,打造了兩款更新的旗艦模型。
最後那個子句,正是這頁之所以需要寫出來的全部理由。搜尋「Grok 4.5」,你會找到七月的發布報導:與 Cursor 的合作、那句「Opus 級」的說法、每秒 80 個 token 的宣稱。你找不到的,是對開發者在九月底真正會有的問題給出直接答案:在 Grok 4.6 和 Grok 4.7 以相同定價存在的情況下,Grok 4.5 是否還值得接入任何東西。所以這頁是參考條目,不是新聞報導:這個模型是什麼、它位在何處、它在哪些方面可衡量地表現得好、在哪些方面可衡量地表現得差,以及誰應該改選其他東西。這裡沒有任何內容被包裝成發布,因為它並不是發布。
關於資料來源,因為在這類頁面上,這件事比平常更重要:下文每一個數字都會標明其來源。xAI 公布自家模型的數字,會標示為廠商回報。來自 Artificial Analysis 的數字則是獨立測量結果,直接讀取自 2026 年 9 月 23 日的模型頁面。若某個數字無法以第一手來源確認,本頁會如實說明,而不是加以估算。
Grok 4.5 在其所屬家族中的定位——而它並非頂尖
Grok 4.5 相關報導中最常見的單一錯誤,就是把它當成旗艦模型。它確實曾是旗艦,但大約只有五週。此後,xAI 已於 2026 年 8 月 12 日推出 Grok 4.6,並在 9 月初推出 Grok 4.7,兩者的價格仍維持在每百萬個 token 2.00 美元與 6.00 美元。Grok 4.5 現在位於產品線中段:能力比廉價層級更強,卻落後最前線兩個世代,而且——這才是重點——它是目前 Grok 系列中唯一快取輸入費率比後繼模型更便宜的模型。根據 xAI 自家的定價表,Grok 4.5 的快取價格為每百萬個 token 0.30 美元;Grok 4.6 和 Grok 4.7 的快取價格則都是 0.50 美元。
以下是廠商定價文件目前所列出的陣容,所有數字皆以每百萬個 token 為單位,且全部由廠商公布:
• Grok 4.20(三種變體:多代理、推理、非推理)—— 1M 上下文,輸入 $1.25/輸出 $2.50,快取 $0.20,2026 年 3 月 31 日推出
• Grok 4.3 — 1M 上下文,輸入 $1.25 / 輸出 $2.50,快取 $0.20,外加批次折扣;取得一百萬個 Grok 上下文 token 的最便宜方式
• Grok 4.5 — 500K 上下文,輸入 $2.00 / 輸出 $6.00,快取 $0.30,於 2026 年 7 月 8 日發布
• Grok 4.6 — 50 萬上下文,輸入 $2.00 / 輸出 $6.00,快取 $0.50,2026 年 8 月 12 日發布
• Grok 4.7 — 500K 上下文,輸入 $2.00 / 輸出 $6.00,快取 $0.50,於 2026 年 9 月上旬推出
• Grok Build 0.1 — 256K 上下文,輸入 $1.00 / 輸出 $2.00,是程式設計專門模型而非通用模型
有兩件事從那份清單中浮現。第一,Grok 4.5 在不再是指標旗艦時並沒有降價——它維持了旗艦價格,這表示除非你特別想要較便宜的快取費率,或是被綁定在 4.5 快照上,否則同樣的錢現在選 Grok 4.6 絕對更划算。第二,Grok 4.5 的上下文長度只有 Grok 4.3 和 4.20 系列的一半,輸入價格卻是兩倍。V9 基礎模型就是原因:1.5 兆個參數,大約是 Grok 4.3 的三倍大,而更大的基礎模型正是以視窗為代價換來能力的原因。
如果你真正需要的是預算有限的長上下文,那麼在這個系列裡,Grok 4.3 才是老實的答案,而 Grok 4.5 不是。那項取捨——能力與上下文視窗之間的取捨——是 Grok 產品線中的關鍵抉擇,值得直言不諱,而不是假裝較新的編號在各方面都更好。
規格表

這些是 xAI 在其自家模型頁面上發布的規格,不是第三方的估計:
• 模型識別碼 — grok-4.5,另有以下別名:grok-4.5-latest 與 grok-build-latest
• 模態 — 文字與圖像輸入,文字輸出。圖像可作為輸入;模型不會生成圖像
• 上下文視窗 —— 500,000 個詞元,由提示與回應共用,而非 500K 輸入再加上獨立的輸出額度
• 授權條款 —— 專有。沒有開放權重,也沒有可下載的檢查點;你必須透過 API 或供應商自家產品才能使用 Grok 4.5
• 定價 — 每百萬輸入符元 $2.00,每百萬輸出符元 $6.00,快取輸入 $0.30
• 長上下文定價——當提示詞達到 200,000 個 token 及以上時,費率將調整為 $4.00 輸入 / $12.00 輸出 / $0.60 快取,且較高的費率適用於每一個請求中的 token,而不僅僅是超過門檻的 token。這是本頁面上最不容錯過的昂貴細節
• 推理控制 — 四個等級,low、medium、high 與 xhigh,預設為 high。推理無法完全關閉,且推理 token 會以輸出 token 計費
• 工具與格式支援——原生支援函式呼叫與結構化輸出。伺服器端搜尋工具會在權杖用量之外另行計費;我們無法在供應商的模型頁面上確認目前的每次呼叫費率,僅能確認確實有此收費項目。
• 速率限制 — 每秒 150 次請求,以及每分鐘 5,000 萬個 token
• Batch API — 與 Grok 4.3 不同,Grok 4.5 不支援
• 服務區域 —— 上線時為 us-east-1 與 us-west-2。歐洲地區的可用性在首日明確尚未提供,供應商表示預計於 2026 年 7 月中旬推出;我們並未找到其後的一手來源聲明可確認確切的開放日期,因此在此將歐盟時程視為未經確認。
有一處不一致值得記錄下來,而不是粉飾帶過:OrcaRouter 自家目錄中 grok/grok-4.5 的條目顯示快取讀取費率為每百萬 $0.50,這與 xAI 對 Grok 4.6 和 Grok 4.7 的收費相符,而非供應商定價表中 Grok 4.5 的 $0.30。供應商的文件是價格的權威依據;我們的頁面似乎沿用了後繼版本的快取費率,而這一點已被標記出來,而非在此悄悄重複。
Grok 4.5 確實在哪些方面表現出色
發表時最受矚目的說法是詞元經濟效益,而這是發表頁面上唯一一項背後有機制支撐、而不只是分數的說法。在 SWE-bench Pro 上,xAI 報告指出,Grok 4.5 在每個已解決任務上平均輸出 15,954 個詞元,而 Claude Opus 4.8 以最大努力執行時則為 67,020 個——完成同樣的工作,詞元數大約少了 4.2 倍。每個已解決任務的輸出詞元更少,正是模型只是比較便宜,與模型比較便宜且以實際時間計算也更快之間的差別,因為輸出詞元正是你要等待的東西。這是廠商自行回報、在廠商自家測試框架上取得,且未經任何獨立第三方重現的結果——但這是一項結構性主張,不是刻意挑選的百分比。
廠商的基準測試表隨模型一同發布,因此通篇都是廠商自行報告的;拿來對照同一批模型時,讀起來是這樣:
• DeepSWE 1.0 — Grok 4.5 62.0%,落後於 Claude Fable 5 的 66.1% 及 GPT-5.5 的 64.31%,領先 Claude Opus 4.8 的 55.75%
• SWE Marathon,解決率 — Grok 4.5 為 29.0%,領先 Claude Opus 4.8 的 26.0% 與 Claude Fable 5 的 24.0%。這是 Grok 4.5 唯一領先全場的程式設計基準測試
• Terminal-Bench 2.1 — Grok 4.5 83.3%,實際上與 84.3% 的 Claude Fable 5 和 83.4% 的 GPT-5.5 不相上下,並領先 78.9% 的 Claude Opus 4.8
• DeepSWE 1.1 — Grok 4.5 53%,落後 Claude Fable 5 的 70% 與 GPT-5.5 的 67%
• SWE-bench Pro — Grok 4.5 64.7%,落後於 80.4% 的 Claude Fable 5 與 69.2% 的 Claude Opus 4.8
誠實的解讀是:Grok 4.5 在長程任務的解決上、以及在完成任務的成本效益上勝出,卻在較困難的單次編碼基準測試上落敗。它是個適合代理迴圈的好模型,面對單次硬問題則表現平平——而這樣的分野,正是那個詞元效率數字所預測應有的結果。

獨立評測的樣貌較單薄,而這正是本頁必須謹慎處理的地方。Artificial Analysis 目前將 Grok 4.5(high)列為 Intelligence Index 分數 39,在 212 個模型中排名第 52,採用 index 版本 v4.3.2——高於同類模型的中位數 25,但並未接近前列。如果你在七月的報導中看過這個模型被引用為 54 或 56 的分數,請不要拿它與 39 相比:Artificial Analysis 自發布以來已修訂過該 index,這兩個數字來自不同的修訂版本。這正是那種會讓基準測試表格失去可信度的過時數字比較,也是本頁在引用分數時一併註明 index 版本的原因。
Grok 4.5 在哪些方面可衡量地表現不佳
Artificial Analysis 回報的輸出速度為每秒 55.1 個 token,在 212 個模型中排名第 126,低於中位數 74——距離 xAI 在發表時所宣稱的每秒 80 個 token 還有一大段差距,距離目前最快模型所繳出的每秒約 340 個 token 更是遙遠。報告也指出,首個 token 的產生時間為 10.94 秒,而中位數是 3.86 秒。high這兩個數字合在一起,正說明了預設為 high 且無法關閉的推理模型真正的代價:你得先等,然後它講話又慢。若把推理層級留在預設值,Grok 4.5 會讓你覺得它像你 API 金鑰上最慢的模型。
還有三項經過衡量的負面因素,依其應對決策造成多大影響的順序排列:
• Artificial Analysis 已將 Grok 4.5 標記為已淘汰,並表示它只會繼續針對預設的 10,000-token 輸入工作量對其進行基準測試。這是第三方在告訴你,它已停止完整衡量你正在考慮的模型,並建議改用 Grok 4.6。在排行榜上被標記為已淘汰,並不代表在 API 上無法使用——這表示獨立證據基礎已被凍結。
• 它在兩項最接近高難度單次編碼的基準測試中敗下陣來:DeepSWE 1.1 與 SWE-bench Pro,而且根據 xAI 自家的表格,這兩項都輸給了 Claude Fable 5 和 GPT-5.5。
• 它的上下文只有 Grok 4.3 的一半,輸入價格卻是兩倍,而且完全沒有批次 API。如果你的工作負載是長文件處理或離線批次推論,Grok 4.5 在自己家族中就是錯誤的模型
就幻覺與校準而言,本頁無法確認目前的獨立數據。七月的報導曾流傳約 54% 的幻覺率,但我們無法在我們所閱讀的 Artificial Analysis 模型頁面上核實那個數字,而它也沒有出現在廠商頁面上。與其重複一個我們無法查證來源的數字,我們在此將其記錄為未測量。
誰應該選擇 Grok 4.5,而誰又應該選擇其他方案?
選擇 Grok 4.5如果你正在執行代理式迴圈,而每項完成任務的成本比每權杖成本更重要,而且你已經實測 V9 的權杖經濟行為在你的工作負載上成立,那就選它。如果你需要一個 Grok 系列快照,在大型、穩定、反覆命中的前綴上具備 $0.30 的快取輸入費率,那也是正確的選擇——該快取費率確實比 Grok 4.6 和 Grok 4.7 收取的費用便宜,而在快取密集的工作負載上,那項差異可能勝過兩代的能力。
改選 Grok 4.6 或 Grok 4.7,其餘幾乎所有情況都該這麼做。同樣的牌價、同樣的 500K 視窗、更新的訓練資料、更好的獨立評測分數,還有 Artificial Analysis 自家的推薦。今天不管是哪一種「我想要最強的 Grok」,答案都不會是 4.5。
若脈絡長度是限制條件,就選 Grok 4.3:100 萬個 token,價格為 $1.25 與 $2.50,還享有 Grok 4.5 未提供的批次折扣。長文件 RAG 與整份儲存庫分析仍是它的地盤。
選擇這個家族以外的東西如果你追求的是巔峰分數,而非每項任務的成本,這點就成立——在 xAI 自家的比較表中,Claude Fable 5 領先每一項程式編寫基準測試,而 GPT-5.5 在 DeepSWE 1.0 和 1.1 上也領先 Grok 4.5。如果你想要開放權重,並且能接受較小的模型,那完全是另一種採購,沒有任何 Grok 模型能在這方面競爭。
在沒有第二份合約的情況下呼叫 Grok 4.5
Grok 4.5 已在 OrcaRouter 上線,售價為 xAI 的定價,供應商費率以零加成原樣傳遞——因此上方的 $2.00 與 $6.00 就是您實付的價格,而供應商一旦調價,我們這邊也會在同一天反映。對這個特定模型而言,這點比平常更為要緊,因為多數讀者面對的抉擇並非「Grok 4.5 或什麼都沒有」,而是「Grok 4.5、Grok 4.6 還是 Grok 4.3」,而比較同一系列的三個模型,正是單一端點橫跨200 多個模型能讓其變得划算之處。一組金鑰、無需第二份合約,A/B 測試只需改個字串,而非一次整合。
這裡的故障轉移論點格外具體。Grok 4.5 仍可路由,但已不再由獨立追蹤機構完整評測,也不再是廠商的旗艦——這個模型你可能會想放進備援鏈,而不是當成唯一路徑。跨供應商的自動故障轉移正是這種機制,讓你保留它擅長的部分,又不必把生產路由押在一個生態系已開始超越的快照上。
這一頁不會做的,是假裝這個選擇顯而易見。Grok 4.5 是一款優秀的模型,有其特定的強項,但它所屬的系列中,同樣的價錢如今已能買到更新的版本。如果你今天才剛要起步,誠實的建議是選 Grok 4.6。如果你已經在代理迴圈中運行 Grok 4.5,而且它能在你編列預算的 token 數量內完成任務,那麼誠實的建議是什麼都別改,一季之後再重新評估。

Grok 4.5 今日已可在 OrcaRouter 上進行路由,Grok 4.6、Grok 4.7 和 Grok 4.3 也是如此。OrcaRouter以零加成的方式將供應商的定價原樣傳遞出去,因此供應商調價的當天,我們這邊也會同步生效;而在兩個 Grok 模型之間轉移工作負載,只需修改一個字串,而不必再簽一份合約。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
