
Gemini 4 Argon 在 Gemini 4 階梯中的定位——以及為何沒有 G4 Ultra
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
對於促成這篇文章的那個問題,簡短的答案是:Gemini 4 Argon 是 Google 最頂尖的模型,卻不是它的最高層級,因為它之上的層級目前還不存在——而且很可能不是任何人預期的形式。Google 至今只發布了一款 Gemini 4 模型,也就是 Argon;而在自家網域上,該路徑底下的唯一第一方頁面是/models/gemini/ultra/,它根本不是模型頁面:它會重新導向 Google AI 訂閱方案。那個重新導向是本文中最有用的一項事實,而且只要在終端機輸入一行就能查證。其餘的內容,談的都是當你不再把 Argon 的價格讀成層級標籤、而是開始把它讀成一個數字之後,Argon 實際上位於什麼位置。
有兩件事同時為真,而且很容易混淆。Argon 是現存能力最強的 Gemini,而 Argon 並不是前沿級模型。它領先所有已推出的 Google 模型,幅度大到這種比較根本稱不上比較;而它在 Artificial Analysis 的 Intelligence Index 上,與兩個相互競爭的旗艦模型僅相差不到一分,這兩個旗艦本身又整整落後目前領先者五分。Google 為它定價時,彷彿它位處前沿之下一個層級,而獨立測量結果也認同這點。因此,這個價格並不是一個低估該模型的行銷決策。它是對該模型準確的陳述。
這是目前已知資訊的整理。Gemini 4 Argon 於 2026-09-30 在 Google DeepMind 一篇署名 Koray Kavukcuoglu 的貼文中宣布,並透過 Google 的 Fairwind Program 率先向一群具名的網路防禦人員推出——不是提供給開發者、企業、消費者,也不是提供給任何有信用卡的人。它在 Gemini API 中沒有模型 ID、沒有端點,也沒有公開的每 token 價格可供計費。針對它,並不存在模型識別符、在真實流量上測得的輸送量與可靠性,這表示下方的量測結果只是某間實驗室的一次基準測試,僅此而已。若某項數字來自 Google,就會標示為 Google 的;若來自 Artificial Analysis,就會標示為他們的。本文不應被解讀為主張 Argon 是可購買的產品。
實際推出的階梯,從其自身頁面讀出
回答「Argon 在 Gemini 4 陣容中位居何處」最快的辦法,就是別再問陣容,而是開始列出 Google 有為其發布頁面的模型。陣容是行銷概念;頁面才是事實。以下是截至 2026 年 10 月 1 日,第一方路徑所解析到的結果。
• deepmind.google/models/gemini/pro/ 會回傳 200,且其標題為「Gemini 3.1 Pro — Google DeepMind」。Google 自家網站上的 Pro 欄位仍是 3.1 世代的模型。
• deepmind.google/models/gemini/flash/ 會回傳 200,且其標題為「Gemini 3.8 Flash — Google DeepMind」。Flash 這個位置已經變動過三次——3.5、3.6、3.7、3.8——而 Pro 這個位置則完全沒有變動。
• deepmind.google/models/gemini/argon/會傳回 404。Argon 不會有專屬的個別模型路徑。它的首頁是 deepmind.google/models/gemini/ 這個系列頁面,也就是 Google 放置目前主推模型的地方。
• deepmind.google/models/gemini/ultra/會回傳 302,並導向one.google.com/about/google-ai-plans/,也就是消費者訂閱頁面。較舊的路徑也是如此:deepmind.google/technologies/gemini/ultra/。Google 模型路徑上的「Ultra」是計費層級,而不是檢查點。
• deepmind.google/models/gemini/nano/會 301 重新導向至 Gemini 系列頁面。Nano 也沒有作為獨立模型頁面的位置。
• deepmind.google/models/gemini/model-cards/——這是 Google 為其歷來發布的每一份模型卡所維護的索引——並未收錄 Argon,也沒有任何名稱含「Gemini 4」的條目。其中最新的 Gemini 品項是 3.8 Flash、3.8 Audio、3.7 Flash、3.6 Flash、3.5 Flash、3.5 Flash-Lite 與 3.1 Pro。模型卡索引是這組文件中更新最慢的一份,因此它的沉默並不證明 Argon 永遠不會有模型卡;它只證明文書作業還沒趕上發布的消息。
• deepmind.google/models/,模型索引將「Gemini 4 Argon」列為旗艦卡片,標語是「我們下一個前沿智慧時代」,就在「Gemini 3.8 Flash——最適合大規模處理複雜代理式任務」的正上方。兩張 Gemini 卡片,相隔一個世代,依此順序排列。
把這些放在一起看,這座階梯的輪廓就毫不含糊了。Google 目前公開的模型陣容中,在 Gemini 4 這一階有一個條目,在 Gemini 3.8 這一階有一個條目,還有一個落後三個半世代的陳舊 Pro 階層,而在這一切之上什麼都沒有。Google 網域上的「Ultra」一詞指向的是訂閱服務。沒有 Gemini 4 Pro 頁面,沒有 Gemini 4 Flash 頁面,沒有 Gemini 4 Ultra 頁面,也沒有 Gemini 4 模型卡。Google 發表的是單一模型,不是一個系列。
有 Gemini 4 Ultra 嗎?證據,以及什麼會證偽它
這值得自成一個段落,因為這是這個問題中最可能在一週後得到不同答案的部分,也因為誠實的答案是有保存期限的。
反面證據是具體的,而非含糊籠統。Ultra 路徑導向訂閱方案頁面所出現的 302,並不是微弱的訊號;那是 Google 自家網站團隊所設定的重新導向。多個用於 Gemini 4 Ultra 文章的 blog.google 網址模式都回傳 404——產品路徑、innovation-and-ai 的 models-and-research 路徑,以及單純的公告路徑。Ultra 這個命名在這裡是有先例可循的,而這個先例反而不利於 Gemini 4 Ultra 的存在。Google 最初發表 Gemini 時,介紹的是「針對三種不同規模最佳化:Ultra、Pro 與 Nano」的 Gemini 1.0,並將 Gemini Ultra 描述為「我們最大、能力最強的模型」。一篇點名三種規模的發布文章,正是家族式發表會該有的樣貌。Argon 的文章只點名一個模型,完全沒有同系列的其他成員。Google 後來淘汰了 Ultra 這個模型名稱,改用數字分級,並把這個詞移到業務的訂閱端,如今它命名的是最高階的消費者方案。當行銷網站已把周邊清理乾淨之後,一個被淘汰的模型名稱會是什麼模樣——就是一個會重新導向到方案頁面的模型頁面。
這份公告中也沒有任何內容承諾會有更大的同系列機型。Argon 的發布文章將 Argon 描述為「我們全新的前沿模型」,並說明了分階段推出、防護措施工作與內部部署,然後就結束了。它沒有說「Gemini 4 家族中的首款」,沒有預告 Pro 或 Ultra,也沒有點名任何後繼型號。Google 自己的定調把 Argon 當成就是那個本體,而不是較小的那一個。
什麼情況會推翻這個結論,說起來很容易,也值得密切留意,因為其中任何一項都可能在一天內讓它翻轉。
• 在 deepmind.google/models/gemini/ultra/ 上回傳 200,且該網址呈現的是模型頁面而非方案頁面,或是出現一個新的 models/gemini/ 子路徑,與 pro 和 flash 並列。
• 模型卡索引中出現了一列 Gemini 4 Ultra,這正是 Google 歷來用以確認某個模型已作為一份有文件記載的人工製品而存在的方式。
• Gemini API 中 gemini-4-*命名空間裡的第二個模型 ID。Argon 目前沒有任何這類 ID,因此 Pro 或 Ultra 的 ID 將是該系列確實存在的首個證據。
• Artificial Analysis 模型清單中的一筆項目,或是家族頁面上帶有第四欄的基準測試表。這兩者對 Google 發布內容的追蹤都夠緊密,因此能提早得知。
• 一則 Google I/O、Cloud Next 或 DeepMind 的公告貼文,在談到 Gemini 4 時使用了「family」這個詞。Argon 的貼文則沒有。
在至少其中一項成真之前,任何宣稱 Gemini 4 Ultra 即將推出的文章,都是披著報導外衣的預測。請據此看待,包括我們自己的報導在內。

將價格階梯解讀為層級聲明
定價是這件事中 Google 刻意公布、還附上註腳的唯一部分,也是整場發布中最清楚表達分層意圖的陳述。Argon 的首發價格是每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入則享 95% 折扣;而 Google 自己的註腳一寫道,在一個它無法界定的首發期過後,「每 1M 輸入 token 4 美元、每 1M 輸出 token 20 美元的價格將適用。」
把那兩對拿去跟全場比對一下,分級的主張自然就不言自明。
• $4 / $20 是 Claude Opus 5.5 的定價。Google 對 Argon 的優惠期後價格,恰好落在當前前沿領導者的價目表上,而這個模型的評測成績卻落後它五個百分點。
• $2 / $10 是 GPT-6 Sol 與 Claude Sonnet 5.5 兩者都落於的促銷價格帶。Argon 的首發價格同樣是 $2 / $10,這使得 Argon 的上市定價與中階 Sol 落在同一價格帶,而非前沿價格帶。
• Claude Fable 5.1 與 GPT-6 Astra 都落在 $10 / $50 這個價位。Argon 是 Fable 5.1 輸入價格的五分之一,也是其輸出價格的五分之一,而它的分數與 Fable 5.1 相差在 0.8 以內。
• $0.75 / $3.75 是 Gemini 3.8 Flash。Argon 在輸入上是它的 2.7 倍,在輸出上也是 2.7 倍——是平順的升級,而非斷崖。
所以 Google 把 Argon 定價為一款應落在 $10/$50 以下、$0.75/$3.75 以上的模型,最終落點在 $4/$20。這個定價階梯完全看不出「前沿」的意味。它說的是「中階區間的頂端,帶著一個最終會落在與領導者現行收費相同水準、但能力更少的招牌數字」。那是有其道理的商業選擇。這不是一款定位成領先任何對手兩個層級的模型會有的定價。
有一個值得留著的結構性重點:Argon 的價格級距是貨真價實的級距,定義在註腳裡,而且沒有標註日期。Sonnet 5.5 與 GPT-6 系列在長上下文分層上也做了類似的事,而 Sol 在超過 272K 之後跳到 $4/$15。Argon 的級距是依時間而跳,不是依上下文長度——同樣的 $2/$10 適用於整個 1M 視窗,只有日曆會改變費率。這是一種不尋常的形態,也讓任何與 Argon 的成本比較都成了雙欄的功課:哪個時期,以及哪種用量。
根據現有數據,Argon 與競爭對手相較的定位
Artificial Analysis 對 Gemini 4 Argon 的測量出得夠快,因此這是唯一可取得的獨立讀數。在 10 月 1 日當時的最新修訂版——v4.3.2——中,Argon 在高推理投入設定下,於 Intelligence Index 取得 52.56 分。它周遭的模型並不是該領域的隨機樣本。
• Claude Opus 5.5 為 57.62,是在最高投入搭配備援下測得。這比 Argon 高出五點多,且是目前排行榜的榜首。
• Claude Fable 5.1 為 53.35,這是在最高努力程度並搭配備援的情況下測得。Argon 落後它 0.79。
GPT-6 Astra 為 52.67,於最大值時測得。Argon 落後它 0.11。
• Claude Sonnet 5.5 落在 55.98,同樣也是在搭配 fallback 時的最高值。這是一個中階模型,卻以 3.4 分之差勝過 Argon;而這個數字應該讓任何想搬出「Gemini 4 Argon 是全球第二好的模型」這套說法的人感到憂心。
• GPT-6 Sol 在 872K 上下文視窗下,以最大值測得 47.63。Argon 領先它 4.9。
• Gemini 3.8 Flash 在高強度設定下為 40.93。Argon 領先它 11.6 分。
• Gemini 3.1 Pro Preview 的成績為 29.72。Argon 領先它 22.8,這是對 Google 現行推出的 Pro 等級已落後自家研究多遠,最清楚不過的說明。
從那份清單中可以得出三件事。首先,Argon 與兩個挑戰者 Fable 5.1 和 Astra 處於同一水平,但明顯落後於兩個 Anthropic 模型——Opus 5.5,以及更尷尬的是,Sonnet 5.5。其次,Argon 與 Google 自家已發布的最佳模型之間的差距,是當前陣容中最大的世代躍進,而且遙遙領先。第三,該訊號所描述的「前沿至少領先兩個層級」在實質上是正確的,但在幾何結構上略有偏差:有一個模型層級明顯領先 Argon(Opus 5.5,得分 57.6),而另一個較便宜層級的模型也領先它(Sonnet 5.5,得分 56.0),這比 Argon 實際所處的階梯上落後兩級是更為尖銳的問題。
原始問題中「比價」的框架——「價格顯示這是他們相當於 Sol/Sonnet 的產品」——結果大致說對了推出時的價格,卻說錯了最終價格。Argon 一開始採用 Sol 和 Sonnet 5.5 的費率,最後則落在 Opus 5.5 的費率。它的定價像中階模型,卻打算成為前沿定價的模型,而實測表現兩者皆非。
每項任務成本這張圖,是 Argon 最強的地方,也是層級故事出現第二個維度的所在。在 Index 任務上,Argon 花費 $1.99,並輸出 142,374 個 token。Opus 5.5 花費 $5.98,輸出 338,099 個。Sonnet 5.5 花費 $7.62,換得 599,849 個。Fable 5.1 花費 $7.63,換得 187,455 個。Astra 花費 $3.26,換得 68,691 個。Gemini 3.8 Flash 花費 $1.24,換得 154,230 個。Argon 是買到接近前沿分數最便宜的方式,而且它比分數高於它的 Flash 模型,每項任務便宜不到一美元。
努力設定是上述一切的但書,而這個領域並未一致地報告這些設定。Argon 是以 high 測量;Opus 5.5、Fable 5.1 和 Sonnet 5.5 是以 max 搭配 fallback 測量;Astra 和 Sol 則是以 max 測量。高強度執行與 max 強度執行並不是同一種測量,而 Anthropic 自家的強度階梯會在設定之間讓模型移動好幾分。如果 Argon 在 max 強度下測得的分數顯著高於 52.6,那麼分級論點就會改變。還沒有人發表過那項執行結果。
Google 自家的表格聲稱了什麼,以及它與獨立表格有何不同
Gemini 家族頁面上有一張由 Google 撰寫的效能表,包含四個欄位——Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5——以及十九個基準測試列。這是 Google 為此模型發布過最詳盡的一組宣稱,而且全篇皆由廠商自行提報。將它與獨立 Index 對照閱讀之所以深具啟發性,正是因為兩者對這個領域的樣貌並不一致。
• 在 Google 的表格中,Argon 在十九行中有十三行單獨勝出或並列第一,包括 Vals Index Knowledge work 的 68.9、AutomationBench 的 51.3、Harvey’s Legal Agent Benchmark 的 19.6、DeepSWE v1.1 的 77.9、LABBench 2 的 88.8、GraphWalks 在 ≤128K 區段的 99.7 與 256K–1M 區段的 84.2、Agent’s Last Exam 的 39.5、LVBench 的 91.7,以及 Chartography 的 71.6。
• Claude Opus 5.5 在那些讀來像是持續性工程的列別中勝出:FrontierSWE v2 以 62.3 對上 Argon 的 55.0,Terminal-bench 4.0 以 66.4 對上 57.4,Terminal-Bench Science 0.1 以 63.3 對上 57.6,而 PostTrainBench 則以 49.3 對上 45.3。
• GPT-6 Astra 在 Terminal-Bench Science 0.1 上取得 68.1,在 OSWorld-2.0 離線子集上取得 72.6,並在 CWE-bench v1 上以 68.0 與 Argon 打成平手。Claude Fable 5.1 除了在 Vibe Code Bench 上並列平手外,其餘每一項皆落敗。
• 在獨立的 Index 上,排序是 Opus 5.5 第一,接著是 Sonnet 5.5,然後是 Fable 5.1,而 Argon 與 Astra 實際上並列。Google 的表格根本沒有 Sonnet 5.5 這一欄,這是其中影響最深遠的遺漏:該表格的四個欄位是經挑選的,而在 Index 上以更低價格排名高於 Argon 的那個模型,並不在其中。
這一切都沒讓 Google 的表格變得不誠實。廠商基準測試表是經過挑選的,不是抽樣得來的,而每一家實驗室的表也都是如此。這讓它成為一項主張,而不是一項測量,也意味著無法從它來解決分級問題。這張表對本文唯一真正有支撐作用的地方,在於那個否定性事實:十九列、四欄,而且沒有留給 Ultra 的第五欄。

Argon 唯一完全不是分級問題的一件事
上述每個層級論點都假設 Argon 是你最終可以呼叫的模型。這一點值得與定位問題分開來看,因為兩者的答案不同,而其中只有一個與能力有關。
Argon 的輸出 token 上限是 100 萬個 token,高於先前的 64K,而 Google 也直接這麼表明。那是輸出上限,不是上下文視窗。這項區別很重要,因為在這場發布的報導中,這兩者經常被混為一談,也因為 100 萬的輸出上限與 100 萬的上下文視窗是不同的工程宣稱——前者關乎單一軌跡能跑多長,後者關乎你能一次交給模型多少東西。Google 對輸出上限說得明白,對上下文視窗則保持沉默。Artificial Analysis 也把 Argon 的上下文記錄為 1,000,000 個 token,但那是該追蹤網站的欄位,不是 Google 的聲明,所以即使這兩個數字讀起來相同,也該把它們當成來自不同來源。
明確無疑無法取得的是存取權。Argon 並未全面開放,它不在 Gemini API 中以任何識別名稱提供,也不在任何第三方型錄中。它僅透過 Fairwind Program 提供給經過審核的網路防禦人員,以及 Google 自家的工程師;而 Google 所點名的下一階段——「先從付費 API 客戶與 Google AI Ultra 訂閱者開始」——並未附上任何日期。你無法在自己的工作負載上對它進行基準測試。因此,本文中的每一個數字,都是別人對一個你無法使用的模型所做的測量。
什麼能讓 Argon 更上一層樓
等級判定只是一張快照,而大約有五件事會改變這一項判定,大致依照它們的影響程度排序。
• 一項經獨立測量的最大努力程度執行。Argon 目前是一項高努力程度的測量,分數為 52.56。Anthropic 自家的努力程度階梯在不同設定之間會讓模型分數變動數分,而如果 Google 的模型在最大設定下也有類似表現,那麼 Argon 相對於 Fable 5.1 與 Astra 的實際位置,就會比這篇文章所說的更好。這是最有可能發生的單一變化。
• 第二個量測來源。一個追蹤器就是一次量測。由第二個獨立實驗室以自身測試框架為 Argon 評分,對等級主張的幫助會比 Google 提供的任何額外基準測試資料列更大。
• 一款 Gemini 4 Pro。如果 Google 在 Argon 之下開設第 4 代的 Pro 層級,產品陣容就會變成一個有明確輪廓的家族,Argon 的地位就不再是「唯一」,而是開始成為「三者之頂」,而本文中每一個關於缺少家族(產品線)的論點都必須改寫。這值得關注,而且比 Ultra 的問題更迫近。
• 一個不會調漲的價格。如果優惠導入期乾脆永遠不到期——Google 尚未界定它何時結束——Argon 的實際常態價格就是 $2/$10,而非 $4/$20,而其相對於 Opus 5.5 的每項任務成本優勢,會從大約 3 倍擴大到大約 6 倍。這是商業層面的事件,而非能力層面的事件,但它會改變採購決策的樣貌。
• 一份 Argon 模型卡、系統卡或評估方法論頁面。效能表連結到 Google 網域上的一個方法論頁面;一份完整的模型卡會將上下文視窗、部署配置與安全包絡列入正式紀錄,而且會是第一份讓 Fairwind 群體之外的人得以查核 Google 數字、而非只是閱讀它們的產物。
反過來說,最可能讓 Argon 排名下滑的因素,根本與基準測試無關。而是九月三十日彭博社的報導,該報導引述了能接觸該模型的 Google 員工的說法,指出它在實際工作上的表現不如其分數所顯示。這項說法未經 Google 以外任何人證實,也並非一種測量結果,但這類說法正是第二項獨立基準測試能夠證實或推翻的。在那之前,它將以具名媒體、匿名消息來源的指控形式留在紀錄中,而它也屬於層級討論的範疇,因為一個基準測試與實務落差受到質疑的模型,無法僅憑基準測試成績獲得提升。
如果你在這個月要挑選模型,這意味著什麼
撇除定位論述後,實際情況已經簡單到一段話就能交代清楚。Gemini 4 Argon 是 Google 打造過最出色的 Gemini,但你無法使用它,因此今天你實際能選擇的 Google 模型,就是那些已經推出的版本:Gemini 3.8 Flash 在 Index 上測得 40.93,價格為 $0.75/$3.75;以及 Gemini 3.1 Pro Preview 測得 29.72,價格為 $2/$12。如果你現在就需要 Gemini,那才是真正的選擇,而 Argon 並不在其中。
如果你是在各家供應商之間挑選,而不是在 Google 內部挑選,那麼 Argon 的公告並不會改變今天的決定。Index 榜首是 57.62 的 Claude Opus 5.5,而 55.98 的 Claude Sonnet 5.5 緊追在後,其輸入費率僅為五分之一,輸出費率則為一半。52.56 的 Gemini 4 Argon 無法用於你的應用程式,因此無論最終分數多好,它都不是候選選項。

OrcaRouter 是一個單一 API,位於 200 多個模型 之前,供應商牌價以零加成直通,而且 跨供應商自動容錯移轉,這表示切換模型的決定不需要重新接線任何東西:請求主體中的 id 就是整項變更。我們目錄中目前的 Google 模型,就是 Google 實際已推出的那些——google/gemini-3.8-flash、google/gemini-3.6-flash、google/gemini-3.5-flash 以及 google/gemini-3.1-pro-preview。Gemini 4 Argon 不在其中,而且只要它還沒有公開的模型識別碼與已公布的價目表,就不會是,因此任何人都不應從上述任何內容解讀出路由方面的說法。當 Google 將 Argon 放上附有 ID 的 API 時,這就會成為路由問題。在那之前,OrcaRouter 答案的誠實版本是它尚未適用,而目錄對這個特定決策的有用之處,是讓你並排比較 實際可呼叫的模型 的價格,而不必開四個帳號才能知道。
最重要的是
Gemini 4 Argon 是 Google 的旗艦產品,而非其最前沿之作。在高強度模式下,它在 Artificial Analysis 的 v4.3.2 指數中測得 52.56——與 Claude Fable 5.1 和 GPT-6 Astra 持平,落後 Claude Opus 5.5 五分,也落後於 Claude Sonnet 5.5,一款來自競爭對手實驗室的較便宜模型。Google 以 $2/$10 的優惠價推出,之後調漲至 $4/$20,使其最終費率正好與 Claude Opus 5.5 相同,但能力明顯較低。它領先 Gemini 3.8 Flash 達 11.6 分,是 Google 自家產品陣容中最大的世代差距,也是最有力的證據,證明 Gemini 4 世代是真正的升級,而非換牌重推。
關於引發這一切的這個問題:並不存在 Gemini 4 Ultra。Google 自家網域上的 Ultra 路徑會重新導向至訂閱方案頁面,模型卡索引中完全沒有 Gemini 4 的條目,每一個可能用來發布 Gemini 4 Ultra 公告的 URL 模式都會 404,而發布文章只宣布了一款模型,並未承諾會有整個系列。這是一項真實的發現,而且是第一方證據,而非推論,但它同時也是一個半衰期很短的事實——只要某一條路徑出現單一個 200,就能推翻它,而 Gemini 4 世代的 Pro 層級,更可能是最先出現的那一個。
有兩點注意事項值得從這篇文章帶走。這裡的每一個 Argon 數字,都是他人對某個模型的測量;而除了經過審核的網路防禦者群組之外,沒有人能呼叫該模型。Google 自家的十九列表格是一項宣稱,而非測量——就其本身而言有其用處,但不能取代獨立的 Index。而關於等級問題的公正評斷仍是暫時性的:Argon 是在高努力程度下測得,而非最大;而一次最大努力程度的執行,是這篇文章出錯成本最低的可能方式。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
