主視覺標題卡寫著「Gemini 4 Argon——這個名稱所附隨的是什麼」,並有一張單獨突顯的 Gemini 4 Argon 卡片;其下方列出確實為它存在的產物——公告貼文、系列頁面、供應商基準測試表、評估方法論——旁邊則是以刪除線標示的不存在產物清單,寫著:沒有模型 ID、沒有 API 端點、沒有模型卡、沒有公開的上下文視窗、沒有正式推出日期;頁尾文字寫著「指數數據依據 Artificial Analysis,v4.3.2 修訂版;Argon 無法在任何公開 API 上呼叫」。
Guides & Insights

Gemini 4 Argon:Google 宣布了什麼,以及這個名稱是附掛在什麼之上

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 4 Argon 是唯一存在的 Gemini 4。這句話聽起來很平凡,直到你把它計算出代價,而計算代價正是本頁的目的。Goog​le 於 2026-09-30 在 DeepMind 一篇署名為 Koray Kavukcuoglu 的文章中宣布了 Gemini 4 Argon;它是真實第一方頁面上的真實模型名稱,並已由 Artificial Analysis 在 v4.3.2 修訂版上測得智慧指數 52.56,距離 GPT-6 Astra 的 52.67 與 Claude Fable 5.1 的 53.35 不到半點——同時比 Claude Opus 5.5 的 57.62 與 Claude Sonnet 5.5 的 56.00 低五點,並與 GPT-6.1 Sol 的 51.83 相差一點以內。它沒有的,是那些競爭對手全都有的東西:一個可以放進請求中的模型識別碼。

所以,對「Gemini 4 Argon 是什麼」這個問題,誠實的一句話回答是:它是 Google 已宣布並做過基準測試、但尚未開放呼叫的模型;這個名稱掛在受控推出(gated rollout)上,而不是某個產品上;而單獨的「Gemini 4」則完全沒有對應任何東西。那句話的兩半都能從終端機查證,因此本頁是去查證它們,而不是直接斷言它們。

這個名字是真的。產品則不是。

先從實體查核實際上會回傳什麼說起。截至 2026 年 10 月 8 日,Google 的系列頁面位於deepmind.google/models/gemini/,以 Gemini 4 Argon 作為主打卡片,標語是「我們的下一個前沿智慧時代」,能力說明中點名軟體工程、法律與金融領域的企業知識工作,以及防禦性資安。公告貼文位於blog.google/innovation-and-ai/models-and-research/gemini-models/路徑。有一個模型系列頁面。有一份十九列的廠商基準測試表。有一份五頁的評測方法 PDF。這是一條相當可觀的書面紀錄,而這遠比一則外流消息所能留下的更多。

現在列出它缺少了什麼,因為那份缺少清單就是文章本身。

• 一個模型 ID —— Gemini API 的模型清單中,「argon」出現零次,「gemini-4」也出現零次。Google 文件所認可的最新識別碼是 3.8 系列。

• 一個可供計費的端點或價格 —— 公告中每百萬個 token 輸入 2 美元 / 輸出 10 美元的價格,是針對尚未觸及付費客戶的推廣計畫所訂的優惠費率。

• 一份模型卡或系統卡——DeepMind 的模型卡索引中沒有 Argon 列,且該系列的模型卡路徑會回傳 404。

• 一個 上下文視窗 — Google 公布輸出上限為 100 萬個 token,高於先前的 64K 上限,且未公布該配對中的輸入端。Artificial Analysis 為其所測量的模型記錄了 1M。

• 一個正式推出日期——該公告說明的是分階段推出,但除了第一階段之外,其後各階段都沒有日期。

• 參數數量,而 Google 尚未為任何 Gemini 公布此數據。

Google 所描述的分階段推出,分為三個未公布時長的階段。第一,透過 Fairwind Program 的一批具名網路防禦人員。第二,付費 API 客戶與 Google AI Ultra 訂閱者。第三,開發者、企業與消費者。只有第一階段以讀者能驗證的任何意義而言已經上線,而 Google 並未為第二與第三階段附上任何日期。那不是註腳。那是模型與倒數計時之間的差別。

A screenshot of Google's Gemini 4 Argon announcement post, showing the headline and the byline for Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, above the intro pricing line of $2 per million input tokens and $10 per million output tokens with cached input at 95 percent off, and the line stating an output limit of 1 million tokens, up from the previous 64K ceiling.

Google 自家表格聲稱了什麼,以及究竟是誰實際測量了它

Google 的家族頁面載有一張四欄的基準測試表,列出 Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1 與 Claude Opus 5.5。這張表值得一讀,而且值得在把來源出處納入考量的情況下閱讀,因為 Google 在方法論 PDF 中揭露了該來源出處,而這項揭露會改變這張表能承載多少份量。

這些說法,被標示為 Google 的:Argon 在 Vals Index 上以 68.9 領先 Opus 5.5 的 67.0 與 Fable 5.1 的 65.8;在 AutomationBench 上以 51.3 領先 42.5、31.4 與 41.4;在 Vals Finance Agent v2 上為 65.4;在 Harvey 的 Legal Agent Benchmark 上以 19.6 領先 3.8、6.7 與 5.4——差距達四到五倍;在 DeepSWE v1.1 上以 77.9 領先 74.2、67.4 與 74.1;在 Vibe Code Bench 上為 91.9,領先 1.6 分;在 LABBench 2 上以 88.8 領先 73.1、68.6 與 85.4;在 RiemannBench 上為 76.0;在 GraphWalks 的兩列上,≤128k 為 99.7,256k–1M 為 84.2;在 Agent’s Last Exam 上為 39.5;在 Terminal-Bench Science 0.1 上為 57.6;在 Chartography 上為 71.6;以及在 LVBench 上以 91.7 成為最先進水準。

而且它在 Google 自家的頁面上落敗:FrontierSWE v2 為 55.0,對上 Astra 的 65.5 與 Opus 5.5 的 62.3;Terminal-bench 4.0 為 57.4,對上 Opus 5.5 的 66.4;PostTrainBench 為 45.3,對上 Opus 5.5 的 49.3;OSWorld-2.0 為 69.2,對上 Astra 的 72.6。CWE-bench v1 則以 68.0 與 Astra 打成平手。

出處標註那一行比任何單一列都更重要。Google 的方法論指出,結果是 pass@1、單次嘗試、採用最高思考設定,而且——至關重要的是——該表中非 Gemini 的數字是供應商自行通報的數字,其中 GPT-6 Astra、Claude Fable 5.1 與 Claude Opus 5.5 在可取得的情況下採用最大思考設定。一張競爭者欄位取自競爭者新聞稿的廠商表格,是有用的文件,但並不是受控比較。那些列中的每一列都是 Google 通報的,而其中有些是 Google 在轉述別人通報了什麼。因此,請據此看待領先幅度,而不只是數值。

一個模型,三個指數數字,以及為什麼它們全都是正確的

Argon 的獨立地位比單一數字更有意思,因為這個數字會因你從哪裡讀取而變動,而這種變動並不是錯誤。

Artificial Analysis 在其 Intelligence Index 的 v4.3.2 修訂版中,測得 Gemini 4 Argon(High)為 52.56。同一指數將 Claude Opus 5.5 列為 57.62、Claude Sonnet 5.5 為 56.00、Claude Fable 5.1 為 53.35、GPT-6 Astra 為 52.67、GPT-6.1 Sol 為 51.83,而 Gemini 3.8 Flash 為 40.93。在排行榜所顯示的排序中,前十名左右的模型壓縮在大約六個指數點之內,而 Argon 落在這群混戰之中,而非其下。

接著,讀者會在排行榜的四捨五入顯示中看到第二個數字——53——而如果拿另一個同系列模型的不同配置來比較,還會看到第三個數字,於是便斷定其中一個來源有誤。但它們全都沒錯。四捨五入後的 53 與 52.56 是同一個測量值。不同配置之間真正有差異的是思考強度:Artificial Analysis 會在數個強度等級下測量每個模型,而同一個模型在較高等級下的分數可能相差數分。這就是為什麼排行榜把 Opus 5.5 分列四次,分別是 58、56、54 和 51。Argon 只出現一次,屬於高等級,因為那是 Google 唯一提供可供測量的配置。如果 Google 推出最高思考等級的 Argon,那一列就會變動,而今天對它最誠實的說法是:它尚未變動。

Argon 另外三項獨立數據值得記下,全都來自 Artificial Analysis,且都是在 (High) 配置下測得。輸出速度中位數為每秒 60.69 個 token。首個答案 token 的時間中位數為 2.92 秒。每個 Intelligence Index 任務的成本——也就是將指數分數相對於賺取它所需的 token 花費來標準化——為 $1.99。最後這個數字才是該牢牢記住的,因為 Argon 的處境正是在這裡變得難堪:Opus 5.5 得分高出五點,每項 Index 任務成本為 $5.98,因此 Argon 每單位實測能力的成本便宜三倍。但 GPT-6.1 Sol 得分低半分,成本為 $0.72,大約是 Argon 數字的三分之一。Argon 在自己所屬的指數區間裡並不是超值之選。它位居該區間的中段。

還有兩份各自獨立的評測讀數,細心的讀者不應將兩者混為一談。Artificial Analysis 把 Argon 的 AutomationBench 數據記為部分分數 0.7751,採 0–1 的量尺;而 Google 的表格則在 AutomationBench 榜單上回報 100 分中的 51.3 分。這並非同一項指標,把兩者並排陳列,正是那種會凭空捏造出數字的比較方式。同樣的謹慎也適用於廠商表格中的知識工作分組:「在知識工作上領先」是 Google 對自家表格所做的總結。

你實際上正在尋找的是哪個「Gemini 4」頁面

這就是這個名稱所造成的混淆,而這值得在一處釐清,因為這個部落格至今已寫過五個不同的「Gemini 4」主題,而它們並不是同一篇文章的變體。

• 如果你想要發布日期與推出時間表——Argon 是何時宣布的、分階段推出是什麼,以及各競技場排行榜如何處理它——那就是發布日期的專文,而這篇正是掌握時間表以及 Text Arena 與 Code Arena 評測讀數的文章。

• 如果你想知道「Gemini 4 Argon 是層級還是模型」,以及 Gemini 4 Ultra 是否存在——那篇層級定位文章,會從 Google 自家的路徑讀出這套層級階梯,並解釋為什麼 Ultra 路徑最終會導向訂閱頁面。

• 如果你想要的是命名問題本身,那個論點是:在「Gemini 4」與「Gemini 4 Argon」之中,恰好一個是模型,另一個是沒有模型 ID、沒有端點、沒有價格的世代前綴——而那就是這兩個 Google 名稱的正面對決。

• 如果你想看FrontierSWE v2 第三名的結果,以及隨之而來的自我批判觀察,那就是 FrontierSWE 評估那篇文章。

• 如果你想在數據上將 Argon 與特定競爭對手對比,網站上有十三個比較頁面涵蓋 frontier band,而它們正是進行兩款型號對照的合適地方。

它們全都不是、而本頁正是的,就是這根支柱:唯一說明這個實體是什麼、附加在它之上的每個數字代表什麼與不代表什麼,以及你今日實際能用它做什麼的地方。相關頁面「Gemini 4 vs Gemini 4 Argon」已完整提出命名論證,本頁不再重複。以下全部都是新內容。

A screenshot of the Artificial Analysis page for Gemini 4 Argon, showing the model name and the line reading released September 2026, a proprietary reasoning model with a 1M token context window, and the statement that it is available via API through 1 provider — with the provider count identifiable in artificial analysis's own hosting panel rather than named in this description.

至今仍未向我們透露任何訊息的壓力

Argon 事件中最強烈的兩個訊號,都指向開發者版本即將發布,而這兩者都不是開發者版本已經發布的證據。

第一點是,Google 自家的 API 介面早已繼續往前推進,卻不見 Argon 的蹤影。Gemini API 更新日誌上最新的一筆是2026 年 10 月 6 日——Gemini Nano Banana 2.1 正式推出,使用的識別碼為gemini-nano-banana-2.1。換句話說,在 Argon 發布後的這八天裡,Google 已為一個在正式環境中運行的 Gemini 模型選定了命名慣例,並為另一個模型發布了 GA 識別碼,而gemini-4命名空間依然空著。真正有在推進的模型,會在更新日誌上留下痕跡。這個模型並沒有留下任何痕跡。

第二點是國家安全論述。Google 表示,它「積極參與美國政府針對模型發布前存取的自願性程序」,而第一波推出階段是一個具名的網路防禦者群體。這與分階段推出相符:前沿能力受眾會比公開 API 更早取得該模型;但這也同樣符合另一種情況:該模型只是還沒準備好面對一般流量。這個論述本身完全無法告訴你是哪一種。任何說它能告訴你答案的人,都是在看茶葉占卜,而 Google 尚未為 API 階段訂下日期來平息這個問題。

你今天可以撥打什麼,以及不能撥打什麼

這是頁面上最快過時的部分,因此它標有日期。截至 2026 年 10 月 8 日,OrcaRouter 模型 API 會對google/gemini-4-argon回傳 HTTP 404。它不在我們的路由中。以下也都不是:google/gemini-4,google/gemini-4-argon-high,google/gemini-4-pro——這些識別碼都無法解析,因為它們在任何地方都不存在可呼叫的模型。

我們今天路線上有些什麼,來自同一家供應商,以及每一項在供應商標價上各是多少錢:

• google/gemini-3.8-flash — 於 2026-09-02 發布,具備 1,048,576 個詞元的上下文視窗,最大輸出為 65,536 個詞元,每百萬個詞元的輸入價格為 $0.75、輸出價格為 $3.75。這是擁有信用卡的人最終會拿來與 Argon 比較的模型,也是你今天下午能執行、最接近與 Argon 同類工作負載的東西。

• google/gemini-3.6-flash — 於 2026-07-21 發布,價格為 $0.75 與 $3.75。

• gemini/gemini-3.5-flash — 於 2026-05-23 發布,價格為 $1.50 與 $9.00。

• google/gemini-3.5-flash-lite —— 於 2026-07-21 發布,定價為 $0.30 與 $2.50。

• google/gemini-3.1-flash-lite — 價格為 $0.25 和 $1.50。

• google/gemini-3.1-pro-preview — 於 2026-02-19 發布,定價為 $2.00 和 $12.00。這是唯一可供呼叫的 Pro 級 Gemini,而且它落後 Flash 系列最新成員三個半世代。

這些全都與同一指數帶內的 Claude 和 OpenAI 前沿模型共用同一把金鑰——Claude Opus 5.5、Claude Sonnet 5.5、Claude Fable 5.1、GPT-6 Astra 與 GPT-6.1 Sol 全都走同一批路由——這意味著 Argon 定位中有趣的部分,無須 Argon 本身就能驗證。若你想知道約 52 點指數的知識工作在五分之一的價格下是什麼感覺,你今天就能拿google/gemini-3.8-flash的 40.93 來量測;而若你想要這個區間的頂端,你可以在同一天、同一個帳號裡量測 Claude Opus 5.5 的 57.62,無須第二份合約,也不必改動任何程式碼。這就是整篇文章的實際樣貌:一個 API 涵蓋 200+ 個模型、零加成於供應商定價牌價轉嫁,因此供應商降價當天就會反映到你身上,以及跨供應商的自動容錯移轉,以備你依賴的某個模型哪天不再回應。我們在此描述這些,是因為這對你能呼叫的 Gemini 3.8 Flash 而言確實如此,而不是因為這對 Argon 說明了什麼。Argon 並不在其中。

如果你想要的是 Argon 本身,如今你的選項只有 Fairwind 網路防禦者團隊,以及等待。Google 自家的 API 並未提供它,我們也沒有,而沒有任何第三方管道能提供一個沒有可供定址識別碼的模型。

懸而未決的問題,以及確切能解決它們的是什麼

有四件事尚未解決,而每一件都有一個具體、可檢核的觸發條件。重點就在於讓那份清單保持簡短——像這樣的頁面只有在仍可被否證時才有用。

• Argon 會取得 Gemini API 識別碼嗎?請留意 API 模型清單中任何以 gemini-4 為字首的 ID。一旦出現,定價問題就會成真,$2 / $10 的優惠價就會變成一個可以據以向你收費的數字,而不只是部落格文章裡的數字。也要留意這個優惠價是否會延續到 API 階段,以及它是否會調升至 $4 / $20,或是其他價格。

• 所測量的配置會改變嗎? Argon 是在一個思考層級下進行測量,得分為 52.56。如果 Google 公開更高投入程度的配置,那一列就會變動;它所追趕的同儕全都列出二到四個投入層級,因此 Argon 只被列出一次,是關於可用性的事實,而不是模型的天花板。

• 法律與金融領域的宣稱,能否在獨立重跑中站得住腳?Harvey 的 Legal Agent Benchmark 拿下 19.6 分,對手僅 3.8 分;Vals Finance Agent v2 以 65.4 分領先群倫——這兩項是 Google 表格中相對差距最大的兩列。它們同時也是最可能被非 Google 員工重新重跑的兩列。在特定領域的基準測試上出現四到五倍的差距,要嘛是整篇公告中最重要的一句話,要嘛只是測試框架的差異;而要分辨究竟是何者,方法就是留意是否出現第二次重跑。

• 有沒有同系列機型?Argon 的發布貼文並未提及任何系列,未預告 Pro,也未預告 Ultra。第二條gemini-4-*路徑、第二個欄位,或一筆模型卡條目,任何一項都能在一天內推翻這個判讀。層級定位那篇文章完整列出了這些否證條件。

最重要的是

Gemini 4 Argon 是真正的前沿模型,具備真正的基準測試表,以及 Artificial Analysis 給出的真正指數分數 52.56——但它不是產品,具體來說,它沒有模型識別碼、端點、模型卡、上下文視窗或正式發布日期,而且 Google 自家文件與第三方測量服務都一致認為,只有一家供應商託管它。其名稱中的「Gemini 4」是世代標籤;「Argon」才是附有模型的部分。如果你這個月要挑選某個東西來開發,這項決策不涉及 Argon:它涉及的是你今天就能以 $0.75 / $3.75 呼叫的 Gemini 3.8 Flash,以及同一指數區間、位於同一把金鑰上的前沿模型。請重新閱讀本頁:當gemini-4 識別碼出現在 API 清單中時。在那之前,關於 Argon 的一切都是 Google 對一個模型所做的宣稱,而首批之外沒有人能存取該模型。

A single-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column headed Gemini 4 Argon showing rows reading Artificial Analysis Index: 52.6, Context window: 1M (output limit 1M), Price: $2 in / $10 out intro, Cost per Index task: $1.99, Callable via API: No — gated rollout, and Supplier count: 1, and the right column headed Gemini 3.8 Flash showing the same six dimension labels with Artificial Analysis Index: 40.9, Context window: 1,048,576, Price: $0.75 in / $3.75 out, Cost per Index task: $1.24, Callable via API: Yes, and Supplier count: on our routes, with a footer line reading "Argon index, price and cost-per-task figures per Artificial Analysis, v4.3.2 revision; Argon availability verified 2026-10-08."

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新