標題卡標題為「模型比較」,內容寫著「Gemini 4 對 Gemini 4 Argon」,副標題為「其中一個在 9 月 30 日發布,另一個則是系列前綴。」,另有四個標籤寫著「Gemini 4 · 無模型 ID」、「Gemini 4 Argon · 於 2026-09-30 發布」、「$2 / $10 優惠價」以及「AA 指數 53 · Vals 第 1 名」,底部頁尾一行寫著「Google 數據為供應商自行回報且未經重現;指數依據 Artificial Analysis;排名依據 Vals。」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 4 與 Gemini 4 Argon:這兩款模型中有一款並不存在

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Google 於 2026 年 9 月 30 日發表了一款前沿模型。那並不是多數人心中所想像的那一個。Gemini 4 Argon 是一個真實名稱,掛在一則真實的發布公告、一份真實的價目表,以及一套已公開的基準測試之上。Gemini 4 是那個名稱所屬的家族前綴——而就今日可取得的紀錄來看,它並不是一項產品。它沒有模型 ID、沒有端點、沒有模型卡,也沒有每百萬個 token 的價格。所以這並不是兩套系統的比較。這是把一款已發布的模型,拿來和一個名稱相比——而這個名稱,包括本部落格在內的許多人,幾個月來一直把它當成一個模型。

這個區別攸關金錢。Gemini 4 Argon 的初期費率為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,並會在 Google 尚未定義的初期期間之後調升至 4 美元與 20 美元。這些是 Google 自家公告貼文中供應商所述的數字。如果你正在為 2026 年的 pro 層級移轉編列預算,$2/$10 是你可據以規劃的數字,而「Gemini 4 不管要多少錢」根本稱不上是數字——目前尚未為它發布任何資訊,因為根本還沒有東西可發布。

「Gemini 4」在正式紀錄中實際上是什麼?

搜尋 Gemini 4 的產品頁面,你會找到一份文件:Google 自己發布的貼文,標題為Gemini 4 Argon:我們的下一個前沿智慧時代,發佈於 2026 年 9 月 30 日 20:00 UTC,署名 Koray Kavukcuoglu。仔細閱讀,你會發現「Gemini 4」從未以獨立模型的形式出現。文中每一項能力宣稱、每一個價格與每一項基準測試,都附在完整名稱之下。單獨形式只會出現在該名稱被當作前綴使用的地方——「Gemini 4 Argon 的能力」——這正是 Gemini 3 在 Gemini 3 Pro、Gemini 3.1 Pro 與四個 Flash 變體各自成為獨立產品之前,所佔據的相同語法位置。

世代沿革支持這種解讀。Alphabet 在 7 月 23 日的財報電話會議上,讓這套說法正式留下紀錄:Sundar Pichai 表示,下一代前沿模型「需要規模大得多的基礎模型」,並點名程式設計與代理式程式設計是亟待改善的領域。9 月 23 日,在 The Information 主辦的活動上,Kavukcuoglu 表示預訓練已經完成,模型正處於後訓練的早期階段;團隊已經看到結果,而他希望能在年底之前早早推出一個早期後訓練版本。Business Insider 將 9 月 30 日的發布形容為 4 系列的首款模型——是個系列,而這正是關鍵線索。這三者全都是廠商針對自家工作的說法,並由第三方轉述。

實際上這代表什麼:「Gemini 4」是世代,而這個世代有一個具名成員。Google 兩年來推出的層級結構——頂端是 Pro,其下是 Flash,還有一個由同一項計畫把關的 Cyber 變體——尚未在第 4 代中配置。所謂的「Gemini 4 Pro」或「Gemini 4 Ultra」是從 Google 自家命名模式推斷出來的,並非外洩,也不是藍圖項目。任何把 Gemini 4 Argon 拿來與「Gemini 4」相比的文章,都應視為是在把一個模型拿來跟它自己的姓氏相比。

Gemini 4 Argon 是什麼

Gemini 4 Argon 於 2026 年 9 月 30 日在 Google 的部落格上發布,Demis Hassabis 當晚也在 X 上以自己的話宣布了同一款模型。推出是分階段進行的,而只有第一階段有日期:Argon 會先透過 Fairwind Program 提供給經過審核的網路防禦人員;這是 Google 為政府與國家網路主管機關、關鍵基礎設施營運商及核心技術平台所打造的僅限申請制層級。Hassabis 自己的貼文表示,該公司「今天起透過我們的 Fairwind Program,先從政府與受信任的網路防禦人員開始」推出。在那之後,Google 的措辭把付費 API 客戶與 Google AI Ultra 訂閱者排在下一批,接著是開發者、企業與消費者。那些後續階段都沒有日期。

不在那份清單裡的,才是對任何規劃工作的人真正重要的部分:正式推出(GA)日期、模型 ID、上下文視窗、參數數量、模型卡或系統卡。Google 公布的是輸出限制,不是上下文視窗。這個限制是 100 萬個 token,高於先前 Gemini 系列所用的 64K 上限,而 Google 稱其為業界領先。單次呼叫可回傳的內容增加一個數量級,對長時間的代理軌跡與單次渲染而言是真正的改變,而且這是公告中唯一沒有模糊空間的技術數字。

A capture of Google's own blog post announcing Gemini 4 Argon, carrying a Published Time of 2026-09-30T20:00:00+00:00 and the headline "Gemini 4 Argon: our next era of frontier intelligence" credited to Koray Kavukcuoglu, followed by the Fairwind Program rollout and the vendor-reported benchmark set: DeepSWE v1.1 77.9%, AutomationBench 51.3%, LVBench 91.7%, CWE-bench v1 68%, an output limit of 1 million tokens up from 64K, and pricing of $2 / $10 stepping to $4 / $20.

這套基準測試集涵蓋範圍廣泛,且完全未經重現。Google 公布 DeepSWE v1.1 為 77.9%,在 AutomationBench 上以 51.3% 拿下第一,LVBench 為 91.7%,在 CWE-bench v1 上以 68% 並列第一,在 Vals Index、其 Vals Finance Agent v2、Harvey 的 Legal Agent Benchmark 上取得領先結果,並在 Gray Swan 的 Indirect Prompt Injection 基準測試中表現最強。這些數字全都是廠商自家的數據,由廠商自行發布,且沒有任何一項經過獨立重現。另一組九月流傳的數字,被呈現為預測的 Gemini 4 基準測試結果,其中 AutomationBench 分數為 48.7%,結果證明是從一場無關的發布活動回收而來,並非 Google 發布的內容。Google 實際公布的 AutomationBench 數字是 51.3%,這是來自不同來源的另一個數字。

這兩個名字所產生的記分板

把這兩者放在這個配對實際取決於的六個維度上並列對照,問題的輪廓就顯而易見了:

• 作為具名產品存在——Gemini 4:否。Gemini 4 Argon:是,已於 2026-09-30 宣布。

• 今日可調用 — Gemini 4:不存在模型 ID 或端點。Gemini 4 Argon:同樣不存在模型 ID 或端點;存取受 Fairwind 管制,且僅限申請。

• 價格 — Gemini 4:未公布。Gemini 4 Argon:每百萬個 token 的優惠價為 $2 / $10,之後為 $4 / $20。廠商所述。

• 最大輸出 — Gemini 4:未公布。Gemini 4 Argon:100 萬個 token,相較前一代的 64K。廠商所述。

• 智慧指數 — Gemini 4:未評估。Gemini 4 Argon:在高推理強度下,於 Artificial Analysis 的智慧指數中獲得 53 分,每項指數任務成本為 $1.99。根據 Artificial Analysis。

• 獨立排行榜排名 — Gemini 4:未排名。Gemini 4 Argon:在 Vals Index 以 68.90% 排名第一,每次測試成本為 15.68 美元,使用 13.40B 輸入 token 與 142.01M 輸出 token。根據 Vals。

A two-column scoreboard card headed "Gemini 4 vs Gemini 4 Argon — the scoreboard", with the subtitle "One announced model against a name with nothing behind it". The left column, headed Gemini 4, reads: exists as a named product, no; callable today, no model ID or endpoint; published price, none; maximum output, none published; intelligence index, not evaluated; independent rank, not ranked. The right column, headed Gemini 4 Argon, reads: exists as a named product, yes, announced 2026-09-30; callable today, no, Fairwind-gated; published price, $2 / $10, then $4 / $20; maximum output, 1M tokens, up from 64K; intelligence index, 53, $1.99 per task; independent rank, 1st, Vals 68.90%. A footer reads that the Argon price and output limit are per Google's own announcement, the index and per-task cost per Artificial Analysis, the rank and score per Vals, and that no figure on the left has a published source because Gemini 4 has no product page. The OrcaRouter logo is composited in the bottom-right corner.

把最後兩列一起看,就會得到這項比較中唯一真正有趣的分歧。Artificial Analysis 將 Gemini 4 Argon 排在 53 分,與 Claude Fable 5.1 和 GPT-6 Astra 持平,並落後 58 分的 Claude Opus 5.5 五分。Vals 則直接把它排在第一名。兩者都獨立,都在衡量某些真實的東西,而且衡量的是不同的東西——AA 的指數加權一組固定的十項評估,涵蓋程式設計、推理與知識工作,而 Vals 指數則依四個產業在美國經濟附加價值中的占比來加權。一個模型可以在其中一個榜單領先,卻不在另一個榜單領先,而這並不代表任何一個榜單有錯。

Vals 那一列還有第二件值得留意的事,而這正是企業買家應該關心的那一點。Vals 將 Argon 的價目表記為 $4/$20——也就是優惠期結束後的價格——但 Google 自家的公告卻寫的是 $2/$10。如果每項測試 $15.68 的成本是以 $4/$20 計算出來的,那麼接受優惠價的買家,在做同樣的工作時會看到明顯較低的數字;而錯過優惠期的買家則不會。Google 並未說明這個優惠期有多長。這一個未定義的變數,左右了整場發布中最與決策相關的數字。

今天你可以稱之為什麼

在 Gemini 4 這個名稱底下什麼都沒有,而這也包括我們在內。我們查了型錄:google/gemini-4、google/gemini-4-argon、google/gemini-4-pro 和 google/gemini-3.8-flash-cyber 全都回傳「找不到模型」,其他每一個路由平台也一樣,因為它們都沒有可路由的模型 ID。Gemini API 本身的模型清單——Gemini 3.8 Flash、Gemini 3.8 Live、Gemini 3.1 Pro、Gemini 3 Flash——完全沒有任何形式的 Gemini 4 項目。在 Argon 清完 Fairwind 佇列並取得識別碼之前,既沒有計費價格,任何地方也都沒有端點。

現行的 Google 專業層級則是另一回事。Gemini 3.1 Pro Preview 自 2026 年 2 月 19 日起便列在我們的目錄中,每百萬詞元輸入 $2.00、輸出 $12.00,具備 1,048,576 詞元的上下文視窗、65,536 詞元的最大輸出,以及涵蓋文字、圖像、音訊、視訊和檔案的多模態輸入。八個月過去,它在 Gemini API 自家的模型清單上仍標示為 Preview,而這本身就是 Argon 存在的理由。一旦輸入超過 200,000 詞元,費率便翻倍至 $4 和 $18。

A capture of the OrcaRouter model page for Gemini 3.1 Pro Preview, showing the Google provider, a release date of 2026-02-19, a 1,048,576-token context window, a 65,536-token maximum output, pricing of $2.00 input and $12.00 output per million tokens with $4.00 and $18.00 over the 200,000-token threshold, multimodal input icons for text, image, video, audio and file, and capability chips for reasoning, tool calling, structured outputs, prompt caching, assistant prefill, computer use and web search.

這是這項比較唯一具有可操作答案的地方。Gemini 3.1 Pro Preview 已上線,位於相同的 OpenAI 相容端點之後,與其他200 多個模型,也就是我們所路由的,以供應商定價提供,不加價——所以當 Google 最終為 Gemini 4 Argon 公布識別碼與計費費率,然後若命名模式維持不變,再為 Pro 層級的兄弟模型公布時,這種直接傳遞意味著這些費率會在出現在 Google 那邊的當天,出現在我們這邊。同時,如果你想衡量 Pro 層級,而不是閱讀相關資訊,那就是該衡量的模型。如果你想試用一個行為仍在被描繪中的模型,自動容錯移轉跨供應商就是做法,不必把生產路徑押在一個 Google 自己描述為逐步推出的預覽版上。

一個必須與價格一併說明的注意事項

彭博社於9月30日報導,一些可直接存取 Argon 的 Google 員工表示,它在實際工作上的表現不如基準測試分數所暗示的那麼好,其中前端設計被特別點名,且有兩名員工使用了「benchmaxxing」這個詞。Google 對這種描述提出異議。這件事值得與基準測試清單並列看待,正是因為該基準測試清單是這個模型全部的公開證據基礎。當只有一家廠商的數據,且無法重現這些數據時,一則指稱這些數據未能呈現全貌的報導就不是註腳。它是證據的一半。

誰應該選哪個

如果你正在這兩個名字之間做選擇,那你其實還沒真正做出任何選擇;而誠實的建議是:要圍繞這一點來規劃,而不是圍繞比較來規劃。

• 如果你本季需要在生產環境中使用 Google 專業級模型,答案就是 Gemini 3.1 Pro Preview。它可呼叫、已定價,而且正是 Argon 被定位要取代的層級。等待 Argon,就是在等一個你無法加入的佇列。

• 如果你是 Argon 限定開放的對象——政府網路安全主管機關、關鍵基礎設施營運者、軟體維護者——Fairwind Program 是唯一途徑,而這道門檻如此明確,是關於該模型能力的事實,而非行銷話術。Google 訓練它來發掘與修補漏洞,並未全面對外推出。

• 如果你正在為 2026 年的遷移編列預算,導入期請採用 $2/$10,之後一律採用 $4/$20。不要使用單一混合數字,也不要在確認 Vals 的 $15.68 每項檢測成本是依哪張費率卡計算之前,就直接採用該數字。

• 如果你在等「Gemini 4」,那要等的是模型 ID。這個名稱終究會拿到一個——Google 橫跨三代產品的命名模式顯示,Pro 層級與 Flash 層級各有自己的識別碼——但這個模式並不是一項公告,而且關於一個單純的 Gemini 4 會是什麼、成本多少或能做什麼,至今都沒有任何已發布的資訊。

更宏觀的一點是,這個部落格以前就不得不提出,而且想必之後還得再次提出:世代名稱不是模型。Gemini 4 Argon 是 Google 唯一賦予名稱、價格、基準測試集與存取方案的東西。家族其餘成員只是一種模式,而模式是可以預測、卻不能指名呼喚的東西。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新