
Gemini 4 與 Gemini 4 Argon:這兩款模型中有一款並不存在
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Google 於 2026 年 9 月 30 日發表了一款前沿模型。那並不是多數人心中所想像的那一個。Gemini 4 Argon 是一個真實名稱,掛在一則真實的發布公告、一份真實的價目表,以及一套已公開的基準測試之上。Gemini 4 是那個名稱所屬的家族前綴——而就今日可取得的紀錄來看,它並不是一項產品。它沒有模型 ID、沒有端點、沒有模型卡,也沒有每百萬個 token 的價格。所以這並不是兩套系統的比較。這是把一款已發布的模型,拿來和一個名稱相比——而這個名稱,包括本部落格在內的許多人,幾個月來一直把它當成一個模型。
這個區別攸關金錢。Gemini 4 Argon 的初期費率為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,並會在 Google 尚未定義的初期期間之後調升至 4 美元與 20 美元。這些是 Google 自家公告貼文中供應商所述的數字。如果你正在為 2026 年的 pro 層級移轉編列預算,$2/$10 是你可據以規劃的數字,而「Gemini 4 不管要多少錢」根本稱不上是數字——目前尚未為它發布任何資訊,因為根本還沒有東西可發布。
「Gemini 4」在正式紀錄中實際上是什麼?
搜尋 Gemini 4 的產品頁面,你會找到一份文件:Google 自己發布的貼文,標題為Gemini 4 Argon:我們的下一個前沿智慧時代,發佈於 2026 年 9 月 30 日 20:00 UTC,署名 Koray Kavukcuoglu。仔細閱讀,你會發現「Gemini 4」從未以獨立模型的形式出現。文中每一項能力宣稱、每一個價格與每一項基準測試,都附在完整名稱之下。單獨形式只會出現在該名稱被當作前綴使用的地方——「Gemini 4 Argon 的能力」——這正是 Gemini 3 在 Gemini 3 Pro、Gemini 3.1 Pro 與四個 Flash 變體各自成為獨立產品之前,所佔據的相同語法位置。
世代沿革支持這種解讀。Alphabet 在 7 月 23 日的財報電話會議上,讓這套說法正式留下紀錄:Sundar Pichai 表示,下一代前沿模型「需要規模大得多的基礎模型」,並點名程式設計與代理式程式設計是亟待改善的領域。9 月 23 日,在 The Information 主辦的活動上,Kavukcuoglu 表示預訓練已經完成,模型正處於後訓練的早期階段;團隊已經看到結果,而他希望能在年底之前早早推出一個早期後訓練版本。Business Insider 將 9 月 30 日的發布形容為 4 系列的首款模型——是個系列,而這正是關鍵線索。這三者全都是廠商針對自家工作的說法,並由第三方轉述。
實際上這代表什麼:「Gemini 4」是世代,而這個世代有一個具名成員。Google 兩年來推出的層級結構——頂端是 Pro,其下是 Flash,還有一個由同一項計畫把關的 Cyber 變體——尚未在第 4 代中配置。所謂的「Gemini 4 Pro」或「Gemini 4 Ultra」是從 Google 自家命名模式推斷出來的,並非外洩,也不是藍圖項目。任何把 Gemini 4 Argon 拿來與「Gemini 4」相比的文章,都應視為是在把一個模型拿來跟它自己的姓氏相比。
Gemini 4 Argon 是什麼
Gemini 4 Argon 於 2026 年 9 月 30 日在 Google 的部落格上發布,Demis Hassabis 當晚也在 X 上以自己的話宣布了同一款模型。推出是分階段進行的,而只有第一階段有日期:Argon 會先透過 Fairwind Program 提供給經過審核的網路防禦人員;這是 Google 為政府與國家網路主管機關、關鍵基礎設施營運商及核心技術平台所打造的僅限申請制層級。Hassabis 自己的貼文表示,該公司「今天起透過我們的 Fairwind Program,先從政府與受信任的網路防禦人員開始」推出。在那之後,Google 的措辭把付費 API 客戶與 Google AI Ultra 訂閱者排在下一批,接著是開發者、企業與消費者。那些後續階段都沒有日期。
不在那份清單裡的,才是對任何規劃工作的人真正重要的部分:正式推出(GA)日期、模型 ID、上下文視窗、參數數量、模型卡或系統卡。Google 公布的是輸出限制,不是上下文視窗。這個限制是 100 萬個 token,高於先前 Gemini 系列所用的 64K 上限,而 Google 稱其為業界領先。單次呼叫可回傳的內容增加一個數量級,對長時間的代理軌跡與單次渲染而言是真正的改變,而且這是公告中唯一沒有模糊空間的技術數字。

這套基準測試集涵蓋範圍廣泛,且完全未經重現。Google 公布 DeepSWE v1.1 為 77.9%,在 AutomationBench 上以 51.3% 拿下第一,LVBench 為 91.7%,在 CWE-bench v1 上以 68% 並列第一,在 Vals Index、其 Vals Finance Agent v2、Harvey 的 Legal Agent Benchmark 上取得領先結果,並在 Gray Swan 的 Indirect Prompt Injection 基準測試中表現最強。這些數字全都是廠商自家的數據,由廠商自行發布,且沒有任何一項經過獨立重現。另一組九月流傳的數字,被呈現為預測的 Gemini 4 基準測試結果,其中 AutomationBench 分數為 48.7%,結果證明是從一場無關的發布活動回收而來,並非 Google 發布的內容。Google 實際公布的 AutomationBench 數字是 51.3%,這是來自不同來源的另一個數字。
這兩個名字所產生的記分板
把這兩者放在這個配對實際取決於的六個維度上並列對照,問題的輪廓就顯而易見了:
• 作為具名產品存在——Gemini 4:否。Gemini 4 Argon:是,已於 2026-09-30 宣布。
• 今日可調用 — Gemini 4:不存在模型 ID 或端點。Gemini 4 Argon:同樣不存在模型 ID 或端點;存取受 Fairwind 管制,且僅限申請。
• 價格 — Gemini 4:未公布。Gemini 4 Argon:每百萬個 token 的優惠價為 $2 / $10,之後為 $4 / $20。廠商所述。
• 最大輸出 — Gemini 4:未公布。Gemini 4 Argon:100 萬個 token,相較前一代的 64K。廠商所述。
• 智慧指數 — Gemini 4:未評估。Gemini 4 Argon:在高推理強度下,於 Artificial Analysis 的智慧指數中獲得 53 分,每項指數任務成本為 $1.99。根據 Artificial Analysis。
• 獨立排行榜排名 — Gemini 4:未排名。Gemini 4 Argon:在 Vals Index 以 68.90% 排名第一,每次測試成本為 15.68 美元,使用 13.40B 輸入 token 與 142.01M 輸出 token。根據 Vals。

把最後兩列一起看,就會得到這項比較中唯一真正有趣的分歧。Artificial Analysis 將 Gemini 4 Argon 排在 53 分,與 Claude Fable 5.1 和 GPT-6 Astra 持平,並落後 58 分的 Claude Opus 5.5 五分。Vals 則直接把它排在第一名。兩者都獨立,都在衡量某些真實的東西,而且衡量的是不同的東西——AA 的指數加權一組固定的十項評估,涵蓋程式設計、推理與知識工作,而 Vals 指數則依四個產業在美國經濟附加價值中的占比來加權。一個模型可以在其中一個榜單領先,卻不在另一個榜單領先,而這並不代表任何一個榜單有錯。
Vals 那一列還有第二件值得留意的事,而這正是企業買家應該關心的那一點。Vals 將 Argon 的價目表記為 $4/$20——也就是優惠期結束後的價格——但 Google 自家的公告卻寫的是 $2/$10。如果每項測試 $15.68 的成本是以 $4/$20 計算出來的,那麼接受優惠價的買家,在做同樣的工作時會看到明顯較低的數字;而錯過優惠期的買家則不會。Google 並未說明這個優惠期有多長。這一個未定義的變數,左右了整場發布中最與決策相關的數字。
今天你可以稱之為什麼
在 Gemini 4 這個名稱底下什麼都沒有,而這也包括我們在內。我們查了型錄:google/gemini-4、google/gemini-4-argon、google/gemini-4-pro 和 google/gemini-3.8-flash-cyber 全都回傳「找不到模型」,其他每一個路由平台也一樣,因為它們都沒有可路由的模型 ID。Gemini API 本身的模型清單——Gemini 3.8 Flash、Gemini 3.8 Live、Gemini 3.1 Pro、Gemini 3 Flash——完全沒有任何形式的 Gemini 4 項目。在 Argon 清完 Fairwind 佇列並取得識別碼之前,既沒有計費價格,任何地方也都沒有端點。
現行的 Google 專業層級則是另一回事。Gemini 3.1 Pro Preview 自 2026 年 2 月 19 日起便列在我們的目錄中,每百萬詞元輸入 $2.00、輸出 $12.00,具備 1,048,576 詞元的上下文視窗、65,536 詞元的最大輸出,以及涵蓋文字、圖像、音訊、視訊和檔案的多模態輸入。八個月過去,它在 Gemini API 自家的模型清單上仍標示為 Preview,而這本身就是 Argon 存在的理由。一旦輸入超過 200,000 詞元,費率便翻倍至 $4 和 $18。

這是這項比較唯一具有可操作答案的地方。Gemini 3.1 Pro Preview 已上線,位於相同的 OpenAI 相容端點之後,與其他200 多個模型,也就是我們所路由的,以供應商定價提供,不加價——所以當 Google 最終為 Gemini 4 Argon 公布識別碼與計費費率,然後若命名模式維持不變,再為 Pro 層級的兄弟模型公布時,這種直接傳遞意味著這些費率會在出現在 Google 那邊的當天,出現在我們這邊。同時,如果你想衡量 Pro 層級,而不是閱讀相關資訊,那就是該衡量的模型。如果你想試用一個行為仍在被描繪中的模型,自動容錯移轉跨供應商就是做法,不必把生產路徑押在一個 Google 自己描述為逐步推出的預覽版上。
一個必須與價格一併說明的注意事項
彭博社於9月30日報導,一些可直接存取 Argon 的 Google 員工表示,它在實際工作上的表現不如基準測試分數所暗示的那麼好,其中前端設計被特別點名,且有兩名員工使用了「benchmaxxing」這個詞。Google 對這種描述提出異議。這件事值得與基準測試清單並列看待,正是因為該基準測試清單是這個模型全部的公開證據基礎。當只有一家廠商的數據,且無法重現這些數據時,一則指稱這些數據未能呈現全貌的報導就不是註腳。它是證據的一半。
誰應該選哪個
如果你正在這兩個名字之間做選擇,那你其實還沒真正做出任何選擇;而誠實的建議是:要圍繞這一點來規劃,而不是圍繞比較來規劃。
• 如果你本季需要在生產環境中使用 Google 專業級模型,答案就是 Gemini 3.1 Pro Preview。它可呼叫、已定價,而且正是 Argon 被定位要取代的層級。等待 Argon,就是在等一個你無法加入的佇列。
• 如果你是 Argon 限定開放的對象——政府網路安全主管機關、關鍵基礎設施營運者、軟體維護者——Fairwind Program 是唯一途徑,而這道門檻如此明確,是關於該模型能力的事實,而非行銷話術。Google 訓練它來發掘與修補漏洞,並未全面對外推出。
• 如果你正在為 2026 年的遷移編列預算,導入期請採用 $2/$10,之後一律採用 $4/$20。不要使用單一混合數字,也不要在確認 Vals 的 $15.68 每項檢測成本是依哪張費率卡計算之前,就直接採用該數字。
• 如果你在等「Gemini 4」,那要等的是模型 ID。這個名稱終究會拿到一個——Google 橫跨三代產品的命名模式顯示,Pro 層級與 Flash 層級各有自己的識別碼——但這個模式並不是一項公告,而且關於一個單純的 Gemini 4 會是什麼、成本多少或能做什麼,至今都沒有任何已發布的資訊。
更宏觀的一點是,這個部落格以前就不得不提出,而且想必之後還得再次提出:世代名稱不是模型。Gemini 4 Argon 是 Google 唯一賦予名稱、價格、基準測試集與存取方案的東西。家族其餘成員只是一種模式,而模式是可以預測、卻不能指名呼喚的東西。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
