
Gemini 4 Carbon 外洩:Google 內部檢查點,員工稱其寫程式能力媲美 Claude Opus 5.5
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 84 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
這個故事有一個版本是新聞,有一個版本是噪音,而差別完全在於那些名字附著在什麼之上。2026年10月9日與10日,Business Insider 報導——而追蹤洩漏的媒體 TestingCatalog 轉述——這家搜尋巨頭的員工正在內部測試一個名為 Carbon 的額外 Gemini 4 檢查點,早期內部回饋認為 Carbon 在寫程式方面感覺可與 Claude Opus 5.5 相媲美,且 Barium-B 是被選為公開 Gemini 4 Argon 發布的檢查點,而 Carbon 是透過該公司內部 Jetski 平台測試的獨立且可能更強大的迭代版本。讓這段內容值得細讀而非略讀的是最後一句:Carbon 究竟會作為 Gemini 4 Argon 更新推出,還是以自身名義發布,用報導自己的話來說,尚未確認。而這就是證據的全部狀態——沒有公告、沒有模型識別碼、沒有端點、沒有價格、沒有模型卡,也沒有來自供應商的評論。本頁所有具體內容都是洩漏、由洩漏推導出的推論,或是關於另一個可正式推出模型的事實,而這項洩漏正是以該模型為衡量基準。
報告實際上聲稱的內容
訊號很薄弱,而且它具體到足以被否證,這是它唯一有資格出現在像這樣一個頁面上的理由。剝去框架之後,這些主張是:
• Google 員工正在內部測試名為 Carbon 的 Gemini 4 檢查點。它不是公開模型,無法透過任何 API 呼叫。
• 據稱,早期內部回饋認為 Carbon 在程式編寫上的感受可與 Claude Opus 5.5 相媲美——這只是員工測試所得的印象,並非基準測試結果,也不是 Google 外部任何人能重現的數字。
• 公眾實際聽過的那個模型——Gemini 4 Argon——背後的檢查點稱為 Barium-B,而 Carbon 則被描述為一個獨立且可能更強大的迭代版本,而非同一建置掛上兩個標籤。
據報導,Carbon 正透過 Jetski 進行演練;同一份報導指出,Jetski 是 Google 內部使用的名稱,與其代理式程式開發環境 Antigravity 相關。
• Carbon 究竟會成為未來 Gemini 4 Argon 的更新,還是獨立的 Gemini 4 版本,目前仍不得而知。Google 尚未對此事發表任何評論。
那就是那份外洩內容。它包含一項比較、一組代號關係,以及一個真正懸而未決的問題,而其中沒有任何一部分是正式發布。

代號階梯,以及哪一階才重要
這份報告需要解碼環的原因,在於 Google 那種週期表式的命名習慣,把三個看似對等、實則不然的名稱塞進同一段。以下依讀者實際上能用每一個名稱做什麼來排序:
• Gemini 4 Argon——已宣布。這是一個真實的模型名稱,有官方公告貼文和系列頁面,已公布的首發價格為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,已公布的輸出上限為 100 萬 token,並以限制性方式分階段推出,最初從經過審核的資安防禦人員開始,且被描述為接下來將擴大到付費 API 客戶。它仍沒有可放入請求中的模型識別碼,而這正是已宣布模型與可呼叫模型之間的分界線。
• Barium-B — 一個檢查點名稱,而非產品。根據同一篇報導,它是獲選用於公開 Argon 版本的組建。這個標籤有用之處在於:它告訴你,Argon 這個名稱是一項包裹著內部組建的出貨決策,而不是組建本身。
• Carbon——一個附有員工心得、除此之外別無其他的內部檢查點。沒有 ID、沒有價格、沒有時程窗口、沒有日期。這是個帶著代號的傳聞,而代號很廉價。
這樣讀來,這件事並不是「一款新的 Gemini 外洩了」。而是 Google 似乎正並行運行不只一個前沿檢查點,它對外掛名的那個並不是其工程師最熱衷的那個,而且公司外沒有人知道這兩項事實中,哪一項最後會是關鍵。
為什麼「感覺像 Claude Opus 5.5」是那句承重句
在報告的所有內容中,這個比較發揮的作用最大,卻也最難以驗證,因此值得精確說明它究竟是在與什麼相比。Claude Opus 5.5 是 Anthropic 的旗艦模型,而且根據獨立評測,是當前世代中可廣泛呼叫的最強程式設計模型——當 Google 工程師想在不指名任何基準測試的情況下說出「這才是好東西」時,所會援引的參照標準。按其公布的定價,每百萬個輸入 token 為 4.00 美元,每百萬個輸出 token 為 20.00 美元,快取讀取為每百萬個 0.20 美元;它具備 1M token 的輸入視窗,以及 128K token 的最大輸出量。
相較之下,這番比較同時說了兩件事,而第二件正是人們會略過的那件。第一件是競爭層面的:一個 Google 內部的檢查點,竟被拿來與領先競爭對手的旗艦並提,這種奉承 Google 絕不會寫進部落格貼文裡。第二件是定位層面的:這項比較是員工對編碼手感的印象,而這正是那種能安然通過聊天視窗考驗、卻在排行榜面前一觸即死的說法。沒有人發表過 Carbon 的基準測試。沒有 Artificial Analysis 的收錄條目,沒有廠商基準測試表,也沒有評估方法 PDF——這些東西 Gemini 4 Argon 有,而它沒有。感覺不是分數,而本頁不會把前者粉飾成後者。
還有一個定價上的後果值得點名,但不該假裝知道答案。如果一個「在寫程式方面感覺像 Claude Opus 5.5」的檢查點正待在 Google 內部,而 Google 實際發表的模型在獨立排行榜上比它低五分,那麼有趣的問題就不是 Carbon 好不好——而是 Google 會把它定價在哪裡,以及它是否終究會以 Gemini 其餘產品線發表時所採用的主力價格來出售。
缺少了什麼,以及為什麼這份清單比新聞還長
對不存在之物的誠實盤點就是整篇文章,所以,它就在這裡:
• 模型識別碼——Carbon 沒有,Gemini 4 Argon 也沒有。這兩個名稱都不會出現在任何可供請求定址的地方。
• 價格——Carbon 在任何方案層級都沒有公佈價格,甚至連體驗優惠價也沒有。
• 模型卡或系統卡——沒有,而且背後也沒有公開的評估方法論。
• 上下文視窗、輸出上限,或參數數量——全都沒有公布,而 Google 也未曾公布任何 Gemini 的參數數量。
• 一項基準測試結果——與 Opus 5.5 的比較只是員工的印象,這意味著沒有數據、沒有測試,也無法重現。
• 一個日期——沒有公告、沒有分階段推出、沒有時程區間,Google 也完全沒有評論究竟是否計畫推出 Carbon 版本。
• 一項關聯性——Carbon 究竟是下一次 Argon 更新,還是獨立的 Gemini 4 模型。這是報告中影響最為重大的單一未知事項,而報告本身也明確指出此事尚未獲得證實。
任何不在那份清單上的,都是推論,包括接下來兩週內關於這件事所寫出的大部分內容。
開發者今天可以用這個做什麼
有用的答案是,幾乎沒有什麼改變,而精確說明原因是有價值的。無論是 Gemini 4 Argon 還是 Carbon 都不在 OrcaRouter 上——對我們自己的目錄查詢任一者都查無結果,而且這種情況會持續下去,直到 Google 讓其中一個可供呼叫為止。Gemini 4 這個名稱不是你能路由到的東西;它是一個附屬於有限制推出的名稱。任何現在提供「Gemini 4 Carbon」存取權的帳號,賣的只是一個標籤。
真正真實存在的,是那則洩漏消息用來作為衡量基準的模型。Claude Opus 5.5 已在 OrcaRouter 上線,價格為 Anthropic 的定價 — 每百萬個 token 輸入 $4.00、輸出 $20.00,快取讀取每百萬 $0.20,零加成原價轉供 — 因此,Carbon 被描述為可與之相比的那款特定模型,是你今天就能用與其他所有服務相同的 API 金鑰呼叫得到的。這比那則洩漏消息更有用,因為它是這項比較中可以被驗證的那一半。
能在謠言中存活的姿態,是不需要謠言成真的那一種。把 Claude Opus 5.5 放在你最艱難的程式編寫工作負載背後,並為不需要它的流量保留一條容錯移轉至較便宜層級的規則;當供應商目錄中出現真正的 Gemini 4 識別碼的那一天,我們的標價會在 Google 定價的同一天更新,因為從供應商公布價格到我們將其轉嫁之間,並沒有重新協商的步驟。一個 API 適用於 200+ 個模型把「我們該遷移嗎?」變成路由 DSL 的編輯與即時流量上的 A/B 測試,而不是一次重寫。根據你能衡量的結果來路由,而不是根據你讀到的名字。


我們正在觀看的內容
• Google 究竟是否會說任何話。一則留言、家庭頁面的變更,或發布貼文中的一行字,都能立刻讓這一切脫離外洩欄。沉默則讓它留在原處。
• Argon 推展的第二階段。該公告將付費 API 客戶與 Ultra 訂閱者描述為繼受審查的防禦者之後的下一批對象,而 Gemini 4 識別碼的出現,正是讓「已宣布」轉為「可呼叫」的事件。如果可執行的端點上線,其檢查點究竟是 Barium-B 還是更新的版本,這個問題就會變得具體。
• 任何對 Carbon 的獨立測量。當這樣一個檢查點出現在中立的排行榜上,而非出現在員工的印象裡,Opus 5.5 那句話就不再只是一種感覺,而開始成為一個數據點——或者不再為真。
• 價目表。Google 把自家工程師偏好的前沿檢查點擺在哪個價位,正是判斷 Carbon 究竟是 Argon 的一次更新,還是自成一級的關鍵依據。
• 代號之間的關係能否撐過正式發表的洗禮。Barium-B 排在 Argon 之後,Carbon 與其並列,這在今天是個乾淨俐落的故事;但發表文章往往會把乾淨俐落的故事壓縮成一個型號、一個 ID。
不誇大這件事的摘要很短。據報導,Google 員工正在測試一個名為 Carbon 的內部 Gemini 4 檢查點;他們的初步印象是,它寫起程式來像 Claude Opus 5.5;對外公開的 Gemini 4 Argon 版本背後的檢查點,則是另一個名叫 Barium-B 的檢查點;而 Carbon 最終是否會成為產品——無論是更新、獨立模型,或什麼都不是——尚未獲得證實。那句話裡你能據以行動的那一半,就是點名 Claude Opus 5.5 的那一半,因為它是整段中唯一具備模型識別碼、價格和端點的模型。繼續呼叫你能呼叫的模型,並備好容錯移轉規則,以備另一個名稱哪天也成為可呼叫的模型。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
