文章「Gemini 4 Carbon — LEAK REPORT」的主視覺標題卡,附有「UNVERIFIED」徽章,副標題為「An internal Google checkpoint the public cannot call — what the report says」,三個標籤分別寫著「Source: Business Insider via TestingCatalog」、「9–10 October 2026」以及「Tested on Jetski, Google's internal platform」,左側卡片寫著「The claim: early internal feedback puts Carbon comparable to Claude Opus 5.5 for coding」,右側卡片則寫著「The context: Barium-B is the checkpoint chosen for the public Gemini 4 Argon release」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 4 Carbon 外洩:Google 內部檢查點,員工稱其寫程式能力媲美 Claude Opus 5.5

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這個故事有一個版本是新聞,有一個版本是噪音,而差別完全在於那些名字附著在什麼之上。2026年10月9日與10日,Business Insider 報導——而追蹤洩漏的媒體 TestingCatalog 轉述——這家搜尋巨頭的員工正在內部測試一個名為 Carbon 的額外 Gemini 4 檢查點,早期內部回饋認為 Carbon 在寫程式方面感覺可與 Claude Opus 5.5 相媲美,且 Barium-B 是被選為公開 Gemini 4 Argon 發布的檢查點,而 Carbon 是透過該公司內部 Jetski 平台測試的獨立且可能更強大的迭代版本。讓這段內容值得細讀而非略讀的是最後一句:Carbon 究竟會作為 Gemini 4 Argon 更新推出,還是以自身名義發布,用報導自己的話來說,尚未確認。而這就是證據的全部狀態——沒有公告、沒有模型識別碼、沒有端點、沒有價格、沒有模型卡,也沒有來自供應商的評論。本頁所有具體內容都是洩漏、由洩漏推導出的推論,或是關於另一個可正式推出模型的事實,而這項洩漏正是以該模型為衡量基準。

報告實際上聲稱的內容

訊號很薄弱,而且它具體到足以被否證,這是它唯一有資格出現在像這樣一個頁面上的理由。剝去框架之後,這些主張是:

• Google 員工正在內部測試名為 Carbon 的 Gemini 4 檢查點。它不是公開模型,無法透過任何 API 呼叫。

• 據稱,早期內部回饋認為 Carbon 在程式編寫上的感受可與 Claude Opus 5.5 相媲美——這只是員工測試所得的印象,並非基準測試結果,也不是 Google 外部任何人能重現的數字。

• 公眾實際聽過的那個模型——Gemini 4 Argon——背後的檢查點稱為 Barium-B,而 Carbon 則被描述為一個獨立且可能更強大的迭代版本,而非同一建置掛上兩個標籤。

據報導,Carbon 正透過 Jetski 進行演練;同一份報導指出,Jetski 是 Google 內部使用的名稱,與其代理式程式開發環境 Antigravity 相關。

• Carbon 究竟會成為未來 Gemini 4 Argon 的更新,還是獨立的 Gemini 4 版本,目前仍不得而知。Google 尚未對此事發表任何評論。

那就是那份外洩內容。它包含一項比較、一組代號關係,以及一個真正懸而未決的問題,而其中沒有任何一部分是正式發布。

A two-column infographic titled 'Gemini 4 Carbon — what the report says / what it does not'. Left column 'What the report says': '9–10 Oct 2026 — Business Insider, relayed by TestingCatalog', 'Google staff testing a Gemini 4 checkpoint named Carbon', 'Early internal feedback: feels comparable to Claude Opus 5.5 for coding', 'Barium-B is the checkpoint chosen for the public Gemini 4 Argon release', 'Tested via Jetski, tied to Antigravity'. Right column 'What it does not say': 'Whether Carbon ships as an Argon update or a separate Gemini 4 release', 'No model ID, endpoint or price of any kind', 'No model card, context window or parameter count', 'No benchmark number behind the Opus 5.5 comparison', 'No date, and no comment from Google'. Footer: 'All leak claims unverified; Google has not commented.'

代號階梯,以及哪一階才重要

這份報告需要解碼環的原因,在於 Google 那種週期表式的命名習慣,把三個看似對等、實則不然的名稱塞進同一段。以下依讀者實際上能用每一個名稱做什麼來排序:

• Gemini 4 Argon——已宣布。這是一個真實的模型名稱,有官方公告貼文和系列頁面,已公布的首發價格為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,已公布的輸出上限為 100 萬 token,並以限制性方式分階段推出,最初從經過審核的資安防禦人員開始,且被描述為接下來將擴大到付費 API 客戶。它仍沒有可放入請求中的模型識別碼,而這正是已宣布模型與可呼叫模型之間的分界線。

• Barium-B — 一個檢查點名稱,而非產品。根據同一篇報導,它是獲選用於公開 Argon 版本的組建。這個標籤有用之處在於:它告訴你,Argon 這個名稱是一項包裹著內部組建的出貨決策,而不是組建本身。

• Carbon——一個附有員工心得、除此之外別無其他的內部檢查點。沒有 ID、沒有價格、沒有時程窗口、沒有日期。這是個帶著代號的傳聞,而代號很廉價。

這樣讀來,這件事並不是「一款新的 Gemini 外洩了」。而是 Google 似乎正並行運行不只一個前沿檢查點,它對外掛名的那個並不是其工程師最熱衷的那個,而且公司外沒有人知道這兩項事實中,哪一項最後會是關鍵。

為什麼「感覺像 Claude Opus 5.5」是那句承重句

在報告的所有內容中,這個比較發揮的作用最大,卻也最難以驗證,因此值得精確說明它究竟是在與什麼相比。Claude Opus 5.5 是 Anthropic 的旗艦模型,而且根據獨立評測,是當前世代中可廣泛呼叫的最強程式設計模型——當 Google 工程師想在不指名任何基準測試的情況下說出「這才是好東西」時,所會援引的參照標準。按其公布的定價,每百萬個輸入 token 為 4.00 美元,每百萬個輸出 token 為 20.00 美元,快取讀取為每百萬個 0.20 美元;它具備 1M token 的輸入視窗,以及 128K token 的最大輸出量。

相較之下,這番比較同時說了兩件事,而第二件正是人們會略過的那件。第一件是競爭層面的:一個 Google 內部的檢查點,竟被拿來與領先競爭對手的旗艦並提,這種奉承 Google 絕不會寫進部落格貼文裡。第二件是定位層面的:這項比較是員工對編碼手感的印象,而這正是那種能安然通過聊天視窗考驗、卻在排行榜面前一觸即死的說法。沒有人發表過 Carbon 的基準測試。沒有 Artificial Analysis 的收錄條目,沒有廠商基準測試表,也沒有評估方法 PDF——這些東西 Gemini 4 Argon 有,而它沒有。感覺不是分數,而本頁不會把前者粉飾成後者。

還有一個定價上的後果值得點名,但不該假裝知道答案。如果一個「在寫程式方面感覺像 Claude Opus 5.5」的檢查點正待在 Google 內部,而 Google 實際發表的模型在獨立排行榜上比它低五分,那麼有趣的問題就不是 Carbon 好不好——而是 Google 會把它定價在哪裡,以及它是否終究會以 Gemini 其餘產品線發表時所採用的主力價格來出售。

缺少了什麼,以及為什麼這份清單比新聞還長

對不存在之物的誠實盤點就是整篇文章,所以,它就在這裡:

• 模型識別碼——Carbon 沒有,Gemini 4 Argon 也沒有。這兩個名稱都不會出現在任何可供請求定址的地方。

• 價格——Carbon 在任何方案層級都沒有公佈價格,甚至連體驗優惠價也沒有。

• 模型卡或系統卡——沒有,而且背後也沒有公開的評估方法論。

• 上下文視窗、輸出上限,或參數數量——全都沒有公布,而 Google 也未曾公布任何 Gemini 的參數數量。

• 一項基準測試結果——與 Opus 5.5 的比較只是員工的印象,這意味著沒有數據、沒有測試,也無法重現。

• 一個日期——沒有公告、沒有分階段推出、沒有時程區間,Google 也完全沒有評論究竟是否計畫推出 Carbon 版本。

• 一項關聯性——Carbon 究竟是下一次 Argon 更新,還是獨立的 Gemini 4 模型。這是報告中影響最為重大的單一未知事項,而報告本身也明確指出此事尚未獲得證實。

任何不在那份清單上的,都是推論,包括接下來兩週內關於這件事所寫出的大部分內容。

開發者今天可以用這個做什麼

有用的答案是,幾乎沒有什麼改變,而精確說明原因是有價值的。無論是 Gemini 4 Argon 還是 Carbon 都不在 OrcaRouter 上——對我們自己的目錄查詢任一者都查無結果,而且這種情況會持續下去,直到 Google 讓其中一個可供呼叫為止。Gemini 4 這個名稱不是你能路由到的東西;它是一個附屬於有限制推出的名稱。任何現在提供「Gemini 4 Carbon」存取權的帳號,賣的只是一個標籤。

真正真實存在的,是那則洩漏消息用來作為衡量基準的模型。Claude Opus 5.5 已在 OrcaRouter 上線,價格為 Anthropic 的定價 — 每百萬個 token 輸入 $4.00、輸出 $20.00,快取讀取每百萬 $0.20,零加成原價轉供 — 因此,Carbon 被描述為可與之相比的那款特定模型,是你今天就能用與其他所有服務相同的 API 金鑰呼叫得到的。這比那則洩漏消息更有用,因為它是這項比較中可以被驗證的那一半。

能在謠言中存活的姿態,是不需要謠言成真的那一種。把 Claude Opus 5.5 放在你最艱難的程式編寫工作負載背後,並為不需要它的流量保留一條容錯移轉至較便宜層級的規則;當供應商目錄中出現真正的 Gemini 4 識別碼的那一天,我們的標價會在 Google 定價的同一天更新,因為從供應商公布價格到我們將其轉嫁之間,並沒有重新協商的步驟。一個 API 適用於 200+ 個模型把「我們該遷移嗎?」變成路由 DSL 的編輯與即時流量上的 A/B 測試,而不是一次重寫。根據你能衡量的結果來路由,而不是根據你讀到的名字。

A screenshot of Google's own Gemini API models documentation page, listing the Gemini 3.8 family and earlier models with their model codes and pricing, and containing no entry for Gemini 4 Argon or Gemini 4 Carbon.A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the model id, its capability chips, a 1M-token context window, a 128K maximum output, and pricing of .00 per 1M input tokens and 0.00 per 1M output tokens with cache reads at /bin/bash.20 per 1M.

我們正在觀看的內容

• Google 究竟是否會說任何話。一則留言、家庭頁面的變更,或發布貼文中的一行字,都能立刻讓這一切脫離外洩欄。沉默則讓它留在原處。

• Argon 推展的第二階段。該公告將付費 API 客戶與 Ultra 訂閱者描述為繼受審查的防禦者之後的下一批對象,而 Gemini 4 識別碼的出現,正是讓「已宣布」轉為「可呼叫」的事件。如果可執行的端點上線,其檢查點究竟是 Barium-B 還是更新的版本,這個問題就會變得具體。

• 任何對 Carbon 的獨立測量。當這樣一個檢查點出現在中立的排行榜上,而非出現在員工的印象裡,Opus 5.5 那句話就不再只是一種感覺,而開始成為一個數據點——或者不再為真。

• 價目表。Google 把自家工程師偏好的前沿檢查點擺在哪個價位,正是判斷 Carbon 究竟是 Argon 的一次更新,還是自成一級的關鍵依據。

• 代號之間的關係能否撐過正式發表的洗禮。Barium-B 排在 Argon 之後,Carbon 與其並列,這在今天是個乾淨俐落的故事;但發表文章往往會把乾淨俐落的故事壓縮成一個型號、一個 ID。

不誇大這件事的摘要很短。據報導,Google 員工正在測試一個名為 Carbon 的內部 Gemini 4 檢查點;他們的初步印象是,它寫起程式來像 Claude Opus 5.5;對外公開的 Gemini 4 Argon 版本背後的檢查點,則是另一個名叫 Barium-B 的檢查點;而 Carbon 最終是否會成為產品——無論是更新、獨立模型,或什麼都不是——尚未獲得證實。那句話裡你能據以行動的那一半,就是點名 Claude Opus 5.5 的那一半,因為它是整段中唯一具備模型識別碼、價格和端點的模型。繼續呼叫你能呼叫的模型,並備好容錯移轉規則,以備另一個名稱哪天也成為可呼叫的模型。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新