Thẻ tiêu đề hero cho bài viết 'Gemini 4 Carbon — LEAK REPORT' với huy hiệu 'UNVERIFIED', phụ đề 'Một checkpoint nội bộ của Google mà công chúng không thể gọi — báo cáo nói gì', ba chip ghi 'Nguồn: Business Insider qua TestingCatalog', '9–10 tháng 10 năm 2026' và 'Được thử nghiệm trên Jetski, nền tảng nội bộ của Google', một thẻ bên trái ghi 'Tuyên bố: phản hồi nội bộ ban đầu đánh giá Carbon tương đương Claude Opus 5.5 về lập trình', và một thẻ bên phải ghi 'Bối cảnh: Barium-B là checkpoint được chọn cho bản phát hành Gemini 4 Argon công khai'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Rò rỉ Carbon Gemini 4: Checkpoint nội bộ của Google mà nhân viên nói rằng viết mã giống Claude Opus 5.5.

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có một phiên bản của câu chuyện này là tin tức và một phiên bản là nhiễu, và sự khác biệt nằm hoàn toàn ở việc những cái tên được gắn vào điều gì. Vào ngày 9 và 10 tháng 10 năm 2026, Business Insider đưa tin — và trang theo dõi rò rỉ TestingCatalog dẫn lại — rằng nhân viên tại gã khổng lồ tìm kiếm đang nội bộ thử nghiệm thêm một checkpoint Gemini 4 có tên Carbon, rằng phản hồi nội bộ ban đầu cho thấy Carboncó cảm giác tương đương với Claude Opus 5.5về khả năng lập trình, rằng Barium-Blà checkpoint được chọn cho bản phát hành công khai Gemini 4 Argon, và rằng Carbon, được thử nghiệm thông qua nền tảng Jetskinội bộ của công ty, là một phiên bản riêng biệt và có thể còn mạnh hơn. Điều khiến thông tin đó đáng đọc chứ không chỉ đáng lướt qua là mệnh đề cuối cùng: liệu Carbonsẽ được phát hành dưới dạng Gemini 4 Argonbản cập nhật hay là một bản phát hành riêng, theo chính lời của báo cáo, vẫn chưa được xác nhận. Và đó là toàn bộ tình trạng bằng chứng — không có thông báo, không có mã định danh mô hình, không có endpoint, không có giá, không có thẻ mô hình, và không có bình luận nào từ nhà cung cấp. Mọi thứ cụ thể trên trang này đều là một rò rỉ, một suy luận rút ra từ rò rỉ, hoặc một sự thật về một mô hình khác, có thể phát hành được, mà rò rỉ đó được đối chiếu với.

Báo cáo thực sự khẳng định điều gì

Tín hiệu thì mỏng manh, và nó đủ cụ thể để có thể bị bác bỏ, đó là lý do duy nhất nó thuộc về một trang như trang này. Bỏ đi phần dẫn dắt, các tuyên bố là:

• Nhân viên Google đang nội bộ thử nghiệm một checkpoint Gemini 4 có tên Carbon. Đây không phải là mô hình công khai và không thể được gọi từ bất kỳ API nào.

• Phản hồi nội bộ ban đầu được cho là đánh giá Carbon có cảm giác tương đương với Claude Opus 5.5 khi lập trình — một ấn tượng từ quá trình thử nghiệm của nhân viên, không phải kết quả benchmark, và cũng không phải một con số mà bất kỳ ai bên ngoài Google có thể tái tạo.

• Checkpoint đằng sau mô hình mà công chúng thực sự đã nghe đến — Gemini 4 Argon — được gọi là Barium-B, và Carbon được mô tả là một phiên bản kế tiếp riêng biệt và có tiềm năng mạnh hơn, chứ không phải cùng một bản build dưới hai nhãn.

• Carbon được cho là đang được sử dụng thông qua Jetski, mà cùng báo cáo đó mô tả là tên nội bộ của Google gắn với Antigravity, môi trường lập trình agentic của hãng.

• Liệu Carbon sẽ trở thành một bản cập nhật Gemini 4 Argon trong tương lai hay một bản phát hành Gemini 4 riêng biệt thì vẫn chưa rõ. Google chưa bình luận gì về bất kỳ điều nào trong số đó.

Đó là vụ rò rỉ. Nó chứa một so sánh, một mối quan hệ tên mã, và một câu hỏi thực sự bỏ ngỏ, và không phần nào của nó là một bản phát hành.

A two-column infographic titled 'Gemini 4 Carbon — what the report says / what it does not'. Left column 'What the report says': '9–10 Oct 2026 — Business Insider, relayed by TestingCatalog', 'Google staff testing a Gemini 4 checkpoint named Carbon', 'Early internal feedback: feels comparable to Claude Opus 5.5 for coding', 'Barium-B is the checkpoint chosen for the public Gemini 4 Argon release', 'Tested via Jetski, tied to Antigravity'. Right column 'What it does not say': 'Whether Carbon ships as an Argon update or a separate Gemini 4 release', 'No model ID, endpoint or price of any kind', 'No model card, context window or parameter count', 'No benchmark number behind the Opus 5.5 comparison', 'No date, and no comment from Google'. Footer: 'All leak claims unverified; Google has not commented.'

Thang mật danh, và nấc nào mới quan trọng

Lý do cần có vòng giải mã này là bảng tuần hoàn của Google đặt ba cái tên vào cùng một đoạn văn trông có vẻ song song với nhau nhưng thực ra không phải vậy. Sắp xếp theo điều mà người đọc thực sự có thể làm với từng cái:

• Gemini 4 Argon — đã được công bố. Một tên mô hình thật với bài đăng công bố chính thức và trang dòng sản phẩm, mức giá giới thiệu được công bố là 2 đô-la cho mỗi triệu token đầu vào và 10 đô-la cho mỗi triệu token đầu ra, giới hạn đầu ra 1 triệu token được công bố, và một đợt triển khai có kiểm soát bắt đầu với các chuyên gia phòng thủ mạng đã được thẩm định và được mô tả là sẽ mở rộng cho khách hàng API trả phí tiếp theo. Nó vẫn chưa có mã định danh mô hình mà bạn có thể đưa vào một yêu cầu, đó là ranh giới giữa một mô hình đã được công bố và một mô hình có thể gọi được.

• Barium-B — tên của một checkpoint, không phải một sản phẩm. Theo cùng nguồn đưa tin đó, nó là bản build được chọn cho bản phát hành Argon công khai. Đó là điều hữu ích ở nhãn này: nó cho bạn biết rằng cái tên Argon là một quyết định phát hành được gói quanh một bản build nội bộ chứ không phải chính một bản build.

• Carbon — một điểm kiểm tra nội bộ với các ấn tượng của nhân viên đính kèm và không có gì khác. Không ID, không giá, không cửa sổ, không ngày tháng. Đó là một tin đồn với một mật danh, và mật danh thì rẻ mạt.

Đọc theo cách đó, câu chuyện không phải là "một Gemini mới bị rò rỉ". Mà là Google dường như đang chạy song song nhiều hơn một checkpoint tiên tiến, rằng cái mà họ gắn tên công khai của mình vào không phải là cái mà các kỹ sư của họ hào hứng nhất, và rằng không ai bên ngoài công ty biết trong hai sự thật đó, điều nào rốt cuộc sẽ trở nên quan trọng.

Vì sao "cảm giác như Claude Opus 5.5" lại là câu chịu lực

Trong toàn bộ báo cáo, phần so sánh đang gánh vác nhiều nhất và cũng khó kiểm chứng nhất, nên đáng để nói cho chính xác về việc nó đang được so sánh với cái gì. Claude Opus 5.5 là mẫu flagship của Anthropic và, theo đo lường độc lập, là mô hình lập trình mạnh nhất có thể gọi rộng rãi thuộc thế hệ hiện tại — điểm tham chiếu mà một kỹ sư Google nhắc đến khi muốn nói "đây là cái tốt" mà không cần nêu tên một benchmark nào. Theo giá niêm yết đã công bố, nó có giá $4.00 mỗi triệu token đầu vào và $20.00 mỗi triệu token đầu ra, với lượt đọc cache ở mức $0.20 mỗi triệu, và nó có cửa sổ đầu vào 1M token cùng đầu ra tối đa 128K token.

Đặt bên cạnh đó, sự so sánh này nói lên hai điều cùng lúc, và điều thứ hai là điều người ta thường bỏ qua. Điều thứ nhất mang tính cạnh tranh: một checkpoint nội bộ của Google đang được nhắc đến cùng lúc với mẫu flagship của đối thủ dẫn đầu, và đó là lời khen mà Google sẽ không đời nào đưa vào một bài blog. Điều thứ hai mang tính vị thế: sự so sánh này là cảm nhận của nhân viên về cảm giác khi viết code, đúng kiểu khẳng định có thể sống sót khi tiếp xúc với cửa sổ chat và chết ngay khi tiếp xúc với bảng xếp hạng. Chưa ai công bố benchmark cho Carbon. Không có mục Artificial Analysis nào, không có bảng benchmark của nhà cung cấp, không có PDF phương pháp đánh giá — những thứ đó tồn tại cho Gemini 4 Argon và chúng không tồn tại cho cái này. Một cảm giác không phải là điểm số, và trang này sẽ không tô vẽ cái này thành cái kia.

Còn một hệ quả về giá đáng để gọi tên mà không giả vờ rằng ta biết câu trả lời. Nếu một checkpoint "có cảm giác như Claude Opus 5.5 khi lập trình" đang nằm bên trong Google, và mô hình mà Google thực sự công bố lại nằm thấp hơn nó năm điểm trên bảng xếp hạng độc lập, thì câu hỏi thú vị không phải là liệu Carbon có tốt hay không — mà là Google sẽ định giá nó ở đâu, và liệu nó có bao giờ được bán ở mức giá dành cho mẫu chủ lực mà phần còn lại của dòng Gemini đã được phát hành hay không.

Còn thiếu điều gì, và tại sao danh sách lại dài hơn tin tức

Bản liệt kê trung thực về những gì không tồn tại chính là toàn bộ bài viết, vậy đây:

• Một mã định danh mô hình — Carbon không có mã nào, và Gemini 4 Argon cũng vậy. Không tên nào trong hai tên đó xuất hiện ở bất cứ đâu mà một yêu cầu có thể được gửi tới.

• Một mức giá — không có gì được công bố cho Carbon ở bất kỳ gói nào, thậm chí không có cả mức giá giới thiệu.

• Thẻ mô hình hoặc thẻ hệ thống — không có, và cũng không có phương pháp đánh giá nào được công bố đằng sau nó.

• Cửa sổ ngữ cảnh, giới hạn đầu ra hay số lượng tham số — không có thông tin nào được công bố, và Google chưa công bố số lượng tham số cho bất kỳ Gemini nào.

• Một kết quả đánh giá chuẩn — phần so sánh Opus 5.5 chỉ là cảm nhận của nhân viên, nghĩa là không có con số, không có bài kiểm tra, và không thể tái lập.

• Một ngày — không thông báo, không triển khai theo từng giai đoạn, không khung thời gian, và không bình luận nào từ Google về việc liệu có kế hoạch phát hành Carbon nào hay không.

• Một mối quan hệ — liệu Carbon là bản cập nhật Argon tiếp theo hay là một mô hình Gemini 4 riêng biệt. Đây là ẩn số có hệ quả lớn nhất trong báo cáo và nó được nêu rõ ràng là chưa được xác nhận ngay trong chính báo cáo.

Bất cứ điều gì không có trong danh sách đó đều là suy luận, bao gồm phần lớn những gì sẽ được viết về vấn đề này trong hai tuần tới.

Một nhà phát triển có thể làm gì với điều này ngay hôm nay

Câu trả lời hữu ích là hầu như không có gì thay đổi, và thật đáng để nói chính xác vì sao. Cả Gemini 4 Argon lẫn Carbon đều không có trên OrcaRouter — truy vấn danh mục của chính chúng tôi cho một trong hai đều không trả về gì, và nó sẽ tiếp tục không trả về gì cho đến khi Google làm cho một trong hai có thể gọi được. Tên Gemini 4 không phải là thứ bạn có thể định tuyến tới; nó là một cái tên gắn với một đợt triển khai có kiểm soát. Bất kỳ tài khoản nào hiện đang chào mời quyền truy cập "Gemini 4 Carbon" đều đang bán một cái mác.

Điều có thật là mô hình mà thông tin rò rỉ được đo lường dựa vào. Claude Opus 5.5 đang hoạt động trên OrcaRouter với mức giá niêm yết của Anthropic — 4,00 USD cho đầu vào và 20,00 USD cho đầu ra mỗi triệu token, đọc bộ nhớ đệm ở mức 0,20 USD mỗi triệu, được chuyển tiếp với mức chênh lệch bằng không — vì vậy mô hình cụ thể mà Carbon được mô tả là có thể so sánh được chính là mô hình bạn có thể gọi ngay hôm nay, trên cùng khóa API như mọi thứ khác. Đó là một sự thật hữu ích hơn thông tin rò rỉ, bởi vì nó là một nửa của phép so sánh có thể được kiểm chứng.

Tư thế tồn tại được qua một tin đồn là tư thế không cần tin đồn đó phải đúng. Hãy đặt Claude Opus 5.5 đằng sau những khối lượng công việc lập trình khó nhất của bạn và giữ một quy tắc chuyển đổi dự phòng sang một tầng rẻ hơn cho lưu lượng không cần đến nó; vào ngày một định danh Gemini 4 thật xuất hiện trong danh mục nhà cung cấp, giá niêm yết của chúng tôi sẽ cập nhật cùng ngày Google đặt chúng, bởi vì không có bước đàm phán lại nào giữa việc nhà cung cấp công bố giá và việc chúng tôi chuyển tiếp nó. Một API cho hơn 200 mô hình biến "chúng ta có nên di chuyển không?" thành một chỉnh sửa routing-DSL và một A/B trên lưu lượng trực tiếp thay vì một lần viết lại. Định tuyến theo kết quả bạn có thể đo lường, không phải theo những cái tên bạn đọc được.

A screenshot of Google's own Gemini API models documentation page, listing the Gemini 3.8 family and earlier models with their model codes and pricing, and containing no entry for Gemini 4 Argon or Gemini 4 Carbon.A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the model id, its capability chips, a 1M-token context window, a 128K maximum output, and pricing of .00 per 1M input tokens and 0.00 per 1M output tokens with cache reads at /bin/bash.20 per 1M.

Những gì chúng tôi đang xem

• Liệu Google có nói bất cứ điều gì hay không. Một bình luận, một thay đổi trên trang dành cho gia đình, hay một dòng trong bài đăng ra mắt sẽ cùng lúc đưa tất cả những điều này ra khỏi chuyên mục rò rỉ. Sự im lặng giữ nó nguyên tại chỗ.

• Giai đoạn thứ hai trong đợt triển khai Argon. Thông báo mô tả khách hàng API trả phí và người đăng ký Ultra là nhóm kế tiếp sau các chuyên gia phòng thủ đã được thẩm định, và sự xuất hiện của một mã định danh Gemini 4 chính là sự kiện biến “đã công bố” thành “có thể gọi”. Nếu một endpoint có thể chạy được xuất hiện, câu hỏi liệu checkpoint của nó là Barium-B hay thứ gì đó mới hơn sẽ trở nên cụ thể.

• Bất kỳ phép đo độc lập nào về Carbon. Khoảnh khắc một checkpoint như thế này xuất hiện trên một bảng xếp hạng trung lập thay vì trong một cảm nhận của nhân viên, câu nói về Opus 5.5 không còn là một vibe nữa mà bắt đầu trở thành một điểm dữ liệu — hoặc không còn đúng nữa.

• Bảng giá. Việc Google định giá một checkpoint tiên phong mà chính các kỹ sư của họ ưa thích chính là dấu hiệu cho thấy Carbon là một bản cập nhật của Argon hay là một hạng riêng.

• Liệu mối quan hệ tên mã có trụ vững khi tiếp xúc với một buổi ra mắt hay không. Barium-B đứng sau Argon và Carbon song hành cùng nó là một câu chuyện rõ ràng của ngày hôm nay; các bài đăng ra mắt thường có thói quen nghiền nát những câu chuyện rõ ràng thành một mô hình với một ID duy nhất.

Bản tóm tắt không thổi phồng điều này thì ngắn gọn. Nhân viên Google được cho là đang thử nghiệm một checkpoint Gemini 4 nội bộ có tên Carbon, ấn tượng ban đầu của họ là nó viết mã giống như Claude Opus 5.5, checkpoint đằng sau bản phát hành Gemini 4 Argon công khai là một checkpoint khác có tên Barium-B, và liệu Carbon có bao giờ trở thành một sản phẩm hay không — một bản cập nhật, một mô hình riêng, hay chẳng là gì cả — vẫn chưa được xác nhận. Nửa câu mà bạn có thể hành động dựa trên đó là nửa nêu tên Claude Opus 5.5, vì đó là mô hình duy nhất trong đoạn văn có mã định danh mô hình, có giá và có endpoint. Cứ tiếp tục gọi những gì bạn có thể gọi, và luôn sẵn sàng một quy tắc chuyển đổi dự phòng cho ngày cái tên kia cũng trở thành một thứ như vậy.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày