Główna karta tytułowa artykułu „Gemini 4 Carbon — RAPORT O WYCIEKU” z plakietką „NIEZWERYFIKOWANE”, podtytuł „Wewnętrzny checkpoint Google, którego opinia publiczna nie może wywołać — co mówi raport”, trzy chipy o treści „Źródło: Business Insider za pośrednictwem TestingCatalog”, „9–10 października 2026” i „Testowane na Jetski, wewnętrznej platformie Google”, lewa karta o treści „Teza: wczesne wewnętrzne opinie wskazują, że Carbon jest porównywalny z Claude Opus 5.5 w kodowaniu”, a prawa karta o treści „Kontekst: Barium-B to checkpoint wybrany do publicznego wydania Gemini 4 Argon”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

Wyciek Gemini 4 Carbon: wewnętrzny checkpoint Google, który zdaniem pracowników koduje jak Claude Opus 5.5.

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Istnieje wersja tej historii, która jest informacją, i wersja, która jest szumem, a różnica tkwi wyłącznie w tym, do czego przypisane są nazwy. W dniach 9 i 10 października 2026 r. Business Insider poinformował — a serwis śledzący przecieki TestingCatalog przekazał — że pracownicy giganta wyszukiwania wewnętrznie testują dodatkowy checkpoint Gemini 4 o nazwie Carbon, że wczesne wewnętrzne opinie wskazują, że Carbon wypada porównywalnie do Claude Opus 5.5 w kodowaniu, że Barium-B jest checkpointem wybranym do publicznego wydania Gemini 4 Argon, oraz że Carbon, testowany przez wewnętrzną platformę Jetski firmy, jest osobną i być może mocniejszą iteracją. To, co sprawia, że warto to przeczytać, a nie tylko przejrzeć, to ostatnie zdanie: czy Carbon zostanie wydany jako aktualizacja Gemini 4 Argon czy jako osobne wydanie, jest, jak ujmuje to sam raport, niepotwierdzone. I to jest cały stan dowodów — żadnego ogłoszenia, żadnego identyfikatora modelu, żadnego endpointu, żadnej ceny, żadnej karty modelu i żadnego komentarza od dostawcy. Wszystko konkretne na tej stronie to przeciek, wniosek wyciągnięty z przecieku albo fakt o innym, gotowym do wdrożenia modelu, z którym porównuje się ten przeciek.

Co tak naprawdę twierdzi raport

Sygnał jest nikły i wystarczająco konkretny, by można go było sfalsyfikować, i to jedyny powód, dla którego trafia na taką stronę. Po odarciu z otoczki twierdzenia są następujące:

• Pracownicy Google wewnętrznie testują punkt kontrolny Gemini 4 o nazwie Carbon. Nie jest to publiczny model i nie można go wywołać z żadnego API.

• Wczesne wewnętrzne opinie podobno stawiają Carbon jako odczuwalnie porównywalny do Claude Opus 5.5 w kodowaniu — to wrażenie z testów pracowników, a nie wynik benchmarku i nie liczba, którą ktokolwiek spoza Google mógłby odtworzyć.

• Checkpoint stojący za modelem, o którym opinia publiczna faktycznie słyszała — Gemini 4 Argon — nazywa się Barium-B, a Carbon jest opisywany jako osobna iteracja o potencjalnie większych możliwościach, a nie ten sam build pod dwiema etykietami.

• Carbon jest tworzony przez Jetski, które to samo źródło opisuje jako wewnętrzne narzędzie Google'a powiązane z Antigravity, jego agentowym środowiskiem programistycznym.

• Nie wiadomo, czy Carbon stanie się przyszłą aktualizacją Gemini 4 Argon, czy odrębnym wydaniem Gemini 4. Google nie skomentował żadnej z tych kwestii.

To jest ten przeciek. Zawiera jedno porównanie, jedno powiązanie kryptonimowe i jedno naprawdę otwarte pytanie, a żadna jego część nie jest wydaniem.

A two-column infographic titled 'Gemini 4 Carbon — what the report says / what it does not'. Left column 'What the report says': '9–10 Oct 2026 — Business Insider, relayed by TestingCatalog', 'Google staff testing a Gemini 4 checkpoint named Carbon', 'Early internal feedback: feels comparable to Claude Opus 5.5 for coding', 'Barium-B is the checkpoint chosen for the public Gemini 4 Argon release', 'Tested via Jetski, tied to Antigravity'. Right column 'What it does not say': 'Whether Carbon ships as an Argon update or a separate Gemini 4 release', 'No model ID, endpoint or price of any kind', 'No model card, context window or parameter count', 'No benchmark number behind the Opus 5.5 comparison', 'No date, and no comment from Google'. Footer: 'All leak claims unverified; Google has not commented.'

Drabina kryptonimów i to, który szczebel ma znaczenie

Powód, dla którego ten raport potrzebuje pierścienia deszyfrującego, jest taki, że zwyczaj Google'a układania wszystkiego jak w tablicy okresowej umieszcza w jednym akapicie trzy nazwy, które wyglądają na równoległe, a takie nie są. Uszeregowane według tego, co czytelnik może faktycznie zrobić z każdą z nich:

• Gemini 4 Argon — ogłoszono. Prawdziwa nazwa modelu z oficjalnym wpisem ogłaszającym i stroną rodziny modeli, opublikowaną ceną wprowadzającą 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych, opublikowanym limitem 1 miliona tokenów wyjściowych oraz ograniczonym wdrażaniem etapowym, które rozpoczęło się od zweryfikowanych obrońców cyberprzestrzeni i które opisano jako rozszerzane w następnej kolejności na płacących klientów API. Nadal nie ma identyfikatora modelu, który można umieścić w żądaniu, co stanowi granicę między ogłoszonym modelem a modelem, który można wywołać.

• Barium-B — nazwa punktu kontrolnego, a nie produkt. Zgodnie z tym samym raportem to kompilacja wybrana do publicznego wydania Argon. To właśnie jest w tym przydatne: etykieta mówi, że nazwa Argon to decyzja o wydaniu opakowująca wewnętrzną kompilację, a nie sama kompilacja.

• Carbon — wewnętrzny punkt kontrolny z dołączonymi wrażeniami personelu i nic więcej. Żadnego identyfikatora, żadnej ceny, żadnego okna, żadnej daty. To plotka z kryptonimem, a kryptonimy są tanie.

Czytana w ten sposób historia nie jest „wyciekiem nowego Gemini”. Chodzi o to, że Google najwyraźniej prowadzi równolegle więcej niż jeden frontier checkpoint, że ten, któremu nadało publiczną nazwę, nie jest tym, którym jego inżynierowie są najbardziej zachwyceni, i że nikt poza firmą nie wie, który z tych dwóch faktów okaże się mieć znaczenie.

Dlaczego „sprawia wrażenie Claude Opus 5.5” to zdanie nośne

Ze wszystkiego w raporcie to porównanie odgrywa największą rolę i jest najtrudniejsze do zweryfikowania, warto więc precyzyjnie określić, z czym jest porównywane. Claude Opus 5.5 to flagowy model firmy Anthropic i, według niezależnych pomiarów, najsilniejszy powszechnie dostępny model do programowania obecnej generacji — punkt odniesienia, po który sięga inżynier Google, gdy chce powiedzieć „to jest ten dobry”, nie wskazując żadnego benchmarku. W opublikowanej cenie katalogowej kosztuje 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych, a odczyty z pamięci podręcznej kosztują 0,20 USD za milion; ma też okno wejściowe o rozmiarze 1 mln tokenów i maksymalny rozmiar wyjścia wynoszący 128 tys. tokenów.

Na tle tego to porównanie mówi dwie rzeczy naraz, a druga z nich jest tą, którą ludzie pomijają. Pierwsza dotyczy konkurencji: wewnętrzny checkpoint Google jest opisywany jednym tchem obok flagowego modelu wiodącego rywala, co jest komplementem, którego Google nie umieściłby we wpisie na blogu. Druga dotyczy pozycjonowania: to porównanie jest wrażeniem pracowników na temat tego, jak się koduje, a to dokładnie ten rodzaj twierdzenia, który przetrwa kontakt z oknem czatu i ginie przy kontakcie z leaderboardem. Nikt nie opublikował benchmarku dla Carbon. Nie ma wpisu w Artificial Analysis, nie ma tabeli benchmarków dostawcy, nie ma PDF-a z metodologią ewaluacji — takie rzeczy istnieją dla Gemini 4 Argon, a dla tego nie istnieją. Wrażenie to nie wynik, a ta strona nie zamierza przedstawiać jednego jako drugiego.

Jest też konsekwencja cenowa, którą warto nazwać, nie udając, że znamy odpowiedź. Jeśli checkpoint, który „sprawia wrażenie Claude Opus 5.5 w kodowaniu”, siedzi wewnątrz Google, a model, który Google faktycznie ogłosiło, plasuje się pięć punktów poniżej niego w niezależnym indeksie, to ciekawe pytanie nie brzmi, czy Carbon jest dobry — lecz jak Google by go wyceniło i czy kiedykolwiek byłby sprzedawany po stawkach dla modeli roboczych, po których wydawano resztę linii Gemini.

Czego brakuje i dlaczego lista jest dłuższa niż wiadomości

Uczciwa inwentaryzacja tego, co nie istnieje, to cały artykuł, więc oto on:

• Identyfikator modelu — Carbon go nie posiada, podobnie jak Gemini 4 Argon. Żadna z tych nazw nie pojawia się w żadnym miejscu, do którego można skierować żądanie.

• Cena — dla Carbon nie opublikowano nic na żadnym poziomie, nawet stawki wprowadzającej.

• Karta modelu lub karta systemu — brak, a za tym nie stoi żadna opublikowana metodologia oceny.

• Okno kontekstowe, limit wyjściowy lub liczba parametrów — żadne z nich nie zostało opublikowane, a Google nie opublikowało liczby parametrów dla żadnego modelu Gemini.

• Wynik benchmarku — porównanie z Opus 5.5 to wrażenie pracownika, co oznacza brak liczby, brak testu i brak powtarzalności.

• Data — żadnego ogłoszenia, żadnego etapowego wdrażania, żadnego okna wydania ani żadnego komentarza ze strony Google na temat tego, czy wydanie Carbon jest w ogóle planowane.

• Relacja — czy Carbon jest kolejną aktualizacją Argon, czy osobnym modelem Gemini 4. To najistotniejsza niewiadoma w raporcie i jest ona wyraźnie niepotwierdzona w samym raporcie.

Wszystko, czego nie ma na tej liście, jest domysłem, w tym większość tego, co zostanie o tym napisane w ciągu najbliższych dwóch tygodni.

Co programista może z tym dzisiaj zrobić

Użyteczna odpowiedź jest taka, że prawie nic się nie zmienia — i warto powiedzieć dokładnie dlaczego. Ani Gemini 4 Argon, ani Carbon nie znajdują się w OrcaRouter; zapytanie do naszego własnego katalogu o którykolwiek z nich nic nie zwraca i nadal nic nie będzie zwracać, dopóki Google nie uczyni jednego z nich możliwym do wywołania. Nazwa Gemini 4 nie jest czymś, do czego można kierować żądania; to nazwa przypisana do wdrożenia o ograniczonym dostępie. Każde konto oferujące teraz dostęp do „Gemini 4 Carbon” sprzedaje etykietę.

Realny jest model, względem którego mierzy się przeciek. Claude Opus 5.5 jest już dostępny na OrcaRouter w cenie katalogowej Anthropic — 4,00 USD za wejście i 20,00 USD za wyjście za milion tokenów, odczyt z pamięci podręcznej po 0,20 USD za milion, przekazywane dalej bez żadnego narzutu — więc konkretny model, z którym porównuje się Carbon, to ten, który możesz wywołać już dziś, na tym samym kluczu API co wszystko inne. To fakt znacznie bardziej użyteczny niż przeciek, bo to właśnie ta połowa porównania, którą da się przetestować.

Postawa, która przetrwa plotkę, to ta, która nie potrzebuje, by plotka była prawdziwa. Postaw Claude Opus 5.5 za najtrudniejszymi obciążeniami programistycznymi i utrzymuj regułę przełączania awaryjnego do tańszej warstwy dla ruchu, który go nie potrzebuje; w dniu, w którym prawdziwy identyfikator Gemini 4 pojawi się w katalogu dostawcy, nasze ceny katalogowe aktualizują się tego samego dnia, w którym Google je ustala, ponieważ nie ma etapu renegocjacji między opublikowaniem ceny przez dostawcę a jej przekazaniem przez nas. Jedno API dla 200+ modeli zamienia „czy powinniśmy migrować?” w edycję routing-DSL i test A/B na rzeczywistym ruchu, a nie przepisanie od nowa. Prowadź routing na podstawie wyników, które możesz zmierzyć, a nie nazw, o których czytasz.

A screenshot of Google's own Gemini API models documentation page, listing the Gemini 3.8 family and earlier models with their model codes and pricing, and containing no entry for Gemini 4 Argon or Gemini 4 Carbon.A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the model id, its capability chips, a 1M-token context window, a 128K maximum output, and pricing of .00 per 1M input tokens and 0.00 per 1M output tokens with cache reads at /bin/bash.20 per 1M.

Co oglądamy

• Czy Google w ogóle cokolwiek powie. Komentarz, zmiana na stronie albo wzmianka podczas premiery przeniosłyby to wszystko od razu z kolumny przecieków. Milczenie pozostawia to tam, gdzie jest.

• Drugi etap wdrożenia Argon. Ogłoszenie opisywało płacących klientów API i subskrybentów Ultra jako kolejną kohortę po zweryfikowanych obrońcach, a pojawienie się identyfikatora Gemini 4 to wydarzenie, które zamienia „ogłoszone” na „możliwe do wywołania”. Jeśli pojawi się uruchamialny endpoint, pytanie, czy jego checkpoint to Barium-B, czy coś nowszego, staje się konkretne.

• Jakikolwiek niezależny pomiar Carbonu. Gdy taki checkpoint pojawi się na neutralnym leaderboardzie, a nie w wrażeniu pracowników, zdanie o Opus 5.5 przestaje być odczuciem, a staje się punktem danych — albo przestaje być prawdziwe.

• Cennik. To, na jakim poziomie Google wycenia czołowy checkpoint, który preferują jego własni inżynierowie, jest wskazówką, czy Carbon to aktualizacja Argonu, czy odrębny poziom.

• Czy układ nazw kodowych przetrwa zetknięcie z premierą. Barium-B za Argonem i Carbon obok niego to dziś spójna historia; posty premierowe mają zwyczaj spłaszczania spójnych historii do jednego modelu z jednym ID.

Podsumowanie, które nie sprzedaje tego na wyrost, jest krótkie. Pracownicy Google podobno testują wewnętrzny checkpoint Gemini 4 o nazwie Carbon; ich wczesne wrażenie jest takie, że koduje jak Claude Opus 5.5. Checkpoint stojący za publicznym wydaniem Gemini 4 Argon jest inny i nazywa się Barium-B, a to, czy Carbon kiedykolwiek stanie się produktem — aktualizacją, osobnym modelem albo niczym — nie zostało potwierdzone. Połowa tego zdania, na której możesz działać, to ta, która wymienia Claude Opus 5.5, ponieważ jest to jedyny model w akapicie z identyfikatorem modelu, ceną i endpointem. Wywołuj dalej to, co możesz wywołać, i trzymaj gotową regułę failover na dzień, w którym druga nazwa stanie się takim modelem.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie