
Gemini 4 Carbon Leak: Googles interner Checkpoint, der laut Mitarbeitern wie Claude Opus 5.5 codet.
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 84 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Es gibt eine Version dieser Geschichte, die Nachricht ist, und eine Version, die Lärm ist, und der Unterschied liegt ganz darin, woran die Namen hängen. Am 9. und 10. Oktober 2026 berichtete Business Insider – und das Leak-Verfolgungsportal TestingCatalog gab weiter –, dass Mitarbeiter des Suchriesen intern einen zusätzlichen Checkpoint von Gemini 4 mit dem Namen Carbon testen, und dass frühes internes Feedback Carbon beim Programmieren als vergleichbar mit Claude Opus 5.5 einstuft, und dass Barium-B der Checkpoint ist, der für die öffentliche Veröffentlichung von Gemini 4 Argon ausgewählt wurde, und dass Carbon, getestet über die interne Plattform Jetski des Unternehmens, eine separate und möglicherweise stärkere Iteration ist. Was das eher lesenswert als überfliegenswert macht, ist der letzte Teilsatz: ob Carbon als Update für Gemini 4 Argon oder als eigenständige Veröffentlichung ausgeliefert wird, ist nach den eigenen Worten des Berichts unbestätigt. Und das ist der gesamte Stand der Beweise – keine Ankündigung, keine Modellkennung, kein Endpunkt, kein Preis, keine Modellkarte und kein Kommentar des Anbieters. Alles Konkrete auf dieser Seite ist ein Leak, eine aus einem Leak gezogene Schlussfolgerung oder eine Tatsache über ein anderes, auslieferbares Modell, an dem das Leak gemessen wird.
Was der Bericht tatsächlich behauptet
Das Signal ist schwach, und es ist spezifisch genug, um falsifizierbar zu sein, was der einzige Grund dafür ist, dass es auf eine Seite wie diese gehört. Ohne Rahmung lauten die Behauptungen wie folgt:
• Google-Mitarbeiter testen intern einen Gemini-4-Checkpoint namens Carbon. Es ist kein öffentliches Modell und kann nicht über eine API aufgerufen werden.
• Frühes internes Feedback stellt Carbon beim Programmieren Berichten zufolge als gefühlt vergleichbar mit Claude Opus 5.5 dar – ein Eindruck aus Tests von Mitarbeitenden, kein Benchmark-Ergebnis und keine Zahl, die jemand außerhalb von Google reproduzieren kann.
• Der Checkpoint hinter dem Modell, von dem die Öffentlichkeit tatsächlich gehört hat — Gemini 4 Argon —, heißt Barium-B, und Carbon wird als eine separate und potenziell leistungsfähigere Iteration beschrieben und nicht als derselbe Build unter zwei Bezeichnungen.
• Berichten zufolge wird Carbon über Jetski eingesetzt, was derselbe Bericht als Googles internen Namen beschreibt, der mit Antigravity, seiner agentischen Programmierumgebung, verbunden ist.
• Ob aus Carbon ein künftiges Update von Gemini 4 Argon oder ein eigenständiges Release von Gemini 4 wird, ist unbekannt. Google hat sich dazu nicht geäußert.
Das ist der Leak. Er enthält einen Vergleich, eine Codename-Beziehung und eine wirklich offene Frage, und kein Teil davon ist eine Veröffentlichung.

Die Codenamen-Leiter – und welche Sprosse zählt
Der Grund, warum dieser Bericht einen Decoder-Ring braucht, ist, dass Googles Periodensystem-Angewohnheit drei Namen in einen Absatz steckt, die parallel wirken und es nicht sind. Sortiert danach, was ein Leser tatsächlich mit jedem davon anfangen kann:
• Gemini 4 Argon — angekündigt. Ein echter Modellname mit einem offiziellen Ankündigungsbeitrag und einer Familienseite, einem veröffentlichten Einführungspreis von 2 US-Dollar pro Million Input-Tokens und 10 US-Dollar pro Million Output-Tokens, einem veröffentlichten Ausgabelimit von 1 Million Tokens und einem zugangsbeschränkten Rollout, der mit überprüften Cyber-Verteidigern begann und von dem es hieß, er werde als Nächstes auf zahlende API-Kunden ausgeweitet. Es hat noch immer keine Modellkennung, die man in eine Anfrage einsetzen kann, was die Grenze zwischen einem angekündigten und einem aufrufbaren Modell darstellt.
• Barium-B — ein Checkpoint-Name, kein Produkt. Derselben Berichterstattung zufolge ist es der Build, der für das öffentliche Argon-Release ausgewählt wurde. Das ist das Nützliche an der Bezeichnung: Sie sagt dir, dass der Name Argon eine Auslieferungsentscheidung ist, die um einen internen Build herumgelegt wurde, statt selbst ein Build zu sein.
• Carbon — ein interner Kontrollpunkt mit angehängten Mitarbeitereindrücken und sonst nichts. Keine ID, kein Preis, kein Zeitfenster, kein Datum. Es ist ein Gerücht mit einem Codenamen, und Codenamen sind billig.
So gelesen ist die Geschichte nicht „ein neues Gemini ist geleakt“. Es ist vielmehr so, dass Google offenbar mehr als einen Frontier-Checkpoint parallel betreibt, dass derjenige, auf den es seinen öffentlichen Namen gesetzt hat, nicht derjenige ist, für den sich seine Ingenieure am meisten begeistern, und dass niemand außerhalb des Unternehmens weiß, welche dieser beiden Tatsachen sich am Ende als wichtig erweisen wird.
Warum „fühlt sich wie Claude Opus 5.5 an“ der tragende Satz ist
Von allem im Bericht leistet der Vergleich die meiste Arbeit und ist am wenigsten überprüfbar, daher lohnt es sich, präzise zu sein, womit er verglichen wird. Claude Opus 5.5 ist Anthropics Flaggschiff und nach unabhängigen Messungen das weithin aufrufbare Coding-Modell der aktuellen Generation – der Referenzpunkt, zu dem ein Google-Ingenieur greift, wenn er sagen möchte: „Das ist der Gute“, ohne einen Benchmark zu nennen. Zu seinem veröffentlichten Listenpreis kostet es 4,00 US-Dollar pro Million Eingabe-Token und 20,00 US-Dollar pro Million Ausgabe-Token, wobei Cache-Lesevorgänge 0,20 US-Dollar pro Million kosten, und es verfügt über ein Eingabefenster von 1 Mio. Token und eine maximale Ausgabe von 128K-Token.
Dagegen gehalten, sagt der Vergleich zwei Dinge zugleich, und das zweite ist das, was die Leute überspringen. Das erste ist wettbewerblich: Ein interner Google-Checkpoint wird im selben Atemzug wie das Flaggschiff des führenden Rivalen genannt, was ein Kompliment ist, das Google nicht in einen Blogbeitrag schreiben würde. Das zweite betrifft die Positionierung: Der Vergleich ist ein Mitarbeitereindruck zum Coding-Gefühl, und genau das ist die Art von Behauptung, die den Kontakt mit einem Chatfenster übersteht und beim Kontakt mit einer Bestenliste stirbt. Niemand hat einen Benchmark für Carbon veröffentlicht. Es gibt keinen Eintrag bei Artificial Analysis, keine Benchmark-Tabelle eines Anbieters, kein PDF zur Evaluierungsmethodik — die gibt es für Gemini 4 Argon, und für dieses hier gibt es sie nicht. Ein Gefühl ist keine Punktzahl, und diese Seite wird nicht das eine als das andere verkleiden.
Es gibt außerdem eine preisliche Konsequenz, die man benennen sollte, ohne vorzugeben, die Antwort zu kennen. Wenn ein Checkpoint, der sich beim Programmieren wie Claude Opus 5.5 anfühlt, bei Google herumliegt und das Modell, das Google tatsächlich angekündigt hat, im unabhängigen Index fünf Punkte darunter liegt, dann ist die interessante Frage nicht, ob Carbon gut ist – sondern wo Google es preislich ansiedeln würde und ob es jemals zu den Arbeitspferd-Tarifen verkauft würde, zu denen der Rest der Gemini-Reihe veröffentlicht wurde.
Was fehlt, und warum ist die Liste länger als die Nachrichten
Das ehrliche Inventar dessen, was nicht existiert, ist der ganze Artikel, also hier ist er:
• Eine Modellkennung — Carbon hat keine, und Gemini 4 Argon auch nicht. Keiner der beiden Namen erscheint irgendwo, wo eine Anfrage adressiert werden kann.
• Ein Preis — für Carbon wurde auf keiner Stufe etwas veröffentlicht, nicht einmal ein Einführungspreis.
• Eine Modellkarte oder Systemkarte – keine, und keine veröffentlichte Evaluierungsmethodik dahinter.
• Ein Kontextfenster, ein Ausgabelimit oder eine Parameteranzahl — nichts davon veröffentlicht, und Google hat für kein Gemini eine Parameteranzahl veröffentlicht.
• Ein Benchmark-Ergebnis – der Vergleich mit Opus 5.5 ist ein Eindruck von Mitarbeitenden, das heißt: keine Zahl, kein Test und keine Reproduzierbarkeit.
• Ein Datum – keine Ankündigung, kein schrittweiser Rollout, kein Zeitfenster und kein Kommentar von Google dazu, ob überhaupt eine Carbon-Veröffentlichung geplant ist.
• Ein Verhältnis — ob Carbon das nächste Argon-Update oder ein separates Gemini-4-Modell ist. Dies ist die folgenreichste Unbekannte im Bericht, und sie ist im Bericht selbst ausdrücklich unbestätigt.
Alles, was nicht auf dieser Liste steht, ist eine Schlussfolgerung, einschließlich des Großteils dessen, was in den nächsten zwei Wochen darüber geschrieben werden wird.
Was ein Entwickler heute damit machen kann
Die nützliche Antwort lautet, dass sich fast nichts ändert, und es lohnt sich, genau zu sagen, warum. Weder Gemini 4 Argon noch Carbon ist auf OrcaRouter verfügbar – eine Abfrage unseres eigenen Katalogs nach einem von beiden liefert nichts, und das wird auch so bleiben, bis Google eines davon aufrufbar macht. Der Name Gemini 4 ist nichts, wohin man routen kann; er ist ein Name, der an einen zugangsbeschränkten Rollout geknüpft ist. Jedes Konto, das derzeit Zugang zu „Gemini 4 Carbon“ anbietet, verkauft ein Label.
Was real ist, ist das Modell, an dem der Leak gemessen wird. Claude Opus 5.5 ist live auf OrcaRouter zum Listenpreis von Anthropic — 4,00 $ für Eingabe und 20,00 $ für Ausgabe pro Million Token, Cache-Lesevorgänge zu 0,20 $ pro Million, ohne Aufschlag durchgereicht — das konkrete Modell also, mit dem Carbon als vergleichbar beschrieben wird, ist eines, das man heute aufrufen kann, mit demselben API-Schlüssel wie alles andere. Das ist eine nützlichere Tatsache als der Leak, denn es ist die Hälfte des Vergleichs, die getestet werden kann.
Die Haltung, die ein Gerücht übersteht, ist diejenige, die nicht darauf angewiesen ist, dass das Gerücht wahr ist. Setzen Sie Claude Opus 5.5 hinter Ihre anspruchsvollsten Coding-Workloads und behalten Sie eine Failover-Regel auf eine günstigere Stufe für den Traffic bei, der sie nicht braucht; an dem Tag, an dem eine echte Gemini-4-Kennung in einem Anbieterkatalog erscheint, aktualisieren sich unsere Listenpreise am selben Tag, an dem Google sie festlegt, denn es gibt keinen Neuverhandlungsschritt zwischen der Veröffentlichung eines Preises durch einen Anbieter und unserer Weitergabe. Eine API für 200+ Modelle macht aus „Sollten wir migrieren?“ eine Routing-DSL-Anpassung und ein A/B-Testing auf Live-Traffic statt einer Neuimplementierung. Routen Sie auf Ergebnisse, die Sie messen können, nicht auf Namen, über die Sie nur lesen.


Was wir uns ansehen
• Ob Google überhaupt etwas sagt. Ein Kommentar, eine Änderung an einer Familienseite oder eine Zeile in einem Launch-Post würde all das auf einmal aus der Leak-Spalte herausbefördern. Schweigen hält es dort, wo es ist.
• Die zweite Phase des Argon-Rollouts. Die Ankündigung beschrieb zahlende API-Kunden und Ultra-Abonnenten als die nächste Kohorte nach überprüften Verteidigern, und das Erscheinen einer Gemini 4-Kennung ist das Ereignis, das „angekündigt“ in „aufrufbar“ verwandelt. Wenn ein lauffähiger Endpunkt verfügbar wird, wird die Frage, ob sein Checkpoint Barium-B oder etwas Neueres ist, konkret.
• Jede unabhängige Messung von Carbon. In dem Moment, in dem ein Checkpoint wie dieser auf einer neutralen Bestenliste auftaucht statt in einem Mitarbeitereindruck, hört der Satz zu Opus 5.5 auf, bloßes Gefühl zu sein, und wird zum Datenpunkt – oder er hört auf, wahr zu sein.
• Die Preisliste. Wo Google einen Frontier-Checkpoint bepreist, den seine eigenen Ingenieure bevorzugen, verrät sie, ob Carbon ein Argon-Update oder eine eigene Stufe ist.
• Ob die Codename-Beziehung den Kontakt mit einem Launch übersteht. Barium-B hinter Argon und Carbon daneben ist heute eine saubere Story; Launch-Posts haben die Angewohnheit, saubere Storys zu einem Modell mit einer ID zusammenzufassen.
Die Zusammenfassung, die hier nicht zu viel verspricht, ist kurz. Google-Mitarbeiter testen Berichten zufolge einen internen Gemini-4-Checkpoint namens Carbon; ihr erster Eindruck ist, dass er wie Claude Opus 5.5 codet, der Checkpoint hinter dem öffentlichen Gemini-4-Argon-Release ist ein anderer namens Barium-B, und ob Carbon jemals ein Produkt wird — ein Update, ein separates Modell oder gar nichts —, ist unbestätigt. Die Hälfte dieses Satzes, mit der du etwas anfangen kannst, ist die Hälfte, die Claude Opus 5.5 nennt, denn es ist das einzige Modell im Absatz mit einer Modellkennung, einem Preis und einem Endpunkt. Rufe weiterhin das auf, was du aufrufen kannst, und halte eine Failover-Regel bereit für den Tag, an dem der andere Name zu einem solchen wird.
