
Claude Sonnet 5.5 vs. Gemini 3.1 Pro: Pro Token günstiger, pro Aufgabe elfmal teurer
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Auf der Preisliste ist Claude Sonnet 5.5 das günstigere Modell, und der Abstand bei der Leistungsfähigkeit ist nicht knapp. Es erreichte die allgemeine Verfügbarkeit am 28. September 2026 zu 2,00 $ pro Million Input-Tokens und 10,00 $ pro Million Output-Tokens; Gemini 3.1 Pro, angekündigt am 19. Februar 2026 und noch über einen Vorschau-Endpunkt bereitgestellt, kostet 2,00 $ und 12,00 $. Sonnet 5.5 erreicht außerdem 56 Punkte im Intelligence Index v4.3 von Artificial Analysis gegenüber den 30 von Gemini 3.1 Pro Preview – eine Lücke von 26 Punkten in einer einzigen Testumgebung. Der 1.048.576-Token-Kontext von Gemini ist die einzige Kennzahl, die es eindeutig gewinnt. Doch derselbe Evaluator berichtet, dass die Fertigstellung einer offenen Aufgabe 0,67 $ beim Google-Modell und 7,60 $ beim Anthropic-Modell kostet, was einen Faktor von elf in die entgegengesetzte Richtung darstellt. Beide Zahlen sind korrekt, und der Grund für ihr Nebeneinander – eine Obergrenze von 65.536 Output-Tokens auf der einen Seite und ein Geschwätzigkeitsproblem auf der anderen – macht den gesamten Vergleich aus.
Was jeder Endpunkt tatsächlich ist
Kläre erst die Identitäten, dann rechne. Der Gegenstand hier ist anthropic/claude-sonnet-5.5, veröffentlicht am 28. September 2026, Text-, Bild- und Dateieingabe, 1.000.000-Token-Kontext, maximale Ausgabe von 128.000 Token, adaptives Denken mit einem Effort-Parameter, der auf der Claude Platform standardmäßig auf high eingestellt ist. Der Gegner ist google/gemini-3.1-pro-preview, veröffentlicht am 19. Februar 2026, Text-, Bild-, Video-, Audio- und Dateieingabe, 1.048.576-Token-Kontext, maximale Ausgabe von 65.536 Token. Einer dieser beiden Namen trägt ein Wort, das der andere nicht hat, und es ist keine Verzierung.
Das Vorschau-Suffix wurde vor sieben Monaten angehängt. Google hat in diesem Zeitraum mehrere Flash-Releases veröffentlicht und keinen Nachfolger für die Pro-Stufe; das Modell, das 3.1 Pro ersetzt hat, ist als abgeschaltet aufgeführt. Nichts davon ist ein Mangel des Modells – es war die ganze Zeit live, stabil und korrekt bepreist –, aber es bedeutet, dass der Endpunkt, gegen den Sie integrieren, nicht durch eine Lifecycle-Zusage für allgemeine Verfügbarkeit abgedeckt ist, und diese Familie hat bereits ein Pro-Modell abgekündigt. Behandeln Sie das als festen Posten und nicht als Fußnote, denn es verändert, was eine mehrjährige Architekturentscheidung kostet, wenn Sie es falsch machen.
Zwei Zahlen, die in entgegengesetzte Richtungen zeigen.
Zuerst der Vergleich pro Token, denn er ist derjenige, den alle durchführen, und er begünstigt das neuere Modell.
• Input — 2,00 $ pro Million bei beiden; ein exakter Gleichstand beim Listenpreis
• Ausgabe — 10,00 $ für Claude Sonnet 5.5 gegenüber 12,00 $ für Gemini 3.1 Pro; das Anthropic-Modell ist 17 % günstiger
• Cache-Lesevorgang — 0,20 $ pro Million für beide unterhalb der Tarifgrenze
• Cache-Schreibvorgang — 2,50 $ pro Million für das Fünf-Minuten-Fenster bei Claude Sonnet 5.5 gegenüber 0,375 $ für Gemini 3.1 Pro; Google ist rund siebenmal günstiger beim Schreiben eines Cache-Eintrags
• Kontext — 1.000.000 gegenüber 1.048.576; ein Unterschied ohne praktische Konsequenz
• Maximale Ausgabe — 128.000 Tokens gegenüber 65.536; das Anthropic-Modell hat fast die doppelte Obergrenze
• Eingabemodalität – Text, Bild und Datei gegenüber Text, Bild, Video, Audio und Datei
Dann der Vergleich pro Aufgabe, vom selben Evaluator, in derselben Woche, in einer Konfiguration mit maximalem Aufwand auf beiden Seiten: 7,60 $ für Claude Sonnet 5.5 gegenüber 0,67 $ für Gemini 3.1 Pro. Elfmal. Der Mechanismus ist auf derselben Seite dokumentiert, nicht bloß erschlossen – Sonnet 5.5 generierte 410 Millionen Token über die Index-Suite hinweg gegenüber einem Median von 88 Millionen für das Feld, was der Evaluator als sehr wortreich beschreibt, während Gemini 3.1 Pro als recht prägnant beschrieben wird. Wenn ein Modell ein Mehrfaches dessen schreibt, was das andere schreibt, übersteht ein Vorteil von 17 % bei der Ausgaberate den Kontakt mit der Rechnung nicht.
Die Lehre geht über diese beiden Modelle hinaus: Eine Preisliste bepreist ein Token, und abgerechnet wird für fertiggestellte Arbeit. Jeder Vergleich, der bei der Preisliste stehen bleibt, misst die falsche Größe.
Die Tarifgrenze bei 200.000 Tokens
Die Preisgestaltung von Gemini 3.1 Pro ist nicht einheitlich, und der Sprung ist groß genug, um Teile des obigen Vergleichs umzukehren. Unterhalb eines Prompts von 200.000 Tokens liegen die Tarife bei $2,00 für die Eingabe und $12,00 für die Ausgabe mit einem Cache-Lesevorgang für $0,20. Oberhalb dieser Grenze wird der gesamte Aufruf neu bepreist: $4,00 Eingabe, $18,00 Ausgabe und $0,40 Cache-Lesevorgang – der Eingabetarif verdoppelt sich auf genau das Doppelte von Claude Sonnet 5.5, und die Ausgabe wechselt von 17 % günstiger auf der Anthropic-Seite zu 80 % teurer auf der Google-Seite.
Die Grenze ist nicht exotisch. Ein Prompt mit 200.000 Tokens ist eine kleine Codebasis, ein langer Vertragssatz, ein paar Stunden Transkript oder ein Agent, der schon eine Weile arbeitet. Long-Context-Arbeit ist genau das, wofür ein Fenster mit 1 Mio. Tokens verkauft wird, also ist die Stufe, die das Fenster am meisten belohnt, zugleich die Stufe, auf der der Preisvorteil verschwindet. Wenn Ihre Prompts regelmäßig 200.000 Tokens überschreiten, sollten Sie Gemini 3.1 Pro mit 4,00 $ und 18,00 $ bewerten, nicht mit den Tarifen auf der Landingpage.
Cache-Schreibvorgänge verdienen einen eigenen Satz, weil sie sich in die andere Richtung umkehren und den Stufenwechsel überstehen. Bei 0,375 $ pro Million gegenüber 2,50 $ ist Gemini weitaus günstiger, um einen Cache zu befüllen, und dieser Satz ändert sich nicht, wenn man die Grenze überschreitet. Für einen Agenten, der bei jedem Durchlauf ein großes Präfix neu aufbaut, statt es wiederzuverwenden, kann diese eine Zeile ein größerer struktureller Vorteil sein als der Input-Tarif — und sie ist die einzige Zeile in diesem Vergleich, die keine Stufengrenze berührt.
Die Obergrenze von 65.536 Token und warum sie die Architektur entscheidet
Die Zahl, die am stärksten verändert, was man bauen kann, ist die maximale Ausgabe: 65.536 Tokens bei Gemini 3.1 Pro gegenüber 128.000 bei Claude Sonnet 5.5. Eine Obergrenze ist keine Leistungskennzahl; sie ist eine Einschränkung dahingehend, ob eine Aufgabe in einen einzigen Aufruf passt.
Alles, was ein großes Artefakt ausgibt — eine vollständige Quelldatei, einen langen Bericht, ein ganzes Dokument, einen strukturierten Datensatz —, muss im Fall von Gemini oberhalb von 65.536 Token in eine Kette von Aufrufen zerlegt werden, zwischen denen Zustand übergeben wird. Die Zerlegung kostet bei jedem Schritt mehr Eingabe-Token, mehr Orchestrierungscode und bringt einen neuen Fehlermodus an den Nahtstellen mit sich, an denen ein Block endet und der nächste beginnt. Eine zweite Einschränkung verschärft dies: Anthropics eigene Unterlagen setzen die praktische Schwelle für zuverlässige lange Arbeit bei Sonnet 5.5 deutlich höher an, und Geminis Obergrenze ist die engere der beiden, und zwar um den Faktor zwei. Wenn Ihr längstes Artefakt 40.000 Token umfasst, ist dieser Abschnitt irrelevant, und Sie sollten anhand der Kosten pro Aufgabe vergleichen. Wenn es 100.000 sind, hat die Obergrenze die Entscheidung bereits für Sie getroffen.
Modalität, die eine Achse, die Gemini uneingeschränkt beherrscht
Gemini 3.1 Pro akzeptiert Video und Audio; Claude Sonnet 5.5 akzeptiert Text, Bilder und Dateien und kann keines von beiden verarbeiten. Für einen Workload, der auf Medien ausgerichtet ist – Anrufaufzeichnungen, Bildschirmaufnahmen, Produktvideos, Meeting-Audio –, gibt es in dieser Paarung keinen Ersatz, und der Preisvergleich ist gegenstandslos, weil nur einer der beiden Endpunkte die Eingabe überhaupt akzeptieren kann. Bei Text-und-Bild-Workloads überschneiden sich die Funktionsumfänge, und es gilt die obige Preisrechnung.
Geminis andere operative Kennzahl ist es wert, genannt zu werden, denn auf einer Seite, die mit Intelligenz wirbt, ist sie leicht zu übersehen: Unser Katalog misst eine mediane First-Token-Latenz von 10.000 ms bei p50 und eine Ausgaberate von nahezu 1.283 Tokens pro Sekunde, bei einer Sieben-Tage-Fehlerrate von 56,8 %. Das ist ein extrem schnelles Modell mit einer sehr hohen beobachteten Ausfallrate – eine Kombination, die sich für Batch-Arbeit mit großzügigen Wiederholungsbudgets weit besser eignet als für alles, worauf ein Nutzer wartet. Claude Sonnet 5.5 ist im Vergleich das langsamere, gleichmäßigere Profil. Die Fehlerrate erscheint auf keiner der Landingpages der beiden Anbieter; sie ist die Art von Kennzahl, die nur auftaucht, wenn die Kandidaten hinter einem einzigen Endpunkt stehen, der sie misst – ein Grund, beide von einer Stelle aus zu bewerten statt über zwei Dashboards.
Was wohin leiten
Senden Sie es an Claude Sonnet 5.5, wenn die Arbeit Text oder Bild ist, wenn die Qualitätshürde hoch genug ist, dass eine 26-Punkte-Indexlücke relevant ist, wenn Ausgabeartefakte lang genug sind, um die 128.000-Token-Obergrenze zu benötigen, oder wenn die Arbeitslast interaktiv ist und eine Fehlerquote von 56,8 % nicht akzeptabel ist. Bei strukturierten, begrenzten Aufgaben verflüchtigt sich die Weitschweifigkeitsstrafe, die den Betrag von 7,60 $ ergibt, weitgehend, und der Vorteil pro Token wird zu echtem Geld.
Sende es an Gemini 3.1 Pro, wenn die Eingabe Video oder Audio enthält, wenn Prompts unter 200.000 Tokens bleiben und das Volumen hoch ist, wenn du häufig große Caches schreibst und sich die Cache-Schreibkosten von 0,375 $ summieren, oder wenn die Aufgabe batchförmig ist und die Kosten pro Aufgabe die einzige Spalte sind, die zählt — bei 0,67 $ pro Aufgabe gegenüber 7,60 $ kannst du dir jede Menge Wiederholungen leisten.
Beide sind heute auf OrcaRouter routbar. google/gemini-3.1-pro-preview und anthropic/claude-sonnet-5 sind beide Live-Katalogeinträge über einen einzigen Zugangsschlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, was bedeutet, dass die oben beschriebene Aufteilung sich als Routing-Regel statt als zwei Integrationen ausdrücken lässt — die medienbezogenen Anfragen an den einen Endpunkt, die Text-und-Bild-Anfragen an den anderen, mit Failover, falls einer von beiden anfängt, Fehler zurückzugeben. Claude Sonnet 5.5 ist noch keine Route auf unserer Plattform; sobald sie gelistet ist, deckt dieselbe Regel sie ab, ohne einen neuen Schlüssel.
Das ehrliche Urteil für dieses Duell: Claude Sonnet 5.5 ist das bessere Modell mit großem Abstand und das günstigere pro Token, und Gemini 3.1 Pro ist bei offenen Aufgaben ungefähr elfmal günstiger pro erledigter Aufgabe, sechsmal günstiger beim Schreiben eines Caches und das einzige der beiden, das ein Video ansehen kann. Wer Ihnen die Preisliste vorhält, beschreibt einen Vergleich, den es nicht gibt; der, den es gibt, dreht sich darum, welche Anfragen Sie eingrenzen können.



In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
