Eine Titelkarte mit der Aufschrift „Claude Opus 5.5 führt den Coding Agent Index mit 66 an“, dem Untertitel „Günstigere Tokens, eine höhere Rechnung pro Aufgabe“ und drei abgerundeten Karten darunter: Coding Agent Index 66, Kosten pro Aufgabe 13,04 $, +21 %, und Claude Opus 5: 60 bei 10,79 $.
Guides & Insights

Claude Opus 5.5 führt den Coding Agent Index mit 66 an — und die Task Bill steigt um 21 %

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Anbieter senkte Claude Opus 5.5s Tokenpreise am 22. September 2026 um 20 %. Zwei Tage später veröffentlichte Artificial Analysis die Coding-Agent-Messung, die zeigt, was die Senkung für die Rechnung eines Agenten bedeutete: Die Kosten pro Aufgabe stiegen um 21 % auf 13,04 $, von den 10,79 $, die derselbe Index für Claude Opus 5 ansetzt. Auch die Punktzahl stieg — 66 im Coding Agent Index, den Artificial Analysis als den höchsten beschreibt, den er gemessen hat, sechs Punkte vor Claude Opus 5 und vier vor Claude Fable 5.1 in derselben Konfiguration. Beides ist gleichzeitig wahr, und der Grund dafür ist die ganze Geschichte dieses Rankings. Ein günstigeres Token, von dem ein Modell mehr verbraucht, ist keine günstigere Aufgabe, und bei maximalem Reasoning-Aufwand bei langen Agentenläufen verbraucht Claude Opus 5.5 deutlich mehr davon.

Was der Coding Agent Index tatsächlich bewertet

Dies ist keine Modell-Bestenliste. Jede Zeile darin ist ein Harness-und-Modell-Paar — ein Checkpoint, der in einem bestimmten Coding-Agenten mit einer bestimmten Effort-Einstellung läuft. Die Zeile, die alle zitieren, ist Claude Opus 5.5 bei max Effort in Claude Code, also dem Harness, gegen den Anthropic entwickelt und optimiert. Die 60 von Claude Opus 5 und die 62 von Claude Fable 5.1 stammen aus demselben Harness und derselben Effort-Einstellung, was sie zu den ehrlichen Vergleichen macht; eine Zeile für eines der beiden Modelle in einem anderen Coding-Agenten ist eine andere Messung und wird hier nicht so abgedruckt, als wäre sie dieselbe.

Der Index ist versioniert, und die Version ist wichtiger als der Markenname darauf. Das derzeit als v1.5 veröffentlichte Board bildet den Durchschnitt aus drei Evaluierungen, jede gleich gewichtet, jede angegeben als pass@1, gemittelt über drei Versuche pro Aufgabe:

Terminal-Bench 4.0 — agentische Shell- und Kommandozeilenarbeit: Navigieren in einem Dateisystem, korrekte Verwendung von Tools, Erholung von einem zwischenzeitlichen Fehler und Abschluss eines mehrstufigen Workflows.

DeepSWE v1.1 — Software-Engineering-Aufgaben, die Repository-Bearbeitungsarbeit.

SWE-Atlas-QnA — Fragen zum Verständnis von Repositories, bei denen die Antwort durch das Lesen einer Codebasis gefunden wird und nicht durch deren Änderung.

Drei Bewertungen, eine Zahl und eine daneben abgedruckte Spalte mit den Kosten pro Aufgabe. Diese Kostenspalte ist der Grund, warum dieser Index nützlicher ist als eine Punktzahl allein, und sie ist auch der Grund, warum die Zahl in der Überschrift schwieriger zu lesen ist, als es den Anschein hat.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

Die drei Komponenten und woher die sechs Punkte stammen

Artificial Analysis veröffentlichte die Komponentenzeilen zusammen mit dem Composite, und sie bewegen sich nicht gleichmäßig:

Terminal-Bench 4.063,1 % für Claude Opus 5.5 gegenüber 54,5 % für Claude Opus 5, ein Zuwachs von 8,6 Punkten. Dies ist die größte einzelne Verbesserung im Set.

DeepSWE v1.168.4% gegenüber 62.5%, ein Plus von 5.9 Punkten.

SWE-Atlas-QnA66,4 % gegenüber 62,1 %, ein Plus von 4,3 Punkten.

Bildet man den Durchschnitt dieser drei, erhält man 66,0 – das ist der zusammengesetzte Wert. Interessant ist die Form des Zugewinns: Am wenigsten verbesserte sich das Modell beim Lesen einer Codebasis, am meisten beim Bedienen einer Shell. Terminal-Bench ist die Evaluierung, die dem, was Leute tatsächlich mit „Coding-Agent“ meinen, am nächsten kommt – eine lang laufende Schleife, in der das Modell Befehle auswählt, die Ausgabe liest und entscheidet, was als Nächstes zu tun ist, ohne dass ein Mensch zwischen den Schritten eingreift. Ein Sprung um 8,6 Punkte ist dort eine Aussage über anhaltende Werkzeugnutzung, nicht über Codegenerierung.

Beachten Sie, was das darüber aussagt, wo die Verbesserung zu erwarten ist. Wenn Ihre Arbeitslast „dieses Repository erklären“ lautet, ist Claude Opus 5.5 ein bescheidenes Upgrade gegenüber Claude Opus 5 – vier Punkte. Wenn Ihre Arbeitslast „laufen lassen, bis die Testsuite erfolgreich ist, und beheben, was kaputtgeht“ lautet, ist es der größte Sprung in der Tabelle.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

Die Zahl, die neben dem Ranking angezeigt wird: 13,04 $ pro Aufgabe

Hier ist die Rechnung, die die Preissenkung anders aussehen lässt als angekündigt. Der Listenpreis von Anthropic für Claude Opus 5.5 beträgt 4,00 $ pro Million Input-Tokens und 20,00 $ pro Million Output, gegenüber 5,00 $ und 25,00 $ für Claude Opus 5, mit einem Rückgang der Cache-Lesevorgänge um 60 % auf 0,20 $ pro Million. Jeder dieser Posten ist günstiger. Die Schätzung von Artificial Analysis, was eine Aufgabe bei maximalem Aufwand kostet, ist trotzdem höher:

Kosten pro Aufgabe — 13,04 $ für Claude Opus 5.5 gegenüber 10,79 $ für Claude Opus 5, ein Anstieg um 21 % beim selben Index, demselben Harness, derselben Effort-Einstellung.

Tokens pro Aufgabe insgesamt — ungefähr 15,6 Mio. gegenüber 11,4 Mio., ein Anstieg um etwa 37 %.

Ausgabe-Tokens pro Aufgabe — etwa 333.000 gegenüber 137.000, mehr als das Doppelte. Die Ausgabe ist die teure Richtung, und sie ist die Zeile, die sich am stärksten bewegt hat.

Zwischengespeicherte Eingabe pro Aufgabe — ungefähr 14,6 Mio. gegenüber 10,9 Mio., ein Plus von etwa 34 %. Die 60-prozentige Reduzierung der Cache-Lesevorgänge macht sich hier deutlich bemerkbar; sie reicht aber einfach nicht aus, um eine Aufgabe auszugleichen, die ein Drittel mehr Kontext liest.

Rechnet man mit den veröffentlichten Preisen, ergibt sich das Bild. Betrachtet man nur die Output-Tokens: 333.000 Tokens zu 20,00 $ pro Million sind etwa 6,66 $ – ungefähr die Hälfte der gesamten Schätzung von 13,04 $, und das aus einem einzigen Posten, der sich verdoppelt hat. Die Cache-Read-Zeile ist vom Volumen her enorm und preislich nahezu kostenlos: 14,6 Mio. Tokens zu 0,20 $ pro Million sind unter 3 $. Die 20-%-Senkung ist real und die Cache-Senkung ist real; bei maximalem Aufwand in einer Agent-Loop werden sie schlicht von einem Modell überwogen, das länger denkt und mehr schreibt.

Das hat direkte Folgen für Ihre Budgetplanung. Wenn Ihr Team 500 Coding-Agent-Aufgaben pro Tag mit maximalem Aufwand ausführt, liegt der Unterschied zwischen 10,79 $ und 13,04 $ bei etwa 1.125 $ pro Tag – rund 34.000 $ im Monat – für dieselbe Anzahl an Aufgaben. Das ist die Zahl, die Sie der Person vorlegen sollten, die die Modelländerung genehmigt, und es ist nicht die Zahl, die die Preissenkung impliziert.

Warum $5.98 und $13.04 beide wahr sind

Artificial Analysis veröffentlichte vor wenigen Tagen eine andere Kosten-pro-Aufgabe-Kennzahl für dasselbe Modell, und wenn man die beiden ohne die Beschriftungen zusammen liest, erscheinen sie wie ein Widerspruch. Sie sind es nicht – es handelt sich um zwei unterschiedliche Bewertungen, und der Unterschied ist lehrreich.

Im Intelligence Index, setzte der Bericht vom 22. September die Kosten pro Aufgabe für Claude Opus 5.5 auf 5,98 $, etwa auf dem Niveau von Claude Opus 5 mit 5,86 $, trotz etwa 119.000 Ausgabe-Tokens pro Aufgabe gegenüber 73.000 bei Opus 5. Dort heben sich die Preissenkung und die zusätzlichen Tokens fast genau auf. Im Coding Agent Index kostet dasselbe Modell bei maximalem Aufwand in Claude Code 13,04 $ gegenüber 10,79 $.

Beides sind ehrliche Messungen unterschiedlicher Workloads. Ein Frage-Antwort-Eval ist ein kurzer Austausch; eine Agenten-Aufgabe ist eine lange Schleife von Tool-Aufrufen mit einem wachsenden Kontext, und das Wachstum summiert sich in Richtung Output, wo der Preis am höchsten ist. Die praktische Lehre ist, dass „gleicht die Preissenkung die zusätzlichen Tokens aus?“ keine einzelne Antwort hat — sie hängt von der Aufgabenlänge ab, und je länger und agentischer die Aufgabe, desto schlechter fällt der Ausgleich aus. Wenn Sie anhand eines Kurzantwort-Benchmarks kalkulieren, werden Sie die Rechnung eines Agenten unterschätzen.

Drei Einschränkungen, die in die Zeile gehören

Die 66 ist eine Claude-Code-Zahl, nicht die Zahl eines reinen Modells. Der Index kombiniert Modelle bewusst mit Harnesses – mit der Begründung, dass Tool-Routing, Retry-Logik und Kontextverwaltung von der gemessenen Leistung eines Agenten nicht zu trennen sind. Das fällt hier zugunsten von Anthropic aus, denn der Harness, in dem es bewertet wird, ist sein eigener. Artificial Analysis kündigt eine Harness-Vergleichsansicht als „bald verfügbar" an; solange es sie nicht gibt, kann niemand sagen, wie viel des Sechs-Punkte-Vorsprungs auf den Checkpoint entfällt und wie viel auf das Gerüst drumherum.

Anthropics eigener Terminal-Bench-4.0-Wert liegt höher als der Wert dieser Komponente und wurde von Anthropic durchgeführt. Das Launch-Material nennt 66,4 % bei xhigh Aufwand; die Komponente des Coding Agent Index liegt bei 63,1 % bei max, und ein separater, unabhängiger Lauf von Artificial Analysis maß 59,6 % in seinem eigenen Harness auf derselben Benchmark-Version. Drei Zahlen, drei Konfigurationen, drei Anbieter. Die 63,1 % in der Zeile darüber sind die eigene Komponente des Index und sollten nur mit den anderen Zahlen auf diesem Index verglichen werden; die 66,4 % des Anbieters sind vom Anbieter angegeben, von keiner dritten Seite reproduziert und gehören zu einer anderen Aufwandsstufe.

Die Index-Revision verändert sich. Dieser Blog berichtete Anfang September über andere Zeilen des Coding Agent Index, und zwar auf einer früheren Version desselben Boards, und diese älteren Zahlen sind nicht mit v1.5 vergleichbar – das Evaluationsset selbst änderte sich, als Terminal-Bench 4.0 die frühere Version ersetzte. Mirrors von Drittanbietern führen weiterhin veraltete Snapshots mit älteren Versionsbezeichnungen. Wenn eine Zahl für Claude Opus 5.5 in diesem Index nicht aus der aktuellen v1.5-Zeile stammt, stellen Sie sie nicht neben eine v1.5-Zahl, und berechnen Sie kein Delta über die beiden.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

Was tatsächlich bereitgestellt werden sollte

Das Ranking ist eine Max-Effort-Zahl, und Max-Effort ist die Einstellung, die fast niemand standardmäßig ausliefern sollte. Claude Opus 5.5 hat fünf Effort-Stufen – niedrig, mittel, hoch, xhigh und max – und das Modell verwendet standardmäßig mittel. Artificial Analysis hat keine Coding-Agent-Index-Zeilen für die niedrigeren Einstellungen veröffentlicht, daher sind die Kosteneinsparungen dort in diesem Index nicht beziffert; im Intelligence Index erreichte dasselbe Modell auf mittel 51 – identisch mit dem Max-Wert von Claude Opus 5 – bei $1.34 pro Aufgabe. In diese Richtung gehen die Einsparungen, und es ist eine Einstellung, kein anderes Modell.

Das realistische Muster ist eine Aufteilung: maximalen Aufwand für die langen autonomen Schleifen beibehalten, bei denen der Zugewinn von 8,6 Punkten bei Terminal-Bench das ist, was man damit kauft, und die Routinearbeit mit geringerem Aufwand laufen lassen, wo das Modell noch deutlich besser abschneidet als Claude Opus 5 am Ende. Weil der Aufwand ein Anfrageparameter und kein Deployment ist, ist diese Aufteilung eine Routing-Regel, und beide Modelle liegen im selben Katalog — Listenpreise von Anthropic mit 0 % Aufschlag weitergegeben, sodass eine Preissenkung des Anbieters bei anthropic/claude-opus-5.5 noch am Tag ihrer Ankündigung live ist und für einen A/B-Vergleich der beiden gegen die eigenen Aufgaben weder ein zweiter Vertrag noch eine Codeänderung nötig sind. Speziell beim Maximalaufwand-Pfad, wo eine einzelne Aufgabe ein langer unbeaufsichtigter Lauf sein kann, sorgt automatisches Failover dafür, dass ein hängender Anbieter nicht die ganze Schleife kostet.

Was ist noch ungemessen?

Drei Dinge würden dieses Bild verändern, und keines davon existiert bisher. Es gibt keinen Vergleich von Claude Opus 5.5 mit einem konkurrierenden Checkpoint bei übereinstimmendem Aufwand und übereinstimmendem Harness — jeder verfügbare herstellerübergreifende Vergleich besteht aus zwei nebeneinander angeordneten Herstellertabellen. Es gibt keinen veröffentlichten Lauf des Coding Agent Index bei mittlerem oder hohem Aufwand, wo der Großteil des Produktionsverkehrs anzusiedeln wäre. Und die Frage der Harness-Zuordnung — wie viel einer 66 das Modell ausmacht und wie viel Claude Code — wurde vom Index anerkannt und zurückgestellt.

Worauf Sie heute reagieren können, ist enger gefasst und nützlicher als ein Ranking. Claude Opus 5.5 ist bei anhaltender, Shell-gesteuerter Agentenarbeit wirklich besser als Claude Opus 5 – das ist die eine Komponente mit einem großen, konsistenten, unabhängig ermittelten Zuwachs. Außerdem kostet es pro Aufgabe in der Einstellung, in der dieser Zuwachs gemessen wurde, etwa 2,25 US-Dollar mehr pro Aufgabe, und die Preissenkung pro Token reicht nicht an diese Zahl heran. Setzen Sie es mit maximalem Aufwand dort ein, wo die Schleife lang und die Fehlerkosten hoch sind; behalten Sie die günstigere Einstellung überall sonst bei; und prüfen Sie den Index erneut, sobald die Zeilen mit geringerem Aufwand erscheinen, denn das ist die Konfiguration, für die die meisten Teams tatsächlich bezahlen werden. Wenn Sie allein wegen der Preissenkung wechseln, kaufen Sie das Falsche – das Modell ist pro Token günstiger und pro Aufgabe teurer, und nur eine dieser beiden Zahlen taucht in Ihrer Rechnung auf.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert