Eine Hero-Karte mit dem Titel „Claude Haiku 5.5 vs Claude Sonnet 5.5" und der Unterüberschrift „Sechs Tage und eine Stufe Abstand". Zwei abgerundete Karten stehen nebeneinander: links mit der Überschrift „Claude Haiku 5.5" und Zeilen mit Index 43, 0,21 $ pro Aufgabe und Veröffentlicht am 7. Okt. 2026; rechts mit der Überschrift „Claude Sonnet 5.5" und Zeilen mit Index 56, 7,60 $ pro Aufgabe und Veröffentlicht am 28. Sep. 2026. Dazwischen steht mittig ein Badge mit der Aufschrift „36-fache gemessene Kostendifferenz". Eine Fußzeile lautet: „Kosten pro Aufgabe und Intelligence Index laut Artificial Analysis; beide Modelle mit 1M Kontext."
Guides & Insights

Claude Haiku 5.5 vs. Claude Sonnet 5.5: Eine 20-fache Preisliste, eine 36-fache gemessene Rechnung

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Claude Haiku 5.5 und Claude Sonnet 5.5 liegen sechs Tage und eine Stufe auseinander in derselben Familie, teilen sich ein Kontextfenster von einer Million Token und antworten über dieselbe API-Form. Auf der veröffentlichten Preistabelle kostet das günstigere in dem Band, in dem die meisten Anfragen landen, ein Fünftel dessen, was das teurere kostet. Auf dem unabhängigen Board von Artificial Analysis ist die Lücke noch größer als das: 0,21 US-Dollar, um eine Aufgabe des Intelligence Index auf Claude Haiku 5.5 abzuschließen, gegenüber 7,60 US-Dollar auf Claude Sonnet 5.5, bei einem Intelligence Index von 43 gegenüber 56. Das Signal, das diesen Beitrag ausgelöst hat, stellte es so dar, dass Claude Haiku 5.5 „viel besser als GPT-6 Luna“ und „näher an Sonnet 5.5“ sei. Die erste Hälfte davon entspricht ungefähr dem, was das eigene Vergleichsset des Anbieters zeigt. Die zweite Hälfte ist der Punkt, an dem die Messungen aufhören, mit dem Marketing übereinzustimmen, und es lohnt sich, genau zu bestimmen, bei welcher der beiden Hälften.

Zwei Modelle, sechs Tage und eine Stufe auseinander

Claude Haiku 5.5 wurde am 7. Oktober 2026 unter der Modell-ID claude-haiku-5-5 veröffentlicht. Es ist der direkte Ersatz für Claude Haiku 4.5, nimmt Text und Bilder entgegen, gibt Text zurück und ist das erste Modell der Haiku-Klasse, dem Anthropic eine einstellbare Aufwandsstufe gegeben hat – Low, Medium, High, Xhigh und Max, wobei medium als API-Standard dient. Anthropic nennt es „das günstigste, schnellste und leistungsfähigste kleine Modell, das wir je veröffentlicht haben“, und die Fußnote schränkt ein, dass es das schnellste bei der Standardgeschwindigkeit des jeweiligen Modells ist, aber immer noch hinter den Opus-Modellen zurückbleibt, wenn diese im Fast Mode laufen.

Claude Sonnet 5.5 erschien sechs Tage früher, am 28. September 2026, als claude-sonnet-5-5 – die Stufe, die Anthropic als die beste Kombination aus Geschwindigkeit und Intelligenz positioniert und die sie für komplexes agentisches Coding empfiehlt. Dasselbe Fenster von einer Million Token. Anders als Claude Haiku 5.5 hat es keine Preisstufe nach Prompt-Länge, was sich als wichtiger erweist als der sechs Tage Vorsprung.

Beide sind jetzt auf allen Plattformen verfügbar, einschließlich Amazon Web Services, Google Cloud und Microsoft Azure, und für beide gilt eine Stilllegungsverpflichtung von nicht früher als einem Jahr nach der Markteinführung – der 7. Oktober 2027 für Claude Haiku 5.5, der 28. September 2027 für Claude Sonnet 5.5. Anthropic zufolge ist Claude Sonnet 5.5 mit Zero-Data-Retention verfügbar, genau wie Claude Opus 5.5 und Claude Sonnet 5.

Die Tarifkarte, beide Seiten, an einem Ort

Pro Million Token, in US-Dollar, zu den Preisen von Anthropic:

• Eingabe — Claude Haiku 5.5: 0,10 $ für Prompts bis zu 100.000 Tokens, 0,50 $ oberhalb dieser Grenze; Claude Sonnet 5.5: 2,00 $ pauschal, kein Staffelschritt.

• Ausgabe — Claude Haiku 5.5 0,50 $ bis zu 100.000 Tokens, 2,50 $ darüber; Claude Sonnet 5.5 10,00 $ pauschal.

• Cache-Lesevorgänge — Claude Haiku 5.5: 0,01 $ im unteren Tarifband und 0,05 $ darüber; Claude Sonnet 5.5: 0,10 $. Anthropic halbierte die Cache-Lesevorgänge von Claude Sonnet 5.5 von 0,20 $ zeitgleich mit der Einführung von Haiku und erklärt, dass Claude Sonnet 5.5, da Cache-Lesevorgänge einen großen Anteil am agentischen Tokenverbrauch ausmachen, bei den meisten agentischen Arbeiten nun etwa 20 % weniger kostet.

• Cache-Schreibvorgänge — Claude Haiku 5.5: 0,125 $ für einen Fünf-Minuten-Schreibvorgang und 0,20 $ für einen Ein-Stunden-Schreibvorgang im unteren Tarifband, 0,625 $ und 1,00 $ darüber; Claude Sonnet 5.5: 2,50 $ für einen Fünf-Minuten-Schreibvorgang und 4,00 $ für eine Stunde.

• Batch — die Batch-API ist sowohl bei der Eingabe als auch bei der Ausgabe um 50 % günstiger. Damit liegt Claude Haiku 5.5 mit 0,05 $ und 0,25 $ unter der 100.000-Token-Grenze und mit 0,25 $ und 1,25 $ darüber, gegenüber Claude Sonnet 5.5 mit 1,00 $ und 5,00 $.

Liest man diese Zeilen im Zusammenhang, ist das Muster konsistent: Im unteren Bereich sieht man eine 20-fache Eingabelücke und eine 20-fache Ausgabelücke; oberhalb der Linie sind es 4-fach und 4-fach. Die Schlagzeile von Anthropic lautet „rund 75 % weniger Betriebskosten“ im Durchschnitt gegenüber Claude Haiku 4.5, in einer Fußnote präzisiert auf 90 % günstiger unter 100.000 Tokens und 50 % günstiger darüber, wobei die Tokenizer-Änderung in diesen Durchschnitt eingerechnet ist.

Der 100.000-Token-Schritt ist der Punkt, an dem die Rechnung kippt.

Zwei Dinge ziehen in entgegengesetzte Richtungen, und nur eines davon steht auf der Preisliste. Die Preise fallen stark gegenüber Claude Haiku 4.5. Gleichzeitig liefert Claude Haiku 5.5 einen aktualisierten Tokenizer aus, ähnlich denen in Claude Sonnet 5.5 und Claude Opus 5.5, der laut Anthropic „pro Aufgabe etwas mehr Tokens verbraucht“ – ein identischer Prompt kommt also als größere Zahl abrechenbarer Tokens an, als es in der vorherigen Generation der Fall gewesen wäre. Der Durchschnitt von 75 % ist der Saldo aus beidem – und es ist eine Anbieterangabe.

Die 100.000-Token-Grenze ist der Teil, der die Leute aufhorchen lässt. Anthropic bepreist Claude Haiku 5.5 nach der Prompt-Länge: Eine Anfrage, deren Prompt 100.000 Token überschreitet, zahlt die höheren Preise für die gesamte Anfrage, nicht nur für die Token jenseits der Schwelle. Die Prompt-Länge zählt alle Eingabe-Token, einschließlich Cache-Reads und Cache-Writes, und jede Anfrage wird für sich bepreist – eine lange Anfrage zahlt die höhere Preisstufe, selbst wenn ein Teil ihres Prompts ein Cache-Treffer ist, und frühere Anfragen behalten die Preise, zu denen sie abgerechnet wurden. Eine Retrieval-Pipeline, die bequem bei 90.000 Token liegt, zahlt 0,10 $ und 0,50 $. Verschiebt man das Fenster nur eine Stufe, wird die gesamte Anfrage mit 0,50 $ und 2,50 $ neu bepreist. Claude Sonnet 5.5 macht das nicht, weil das volle Fenster von einer Million Token zum Standardpreis abgerechnet wird.

Daraus folgen zwei Konsequenzen, die in entgegengesetzte Richtungen weisen. Erstens tritt der erwartete Crossover – langer Kontext, der das teure Modell zum günstigeren macht – nicht ein: Claude Haiku 5.5 oberhalb der Linie kostet auf der Preisliste immer noch ein Viertel von Claude Sonnet 5.5. Zweitens verengt sich die Lücke, auf die Sie gesetzt haben, von 20x auf 4x genau dann, wenn Ihre Arbeitslast hoch wird – also genau dann, wenn absolute Zahlen anfangen, eine Rolle zu spielen. Der Sprung ist der Grund, warum eine kostensensible Pipeline eine eigene Budgetposition statt eines Preises pro Token braucht.

Welche Punktzahl jeder Anbieter nach eigenen Angaben erzielt

Alles in diesem Abschnitt stammt vom Anbieter und wurde nicht von Dritten reproduziert. Anthropic veröffentlicht dasselbe Vergleichsset auf seinen Seiten zu Claude Haiku 5.5 und Claude Sonnet 5.5, und wo sich die beiden Seiten überschneiden, stimmen sie überein:

• GDPval-AA v2.1, Wissensarbeit — 1.620 für Claude Haiku 5.5, gegenüber 1.840 für Claude Sonnet 5.5, 735 für Claude Haiku 4.5 und 1.437 für GPT-6 Luna.

• AA-Briefcase v1.1 — 1.578 für Claude Haiku 5.5, gegen 1.824 für Claude Sonnet 5.5, 614 für Claude Haiku 4.5 und 1.336 für GPT-6 Luna.

• OSWorld 2.1, Computer-Nutzung, Offline-Teilmenge — 72,4 % für Claude Haiku 5.5, gegenüber 83,9 % für Claude Sonnet 5.5, 15,7 % für Claude Haiku 4.5 und 48,9 % für GPT-6 Luna.

• Terminal-Bench 4.0, agentisches Coding — 39,2 % für Claude Haiku 5.5, gegenüber 70,6 % für Claude Sonnet 5.5, 0,0 % für Claude Haiku 4.5 und 16,4 % für GPT-6 Luna.

• FrontierCode 1.1, Main — 46,4 % für Claude Haiku 5.5, gegenüber 52,1 % für Claude Sonnet 5.5 bei Xhigh-Aufwand, 42,4 % für GPT-6 Luna. Anthropic weist außerdem darauf hin, dass Claude Sonnet 5.5 bei diesem Test bei Max-Aufwand niedriger abschneidet als bei Xhigh, was das Unternehmen auf die häufigere Nutzung eines Code-Review-Skills zurückführt, der Zeitüberschreitungen oder Änderungen außerhalb des vorgesehenen Umfangs verursacht.

• Chartographie, visuelles Schlussfolgern ohne Werkzeuge — 46,4 % für Claude Haiku 5.5, gegenüber 61,6 % für Claude Sonnet 5.5, 6,4 % für Claude Haiku 4.5 und 29,1 % für GPT-6 Luna.

• Humanity's Last Exam — 45,9 % ohne Werkzeuge und 57,4 % mit ihnen für Claude Haiku 5.5; 64,5 % mit Werkzeugen für Claude Sonnet 5.5, 18,7 % für Claude Haiku 4.5 und 56,9 % ohne Werkzeuge für Claude Sonnet 5.5 auf derselben Seite. Anthropic merkt an, dass die Zahlen der GPT-6-Familie veraltet sein könnten, weil OpenAI einen Fehler beim Bildverständnis behoben hat und nicht alle Bewertungen von Drittanbietern aktualisiert worden waren.

Zwei dieser Zeilen sind es wert, zweimal gelesen zu werden. Auf FrontierCode liegen die beiden Modelle überhaupt dicht beieinander — 46,4 % gegenüber 52,1 % — und bei Chartography, wo es keine Tools gibt, hinter denen man sich verstecken kann, beträgt der Abstand 15 Punkte. Terminal-Bench 4.0 ist überhaupt nicht knapp: 39,2 % gegenüber 70,6 % ist eine andere Fähigkeitsklasse, weshalb Anthropics Seite zu Claude Sonnet 5.5 weiterhin auf Claude Sonnet 5.5 und Claude Opus 5.5 für komplexes agentisches Coding verweist und Claude Haiku 5.5 als das Modell für eng gefasste, hochvolumige Arbeit darstellt.

Was der unabhängige Vorstand beiträgt

Die Zahlen von Anthropic vergleichen seine eigenen Modelle miteinander und mit einem einzigen Wettbewerber. Ein unabhängiges Gremium stellt beide dem gesamten Feld gegenüber, und die Kennzahl, die es ausweist, die die Anbieter nicht ausweisen, sind die Kosten pro abgeschlossener Aufgabe.

Artificial Analysis bewertet Claude Haiku 5.5 bei maximalem Aufwand mit einem Intelligence Index von 43, deutlich über dem Median von 13 unter vergleichbaren Modellen; das Modell erzeugt 440 Mio. Output-Tokens im Index gegenüber einem Median von 100 Mio. — sehr wortreich — bei 0,10 $ für Input und 0,50 $ für Output pro Million Tokens sowie 242 Output-Tokens pro Sekunde. Seine gemessenen Kosten betragen 0,21 $ pro Intelligence-Index-Aufgabe.

Dieselbe Rangliste bewertet Claude Sonnet 5.5 mit 56 Punkten gegenüber einem Median von 26; dabei generiert es 410 Mio. Ausgabe-Tokens gegenüber einem Median von 88 Mio., bei 2,00 $ für Eingabe und 10,00 $ für Ausgabe mit 90 % Cache-Rabatt. Die gemessenen Kosten betragen 7,60 $ pro Aufgabe im Intelligence Index.

A headless capture of the Artificial Analysis model page for Claude Haiku 5.5 at Max effort, showing the header 'Claude Haiku 5.5 (Max)' with the Anthropic vendor label and release month October 2026, a rank strip reading Intelligence #2/182, Speed #8/182, Cost #46/182 and Verbosity #62/182, the price strip In $0.10, Out $0.50 and $0.21 per task, a Comparison Summary stating an Artificial Analysis Intelligence Index of 43 against a median of 13 with 440M output tokens generated, and an output-token speed of 242 tokens per second described as notably fast. A specification panel confirms a 1M-token context window, reasoning enabled, text and image input and text output.A headless capture of the Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), showing the Anthropic vendor label and release month September 2026, a rank strip reading Intelligence #3/216, Cost #98/216 and Verbosity #102/216, the price strip In $2.00, Out $10.00, a 90% cache discount and $7.60 per task, a Comparison Summary stating an Intelligence Index of 56 against a median of 26 with 410M output tokens generated against a median of 88M, and a specification panel showing a 1M-token context window and text and image input.

Stellt man diese beiden Zeilen nebeneinander, ist das Verhältnis die eigentliche Aussage. 0,21 $ gegenüber 7,60 $ sind etwas mehr als das 36-Fache, und die beiden Modelle liegen bei der Ausführlichkeit fast gleichauf – 440 Mio. Ausgabe-Token gegenüber 410 Mio. –, sodass dieser Multiplikator fast vollständig darauf zurückzuführen ist, dass die Preisliste genau das tut, was sie verspricht. Nach der Preisliste des Anbieters selbst beträgt derselbe Vergleich das 20-Fache. Das Plus kommt von Dingen, die ein Preis pro Token nicht zeigen kann: Das günstigere Modell erreicht seine Antwort bei dieser Aufwandsstufe mit weniger abgerechneten Tokens pro Aufgabe, und Cache-Lesevorgänge werden mit einem Zehntel des Tarifs von Claude Sonnet 5.5 abgerechnet. Dieselbe Testumgebung, dieselben Aufgaben, unabhängig gemessen.

A generated two-column comparison scoreboard titled 'Claude Haiku 5.5 vs Claude Sonnet 5.5 - the scoreboard'. The left column, headed Claude Haiku 5.5, reads AA Intelligence Index: 43; Cost per Index task: $0.21; Input / output per 1M: $0.10 / $0.50; Output speed: 242 tok/s; Context window: 1M; Terminal-Bench 4.0: 39.2%. The right column, headed Claude Sonnet 5.5, reads AA Intelligence Index: 56; Cost per Index task: $7.60; Input / output per 1M: $2.00 / $10.00; Output speed: not published; Context window: 1M; Terminal-Bench 4.0: 70.6%. A footer line reads 'Index, cost per task and speed per Artificial Analysis; Terminal-Bench vendor-reported.'

Wo der Billig-Tarif tatsächlich ausläuft

Die Kundenzahlen, die Anthropic veröffentlicht, entscheiden die Aufteilung häufiger als die Benchmarks, und sie weisen alle in dieselbe Richtung. Asana meldet über 30 % geringere Latenz bei Aufgabenabschlüssen und bis zu 2,5-mal schnellere Inferenz pro Agenten-Turn. Box meldet eine Punktzahl, die 11 Punkte über Claude Haiku 4.5 liegt, bei etwa halber Latenz. HubSpot meldet die beste Punktzahl, die es in seiner eigenen Suite gesehen hat, 92,8 % im Durchschnitt über drei Durchläufe, mit der höchsten Trefferquote und der niedrigsten Falsch-Positiv-Rate. AlphaSense führt etwa 8 Mio. Aufrufe pro Woche über „Ask in Document" aus und meldet eine statistisch signifikante Verbesserung gegenüber Claude Haiku 4.5, 0,84 gegenüber 0,76. Cognition meldet, dass sein Fusion-Agent mit Claude Haiku 5.5 als Sidekick einen FrontierCode-Score von 66,2 hält.

Nichts davon ist ein Long-Horizon-Agent. Sie sind Punktlösungen – ein wohldefinierter Schritt, der schneller und günstiger wird. Das ist die Form, für die Claude Haiku 5.5 gebaut ist, und sie ist zugleich die Form, in der der 36x-Kostenvorteil echtes Geld ist und kein Rundungsfehler. Der Vorteil verstärkt sich mit dem Aufrufvolumen und verflüchtigt sich mit der Aufruftiefe: Hunderttausend Klassifizierungsaufrufe pro Tag bei 0,10 $ für Input und 0,50 $ für Output sind ein Posten, den man verschwinden sieht, während hundert Agenten-Turns pro Sitzung, von denen jeder den angesammelten Kontext erneut liest, einen Posten bilden, der superlinear wächst, weil jeder Turn jenseits der Schwelle die höhere Tarifstufe bezahlt.

Das Gegenargument von Claude Sonnet 5.5 sind die Kosten pro Versuch und nicht die Kosten pro Token. Anthropic zufolge ist es über 30 % schneller als Claude Sonnet 5 und kostet bei den meisten Aufgaben bis zu 30 % weniger, wobei die Einsparung daraus resultiert, dass weniger Token benötigt werden und nicht aus niedrigeren Preisen. Drittanbieter-Tester haben dazu Zahlen vorgelegt: Slack meldet etwa 14 % weniger Ausgabe-Token, Balyasny etwa 121k Token pro Antwort gegenüber 497k, Box 2,4-mal schneller mit 12 % weniger Token, Lovable etwa ein Drittel weniger Tool-Aufrufe und etwa halb so viele Shell-Ausführungen, Atlassian bis zu 30 % schnellere Rovo Agents und Base44 3,6 Iterationen pro Build gegenüber 7,7 für Claude Opus 5. Ein Durchgang, der sitzt, schlägt vier, die es nicht tun.

Es gibt einen dritten Faktor, der in die entgegengesetzte Richtung wirkt. Anthropic hat den Aufwand in dieser Generation auf einen Schalter auf Modellebene verlagert — die Effort-Einstellung von Claude Haiku 5.5 wird einmal pro Anfrage festgelegt, statt als Thinking-Budget pro Anfrage bemessen zu werden, und der alte budget_tokens-Modus ist bei den 4.6-Modellen veraltet und wird bei späteren nicht mehr akzeptiert. Für eine Flotte, die aus vielen Diensten heraus eine einzige Modell-ID aufruft, ist das eine Vereinfachung. Für alles, was sein eigenes Reasoning pro Aufruf bemessen hat, ist es ein Rewrite.

Beide hinter einem Endpunkt betreiben

Der Grund, warum es sich lohnt, diese Entscheidung richtig zu treffen, ist, dass die falsche Hälfte davon teuer rückgängig zu machen ist: Einen Produktionspfad von einer Modell-ID auf eine andere umzuverdrahten bedeutet, jede Aufrufstelle anzufassen, die das Verhalten der alten vorausgesetzt hat. Der günstigere Weg herauszufinden, auf welche Stufe eine Workload gehört, besteht darin, beide hinter einem Endpunkt laufen zu lassen und den Verkehr durch Konfiguration statt durch Refactoring zwischen ihnen zu verschieben.

Dafür ist OrcaRouter da. Claude Sonnet 5.5 steht im Katalog als anthropic/claude-sonnet-5.5, neben Claude Sonnet 5, Claude Opus 5.5 und Claude Haiku 4.5 — die ältere Haiku-Stufe bleibt als Referenzpunkt verfügbar, während Sie davon migrieren. Die Plattform gibt den Listenpreis des Anbieters ohne Aufschlag weiter, sodass die oben genannten 2,00 $ und 10,00 $ die Sätze sind, die Sie zahlen, und umgekehrt gilt dasselbe: Wenn ein Anbieter seine Preise ändert, ist der neue Preis hier noch am selben Tag live, und auf diese Weise hat uns auch die Senkung des Cache-Lesepreises für Claude Sonnet 5.5 erreicht. Zwei Funktionen leisten die Arbeit, die diese spezielle Entscheidung erfordert. Automatisches Failover hält ein Modell, das Sie noch evaluieren, von Ihrem kritischen Pfad fern – ganz von selbst –, und mit der Routing-DSL können Sie Aufrufe unter 100.000 Token an die günstige Stufe senden und die Long-Context- oder Long-Horizon-Aufrufe im selben Anfragefluss an die teurere weiterreichen, ohne einen zweiten Vertrag oder ein zweites SDK.

Um genau zu sein, was gehostet wird und was nicht: Claude Sonnet 5.5 ist heute über uns routingfähig. Claude Haiku 5.5 ist noch nicht im Katalog. Bis es so weit ist, läuft es über Anthropics eigene API und die drei oben genannten Cloud-Plattformen.

Wie man entscheidet

Wählen Sie Claude Haiku 5.5, wenn die Aufgabe eng begrenzt ist, in großer Zahl anfällt und überprüfbar ist – Klassifizierung, Extraktion, Routing, Zusammenfassung, die Arbeit pro Turn innerhalb eines Agenten, den Sie bereits gebaut haben. Das 20-fache Kostengefälle ist dort der eigentliche Punkt, der 100.000-Token-Schritt lässt sich konstruktionsbedingt vermeiden, und die unabhängig gemessenen 0,21 $ pro Aufgabe belegen, dass der Vorteil auch außerhalb des eigenen Labors des Anbieters Bestand hat. Stellen Sie den Aufwandsregler pro Aufgabenklasse ein, statt ihn auf der Standardeinstellung zu belassen; bei einem Modell der Haiku-Klasse ist der Unterschied zwischen Low und Max ein Kostenmultiplikator, keine Qualitätspräferenz.

Wählen Sie Claude Sonnet 5.5, wenn die Aufgabe langfristig, agentisch oder nicht verifizierbar ist – Code, der kompilieren muss, Computer-Nutzung, die den Bildschirm in einem bekannten Zustand hinterlassen muss, alles, wo eine falsche Antwort mehr kostet als der Aufruf. Terminal-Bench 4.0 mit 70,6 % gegenüber 39,2 % ist keine Nuance, sondern eine andere Fähigkeitsklasse, und das Pauschalpreismodell bedeutet, dass ein langer Kontext nicht stillschweigend die gesamte Anfrage neu bepreist. Wenn Ihre Workload wirklich dazwischenliegt, ist die ehrliche Antwort, dass bisher hinter keinem der beiden Modelle eine breite Basis an Reproduktionen durch Dritte steht, die Indexwerte aus einem einzigen Harness stammen und die oben zitierten Herstellerangaben vom Hersteller selbst stammen.

Was würde diese Antwort ändern?

Drei Dinge sind es wert, beobachtet zu werden, und keines davon ist eine Benchmark-Veröffentlichung. Das erste ist, ob unabhängige Evaluierungen von Claude Haiku 5.5 bei Low-, High- und Xhigh-Aufwand – nicht nur bei Max – dasselbe Kosten-pro-Aufgabe-Verhältnis zeigen, denn der Aufwandsregler ist der billigste Hebel im Vergleich und der am wenigsten gemessene. Das zweite ist, ob der 100.000-Token-Schritt Bestand hat; ein drittes Band oder gar kein Band in der nächsten Generation würde die Kalkulation für jede Retrieval-Pipeline an der Linie stärker verändern als jeder einzelne Benchmark-Score. Das dritte ist der Tokenizer. Wenn ein späterer Checkpoint denselben Text mit der älteren Rate tokenisiert, wird Anthropics 75-%-Durchschnitt zur Untergrenze statt zum Ziel, und die Lücke zu Claude Sonnet 5.5 vergrößert sich, ohne dass sich einer der beiden Preise bewegt.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert