
Tägliches KI-Briefing, 8. Okt.: Claude Haiku 5.5 startet bei 0,10 $ und Cache-Lesevorgänge bei Sonnet 5.5 halbieren sich
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Claude Haiku 5.5 wurde am 7. Oktober 2026 veröffentlicht und ist das Billigste, was das Unternehmen je hinter einer API angeboten hat: 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens bei Prompts bis zu 100.000 Tokens, mit einem Kontextfenster von 1 Mio. Tokens und einem Effort-Regler, der von Low bis Max reicht. Am selben Tag sanken ohne eigenen Launch-Post die Prompt-Cache-Lesevorgänge bei Claude Sonnet 5.5 von 0,20 $ auf 0,10 $ pro Million Tokens. Eines davon ist ein Produkt, das andere ein Einzelposten, und der Einzelposten ist derjenige, der in diesem Quartal mehr Geld bewegen wird.
Der Preis zuerst, weil er der Teil ist, bei dem Sie heute aktiv werden können. Dann der Aufwand, die Sache, die den Preis im Stillen entscheidet. Dann die Cache-Senkung, von der die Hälfte der Leute, die für Sonnet 5.5 zahlen, erst mit ihrer nächsten Rechnung erfahren wird.
Was Claude Haiku 5.5 ist, in der Reihenfolge, in der es zählt
Die Formulierung des Anbieters selbst lautet „das günstigste, schnellste und leistungsfähigste kleine Modell, das wir je veröffentlicht haben", und das Veröffentlichungsdatum ist der 7. Oktober 2026 — einen Tag vor diesem Briefing. Die Modell-ID lautet claude-haiku-5-5. Es nimmt Text und Bilder entgegen und gibt Text aus. Das Kontextfenster umfasst 1.000.000 Token, gegenüber 200.000 bei Claude Haiku 4.5, und die maximale Ausgabe beträgt 128.000 Token, wobei ein Beta-Header in der Batch-API diesen Wert auf 300.000 erhöht. Der Trainings-Cutoff ist Juni 2026, und Anthropic verpflichtet sich, das Modell nicht vor dem 7. Oktober 2027 abzukündigen.
Die wichtigste Aussage für alle, die Traffic routen, ist nicht das Kontextfenster. Sie ist, dass dies das erste Modell der Haiku-Klasse mit einstellbarem Effort ist. Effort umfasst Low, Medium, High, Xhigh und Max, Standard ist Medium, und adaptives Denken ist standardmäßig aktiviert – eine Sonnet-und-Opus-Funktion, die eine Stufe tiefer verfügbar wird. Der Launch-Beitrag enthält außerdem zwei Dinge, bei denen es ums Kaufen statt ums Bauen geht: monatliche API-Guthaben für Claude Max- und Team-Pläne, 100 $ bei Max 5x und 200 $ bei Max 20x mit bis zu 500 $ gepoolt für Team, und Beta-Unterstützung für Computer- und Browser-Nutzung in den SDKs. Die Sicherheit hält mit der Stufe Schritt: Die Cybersicherheitsvorkehrungen sind strenger als die von Claude Haiku 4.5, wobei Penetrationstest-Anfragen weiterhin blockiert werden, und die Biologiesicherheitsvorkehrungen entsprechen denen von Claude Sonnet 5, Claude Sonnet 5.5 und Claude Opus 5.

Der Preis und die 100.000-Token-Klippe mitten darin
Der beworbene Preis liegt bei 0,10 $ pro Million Eingabe-Tokens und 0,50 $ pro Million Ausgabe-Tokens. Lesen Sie das Sternchen: Das ist der Preis für Prompts mit höchstens 100.000 Tokens. Oberhalb von 100.000 werden beide Zahlen mit fünf multipliziert, auf 0,50 $ für Eingabe und 2,50 $ für Ausgabe. Cache-Schreibvorgänge kosten 0,125 $ pro Million in der Fünf-Minuten-Stufe und 0,20 $ in der Ein-Stunden-Stufe innerhalb des günstigen Bereichs, und Cache-Lesevorgänge kosten 0,01 $ pro Million – ein Zehntel des Eingabepreises, der tiefste Cache-Rabatt, den Anthropic für irgendein Modell veröffentlicht hat. Batch halbiert alles noch einmal: 0,05 $ und 0,25 $ innerhalb des günstigen Bereichs, 0,25 $ und 1,25 $ oberhalb davon.
Vergleichen Sie das mit Claude Haiku 4.5, das weiterhin mit pauschal 1,00 $ für Eingabe und 5,00 $ für Ausgabe auf der Preisliste steht, ohne kontextbasierte Staffelung, mit 0,10 $ für Cache-Lesevorgänge und einem Fenster von 200.000 Tokens. Das neue Modell kostet bei gleicher Prompt-Struktur ein Zehntel und bietet fünfmal so viel Kontext. Hier gibt es keine Migrationsrechnung anzustellen; die Rechnung ist alles andere als knapp.
Die Klippe ist der Teil, um den herum man planen muss. Ein Prompt mit 99.000 Tokens kostet zum Eingabetarif 99 Cent pro tausend Aufrufe. Ein Prompt mit 101.000 Tokens kostet 5,05 $ pro tausend. Ein Unterschied von zweitausend Tokens bedeutet eine fünfmal so hohe Rechnung, also sollte alles, was Sie im günstigen Tarifband bauen, entweder bequem unter 100.000 Tokens bleiben oder bewusst und konsequent darüber liegen – das schlechteste Ergebnis ist eine Pipeline, die auf der Grenze liegt und für die Hälfte ihres Traffics den hohen Tarif zahlt.
Aufwand ist jetzt ein Preisparameter, und die Standardeinstellung ist nicht die günstigste.
Da Effort standardmäßig auf Medium steht und Thinking standardmäßig aktiviert ist, sind Listenpreis und tatsächlicher Preis nicht dieselbe Zahl. Reasoning-Tokens werden als Output-Tokens abgerechnet. In Anthropics eigener veröffentlichter Ausführung des Artificial Analysis Intelligence Index – vom Anbieter gemeldet, von uns nicht reproduziert – gibt Claude Haiku 5.5 ungefähr 162.000 Tokens pro Aufgabe aus, von denen etwa 129.000 auf Reasoning entfallen. Das Medianmodell des Index gibt über die Testsuite hinweg in der Größenordnung von 100 Millionen Tokens aus; Haiku 5.5 verbraucht 440 Millionen. Bei $0,50 pro Million Output-Tokens ist diese Ausführlichkeit bezahlbar, und genau das ist der Punkt: Zum Preis von Haiku 5.5 ist viel zu denken immer noch billiger als wenig zu denken bei einem Modell, das $5,00 für Output berechnet.
Setze den Aufwand für Klassifizierungs-, Extraktions- und Routing-Entscheidungen, bei denen du eine schnelle statt einer wohlüberlegten Antwort möchtest, auf Niedrig, und belasse ihn bei Mittel für alles, was ein Nutzer lesen wird. Außerdem ist der Wechsel auf Niedrig die zuverlässige Möglichkeit, einen wortreichen Agenten innerhalb des 100.000-Token-Bereichs zu halten, weil er Reasoning-Tokens kürzt, bevor er die Antwortqualität senkt.
Die leisere Zeile: Sonnet 5.5 – Cache-Lesevorgänge halbiert
Claude Sonnet 5.5 liest einen gecachten Prompt ab dem 7. Oktober für $0,10 pro Million Tokens, gesenkt von $0,20. Der Eingabepreis von Sonnet 5.5 beträgt $2,00 und der Ausgabepreis $10,00, sodass ein Cache-Lese-Multiplikator von 0,05x jetzt derselbe Multiplikator ist, den Haiku 5.5 hat, angewendet auf einen zwanzigmal höheren Eingabetarif. Anthropics eigene Schätzung ist, dass dies die Kosten der meisten agentischen Arbeit um etwa 20% senkt, was eine Aussage über die Form der Arbeitslast und nicht über einen Benchmark ist: Sie gilt nur, wenn ein großer Teil Ihrer Eingabe ein stabiler Präfix ist, den Sie bei jedem Turn erneut senden. Wenn Ihre Prompts bei jedem Aufruf einzigartig sind, kostet Sie diese Änderung nichts und spart Ihnen nichts.
Bemerkenswert ist, was die Preissenkung impliziert. Anthropic bepreist langlebige Präfixe auf dem Mittelklasse-Modell genau in dem Moment aggressiv, in dem es ein sehr günstiges kleines Modell auf den Markt bringt, was sich als Argument für eine Zwei-Modell-Architektur lesen lässt: ein Sonnet-5.5-Zweig mit heißem Cache für die Arbeit, die Urteilsvermögen erfordert, und ein Haiku-5.5-Zweig für das Volumen, das kein Urteilsvermögen erfordert.
Was die unabhängigen Zahlen zeigen, nach einem Tag
Artificial Analysis ließ Claude Haiku 5.5 am Tag nach dem Launch bewerten. Der Intelligence Index liegt insgesamt bei 43, wobei die Max-effort-Konfiguration mit 43,40 angegeben wird, Platz zwei von 182 Modellen im Ranking. Die Kosten pro Index-Aufgabe betragen 0,21 $, Platz 46 der günstigsten. Der gemischte Preis bei einem Verhältnis von 7:2:1 von Input zu gecachtem Input zu Output beträgt 0,08 $ pro Million – die Zahl, die den früheren Tier-Vergleich gegenüber allem anderen unfair erscheinen lässt. Die Ausgabegeschwindigkeit beträgt 243,4 Tokens pro Sekunde, womit sie im Ranking auf Platz neun der schnellsten liegt, mit einer angegebenen First-Token-Latenz von etwa 0,3 Sekunden und einem Cache-Rabatt von 90 %.
Diese 440-Millionen-Token-Ausgabezahl ist der Vorbehalt, der an der 43 hängt. Der Score ist echt und unabhängig erhoben; die Ausführlichkeit ebenso. Ein Modell, das so viel denkt, ist pro Token günstig und nicht immer pro Aufgabe günstig, und in der Lücke zwischen diesen beiden Zahlen sitzt tatsächlich die Routing-Entscheidung.
Um die Größenordnung einzuordnen: Die eigenen veröffentlichten Vergleiche von Anthropic setzen Claude Haiku 5.5 bei GDPval-AA v2.1 auf 1620 gegenüber 735 für Claude Haiku 4.5, bei OSWorld 2.1 auf 72,4 % gegenüber 15,7 %, bei Humanity's Last Exam ohne Tools auf 45,9 % gegenüber 10,2 % und bei Terminal-Bench 4.0 auf 39,2 % gegenüber 0,0 %. Das sind vom Anbieter gemeldete Zahlen aus vom Anbieter ausgewählten Evaluierungen und sollten als richtungsweisend gelesen werden, doch die Richtung ist alles andere als subtil – das ist kein kleines Upgrade für ein kleines Modell.

Zugang zu diesen Modellen ohne einen zweiten Vertrag
Claude Haiku 5.5 ist über Anthropics eigene API verfügbar und von dort aus überall dort, wo Anthropics Modelle weiterverkauft werden.anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 und anthropic/claude-fable-5.1 — wir hosten Claude Haiku 5.5 nicht, und dieses Briefing wird nicht so tun, als wäre es anders. Was wir führen, ist die Stufe darüber, und OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, weshalb die Cache-Read-Senkung für Sonnet 5.5 am selben Tag in unserer Preisgestaltung erschien, an dem Anthropic sie vornahm, statt in einem geplanten Neupreiszyklus.
Die praktische Variante: Wenn Sie Haiku 5.5 auf einem Klassifizierungs-Pfad ausprobieren möchten, während Ihr Bewertungs-Pfad auf Claude Sonnet 5.5 bleibt, halten Sie zwei Schlüssel statt einen, und die Routing-Schicht ist der Ort, an dem das A/B entschieden wird. Das ist das ganze Argument für ein Gateway statt einer direkten Integration – ein Endpunkt, Modell-Strings und ein Failover-Pfad, wenn ein Anbieter wackelt.

Was von hier aus zu beobachten ist
Drei Dinge. Ob Drittanbieter beginnen, Haiku 5.5 zu einem Mischpreis von unter 0,10 $ weiterzuverkaufen – der Punkt, an dem sich die Routing-Schicht bezahlt macht und nicht mehr nur die Beschaffung vereinfacht. Ob Anthropic die Grenze der 100.000-Token-Stufe erweitert, denn eine Klippe bei exakt 100.000 ist ein seltsamer Ort für ein Modell mit 1-Mio.-Token-Fenster, um eine zu haben. Und ob die 440-Millionen-Token-Ausführlichkeitskennzahl in einem Point-Release sinkt, weil genau diese eine Zahl zwischen Haiku 5.5 und seinem Status als offensichtlicher Standard für die gesamte untere Hälfte eines Produktions-Stacks steht.
