
Claude Haiku 5.5 vs. Ling 3.0 Flash: Eines dieser Modelle hat bereits einen Nachfolger
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Beginne mit der seltsamen Tatsache, denn sie ist diejenige, die die Entscheidung prägen sollte. Ling 3.0 Flash – Ant Groups Open-Weight-Modell mit 124 Milliarden Parametern, im August 2026 unter MIT veröffentlicht – ist jetzt als veraltet markiert, wobei Ling 3.1 Flash als sein Nachfolger genannt wird. Claude Haiku 5.5 erschien am 7. Oktober 2026, zwei Tage vor diesem Text, und Anthropic hat zugesagt, es nicht vor Oktober 2027 einzustellen. Zwei Modelle im selben Preisbereich, und bei einem davon wird bereits auf seinen eigenen Nachfolger verwiesen.
Diese Asymmetrie ist kein Urteil über die Qualität. Ling 3.0 Flash ist ein wirklich schnelles Modell mit offenen Gewichten und einer ungewöhnlichen Architektur, und in mehreren Belangen schlägt es die Anthropic-Klasse klar. Aber es bedeutet, dass dieser Vergleich ein Verfallsdatum hat, und jeder Beitrag, der die beiden als gleich langlebig behandelt, verkauft dir den Teil, der abläuft.
Zwei Veröffentlichungen, zwei sehr unterschiedliche Zeitalter
Die unabhängigen Zahlen hier stammen von Artificial Analysis; die anbieterspezifischen Angaben stammen aus den Modellkarten und der Dokumentation und sind gekennzeichnet.
• Veröffentlichung — Ling 3.0 Flash am 4. August 2026, mit dem auf den 2. August datierten Hugging-Face-Repository. Claude Haiku 5.5 am 7. Oktober 2026.
• Lizenz — MIT für Ling 3.0 Flash, was so permissiv ist, wie offene Gewichte nur sein können. Claude Haiku 5.5 ist proprietär, nur per API verfügbar.
• Status — Ling 3.0 Flash trägt eine Deprecation-Kennzeichnung, die auf Ling 3.1 Flash verweist. Claude Haiku 5.5 ist aktuell, mit einer Zusage zur Nicht-Abschaltung bis Oktober 2027.
• Akzeptanz — das Ling 3.0 Flash-Repository hat 11,471 Downloads und 427 Likes erzielt. Das ist eine reale, aber bescheidene Präsenz und ein brauchbarer Anhaltspunkt dafür, wie stark das Tooling von Drittanbietern rund um das Modell gewachsen ist.
Der Altersabstand fällt stärker ins Gewicht, als die sechs Wochen nahelegen. Ling 3.0 Flash wurde in eine Phase hinein veröffentlicht, in der sich seine eigene Familie bereits bewegte; Claude Haiku 5.5 wurde als neuestes Mitglied einer Linie veröffentlicht, für die kein Nachfolger angekündigt ist.
Die Architektur ist der Teil, den es wert ist, zweimal gelesen zu werden

Ling 3.0 Flash ist ein Mixture-of-Experts-Modell mit 124 Milliarden Gesamtparametern und 5,1 Milliarden aktiven pro Token. Dieses Verhältnis ist das ganze wirtschaftliche Argument: Man bringt den Speicherbedarf eines großen Modells unter und bezahlt die Rechenleistung eines kleinen. Die veröffentlichte Konfiguration ist konkret, und sie ist keine bloße Neuverpackung eines Standard-Transformers:
• Schichtung — 35 KDA-Schichten mit 7 Gated-MLA-Schichten in einem Verhältnis von 5:1 plus 2 dichte Schichten. Das veröffentlichte Trainingsrezept verschiebt das Kontextfenster in Stufen von 8K auf 32K auf 256K, statt das lange Fenster von Grund auf zu trainieren.
• Experten — 512 geroutete Experten mit einem gemeinsam genutzten Experten, 8 pro Token aktiviert, bei einer Hidden Size von 2.560, einer Expert-Intermediate-Size von 768 und einer Dense-Intermediate-Size von 6.144. Das Vokabular umfasst 157.184 Token.
• Serving — das Referenz-Deployment der Karte nutzt SGLang mit --context-length 262144, und berichtet, dass HiCache mit Mooncake-Caching die Zeit bis zum ersten Token bei langen Eingaben um 60–80 % oder mehr reduziert. Dabei handelt es sich um eine vom Anbieter gemeldete Zahl, und sie wird als solche angegeben.
Nichts davon ist ein Gimmick. Ein aktiver Footprint von 5,1B ist der Grund, warum Ling 3.0 Flash mit dem Durchsatz bedient werden kann, den es erreicht, und die Caching-Arbeit ist der Grund, warum die First-Token-Latenz von Ling 3.0 Flash bei langen Prompts nutzbar bleibt. Der Ansatz von Claude Haiku 5.5 ist das Gegenteil: ein dichtes proprietäres Modell hinter einer API, mit einem 1.000.000-Token-Fenster und adaptivem Denken, das pro Anfrage entscheidet, wie viel Arbeit zu erledigen ist. Zwei kohärente Antworten auf dieselbe Kostenfrage.
Die Zahlen, Seite an Seite

• Unabhängige Bewertung — Claude Haiku 5.5 mit 43 auf dem Intelligence Index, Zweiter von 182. Ling 3.0 Flash mit 20, Dritter von 65 in seiner eigenen Klasse.
• Eingabepreis pro Million Token — Claude Haiku 5.5: 0,10 $ bis 100.000 Token, darüber 0,50 $. Ling 3.0 Flash: 0,075 $, mit 80 % Cache-Rabatt.
• Ausgabepreis pro Million Tokens — Claude Haiku 5.5: $0.50 bis 100.000 Tokens, darüber $2.50. Ling 3.0 Flash: $0.22.
• Gewichtete Kosten — 0,05 $ pro Million Tokens für Ling 3.0 Flash, gegenüber 0,08 $ für Claude Haiku 5.5 nach der eigenen Gewichtung des Boards.
• Geschwindigkeit — 333,6 Ausgabe-Tokens pro Sekunde für Ling 3.0 Flash, Platz 1 von 65 in seiner Klasse, gegenüber 240,4 für Claude Haiku 5.5. Die Zeit bis zum ersten Token ist nahezu gleichauf: 2,50 Sekunden gegenüber der Messung des Boards für das Anthropic-Modell.
• Kontext — 262.000 Tokens für Ling 3.0 Flash; 1.000.000 für Claude Haiku 5.5.
• Eingabemodalität – nur Text für Ling 3.0 Flash. Text und Bilder für Claude Haiku 5.5.
• Gewichte — MIT und herunterladbar für Ling 3.0 Flash. Proprietär für Claude Haiku 5.5.
Bei Ling zählen Geschwindigkeit und Preis, nicht Tiefe
Der 23-Punkte-Abstand im Index zwischen 43 und 20 ist die Schlagzeile, und er weist in dieselbe Richtung wie bei jedem Vergleich dieser Art: Claude Haiku 5.5 ist das stärkere Modell, und der Abstand ist nicht klein. Doch die Ling-Spalte gewinnt zwei Zeilen klar, und beide sind von der Sorte, die auf einer Rechnung oder in einem Latenzbudget auftaucht.
Zunächst der Durchsatz. 333,6 Tokens pro Sekunde sind die schnellste Leistung in seiner Klasse auf dem Leaderboard, rund 39 % vor Claude Haiku 5.5, und in Kombination mit niedrigeren Mischkosten bedeutet das, dass Massen-Generierung – Klassifizierungs-Sweeps, Datenkennzeichnung, strukturierte Extraktion mit hohem Volumen – messbar günstiger auf Ling 3.0 Flash läuft. Wenn die Aufgabe gut spezifiziert ist und die Fehlerart offensichtlich ist, kann ein Modell mit 23 Index-Punkten Rückstand trotzdem die richtige Wahl sein.
Zweitens: der 80-%-Cache-Rabatt. Für eine Workload mit einem großen stabilen Präfix und einem kleinen variierenden Tail fällt die effektive Eingaberate bei Ling 3.0 Flash deutlich unter den Listenpreis, und das Caching-Design der Modellkarte zielt genau auf dieses Muster ab. Die Cache-Leserate von Claude Haiku 5.5 in Höhe von $0,01 ist in absoluten Zahlen günstiger, doch seine Cache-Schreibkosten betragen $0,125, und das Modell ist mit einer Preisstufe bei 100.000 Eingabe-Tokens bepreist, die es bei Ling nicht gibt.
Das Gegengewicht ist Geschwätzigkeit, und es ist dasselbe, das auch für das Anthropic-Modell gilt. Artificial Analysis verzeichnete 260 Millionen Ausgabe-Tokens beim Ausführen des Index auf Ling 3.0 Flash gegenüber einem Median von 100 Millionen und kennzeichnet es als geschwätzig. Bei einem pro Token bepreisten Modell schmälert das den Kostenvorteil – eine um den Faktor 2,3 günstigere Ausgaberate, die teilweise von einem Modell aufgezehrt wird, das mehr Tokens schreibt, ist ein kleinerer Vorteil, als die Karte suggeriert.
Was die Anbieter-Benchmarks behaupten – und was nicht.
Die eigene Model Card von Ling 3.0 Flash meldet starke Werte: MathArena AIME 2026 bei 93,2, HMMT Februar 2026 bei 87, SWE-Bench Pro bei 56,6, SWE-Bench Multilingual Resolved bei 72,4 und Humanity's Last Exam bei 22,7. Jeder dieser Werte wurde vom Anbieter gemeldet, und keiner wurde hier unabhängig reproduziert. Sie wurden außerdem nicht gegen Claude Haiku 5.5 auf demselben Harness gemessen — Anthropic veröffentlicht sein eigenes Set (GDPval-AA v2.1 bei 1620, OSWorld 2.1 bei 72,4 %, Terminal-Bench 4.0 bei 39,2 %), und die beiden Anbieter haben unterschiedliche Test-Suiten verwendet. Die einzige gemeinsame Messung ist das unabhängige Board, und dort ist die Antwort eindeutig.
Anmerkenswert neben den Mathe-Ergebnissen: Dieser HLE-Wert von 22,7 liegt deutlich unter dem Wert von 45,9 ohne Tools, den Anthropic für Claude Haiku 5.5 meldet. Unterschiedliche Harnesses – also kein direkter Vergleich, aber auch keine Lücke, die sich mit der Wahl des Harness wegerklären lässt.

Das Nachfolgerproblem
Dies ist der Teil, der den Vergleich für alle entscheidet, die über das aktuelle Quartal hinaus planen, und er hat nichts mit Benchmarks zu tun.
Ling 3.0 Flash ist zugunsten von Ling 3.1 Flash veraltet. Das bedeutet nicht, dass es aufhört zu funktionieren – offene Gewichte laufen nicht ab, und MIT-Lizenzen können nicht widerrufen werden. Aber es bedeutet, dass das Ökosystem darum herum abdriften wird: Unterstützung durch Inferenz-Frameworks, Quantisierungs-Releases, Bugfixes und Community-Tools richten sich alle nach dem aktuellen Modell, und ein veraltetes bekommt nur den Rest dieser Aufmerksamkeit. Wenn du heute auf Ling 3.0 Flash aufbaust, baust du auf Gewichten auf, die eingefroren und fertig sind, was für eine stabile Arbeitslast in Ordnung ist und schwierig für alles, von dem du erwartest, dass es sich verbessert.
Claude Haiku 5.5 bietet die spiegelbildliche Menge an Garantien: Sie erhalten nicht die Gewichte, aber Sie bekommen einen Anbieter, dessen kommerzielles Interesse darin besteht, das Modell schnell, gepatcht und verfügbar zu halten, dazu eine Zusage, das Modell bis einschließlich Oktober 2027 nicht auszumustern, und einen veröffentlichten Migrationspfad für die Zeit nach deren Ende.
Beide Seiten dieser Route, durch einen Schlüssel
Die ehrliche Verfügbarkeitsaussage: OrcaRouter bietet Ling 3.0 Flash nicht an, und Claude Haiku 5.5 ebenfalls nicht. Ling 3.0 Flash wird über die eigene Distribution des Anbieters und mehrere Drittanbieter-Plattformen bereitgestellt; Claude Haiku 5.5 ist über die API von Anthropic und die großen Cloud-Plattformen verfügbar.
Was das übrig lässt, ist die Routing-Frage, die beide Modelle aufwerfen. Claude Haiku 5.5 mit 43 und einem 1M-Fenster ist ein natürliches Eskalationsziel; Ling 3.0 Flash mit 333 Token pro Sekunde ist eine natürliche Bulk-Strecke. Eine Route, die hochvolumige, klar spezifizierte Arbeit an eine schnelle Stufe schickt und alles, was eine Längen- oder Qualitätsprüfung nicht besteht, auf eine stärkere eskaliert, ist genau die Anordnung, die ein Router zusammenstellt — auf OrcaRouter stehen Anthropics Claude Haiku 4.5, Claude Sonnet 5.5 und Claude Opus 5.5 heute im Katalog, zusammen mit großen Open-Weight-Optionen wie DeepSeek V4.1 Flash und GLM 5.3 Flash, sodass sowohl die Eskalations- als auch die Bulk-Strecke jetzt gebaut und im Lasttest geprüft werden können. Ein Schlüssel, automatisches Failover darunter, Anbieter-Listenpreise zu 0 % Aufschlag durchgereicht, sodass eine Preisänderung noch am selben Tag live ist.
Welche der beiden, und wie lange?
Wählen Sie Claude Haiku 5.5, wenn die Arbeit ergebnisoffen ist, wenn Sie Bilder oder ein Kontextfenster von einer Million Token benötigen, wenn Sie möchten, dass ein Anbieter für die Betriebszeit geradesteht, oder wenn Sie über das nächste Quartal hinaus planen. Es liegt 23 Indexpunkte vorn, es ist aktuell statt veraltet, und der Preisunterschied ist klein genug, dass die Punktedifferenz den Ausschlag gibt.
Nehmen Sie Ling 3.0 Flash, wenn die Arbeitslast Massencharakter hat, gut spezifiziert und latenzempfindlich ist, wenn die MIT-Lizenz oder die offenen Gewichte ausschlaggebend sind oder wenn ein Cache-Rabatt von 80 % auf einen stabilen Präfix der entscheidende Faktor für Ihre Rechnung ist. Es ist das schnellere Modell und das günstigere pro Token, und es ist wirklich gut bei den Aufgaben, die ein 20-Index-Modell bewältigen kann. Gehen Sie einfach mit dem Wissen heran, dass Sie ein fertiges statt eines gepflegten Modells übernehmen und dass der Nachfolger, auf den es verweist, bereits existiert.
