
Claude Haiku 5.5 vs. Ling 3.1 Flash: Ein Modell mit 560 Milliarden Parametern, das pro Antwort viermal mehr kostet
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Sechs Tage liegen zwischen ihnen. InclusionAI veröffentlichte Ling 3.1 Flash am 1. Oktober 2026; der Anbieter veröffentlichte Claude Haiku 5.5 am 7. Oktober. Beide werden als Modelle der Flash-Klasse verkauft, beide haben ein Kontextfenster von einer Million Token, und in den Reasoning-Zeilen des einen unabhängigen Boards, das beide getestet hat, liegen sie so dicht beieinander, dass der Unterschied im Rauschen liegt. Dann kommt man zu der Zeile, die misst, ob ein Agent die Aufgabe tatsächlich abschließt, und sie liegen 26 Punkte auseinander – und zu der Zeile, die misst, was eine abgeschlossene Aufgabe kostet, wo das Modell mit 560 Milliarden Parametern viereinhalbmal so teuer ist wie das, dessen Parameterzahl niemand veröffentlicht hat.
Keine der beiden Preislisten sagt das voraus. Ling 3.1 Flash wird mit 0,30 $ pro Million Eingabe-Tokens und 0,90 $ pro Million Ausgabe-Tokens gelistet. Claude Haiku 5.5 wird mit 0,10 $ und 0,50 $ für Prompts bis zu 100.000 Tokens gelistet, darüber steigend auf 0,50 $ und 2,50 $. Als Preis pro Token gelesen, kostet Ling dreimal so viel bei der Eingabe und etwas weniger als doppelt so viel bei der Ausgabe, eine Kluft, die einen Vergleich in einer Zeile beendet.
Es beendet dieses hier nicht, denn die Preisliste wird pro Token bepreist und die Entscheidung pro Aufgabe. Diese beiden Zahlen gehen aus diesem Aufeinandertreffen mit entgegengesetzten Vorzeichen hervor, und der Grund ist nicht Weitschweifigkeit.
Was eine erledigte Aufgabe kostet, nicht was ein Token kostet
Beim Artificial Analysis Intelligence Index v4.3.2 betragen die gemessenen Kosten für die Absolvierung einer vollständigen Index-Aufgabe 0,21 $ für Claude Haiku 5.5 und 0,99 $ für Ling 3.1 Flash. Das ist eine 4,6-fache Kluft – größer als das 3-fache Eingabeverhältnis und in dieselbe Richtung.
Die naheliegende Erklärung – dass das teure Modell mehr redet – ist die falsche. Ling 3.5 Flash generierte 100.671 Ausgabe-Tokens pro Index-Aufgabe; Claude Haiku 5.5 generierte 162.164. Das günstigere Modell ist das geschwätzigere – und das um mehr als 60 %. Das Geld fließt also auch nicht dorthin, wohin die Preisliste es vermuten lässt.
Teilt man die Kosten pro Aufgabe auf, landen sie dort, wo die Indexmethodik sie tatsächlich ausgibt. Von den 0,21 $ von Claude Haiku 5.5 entfallen rund 62 % auf die Eingabeseite; von den 0,99 $ von Ling 3.1 Flash sind es rund 91 %. Das sind stark cache-lastige Reasoning-Läufe, und die beiden Anbieter bepreisen ein gecachtes Eingabe-Token sehr unterschiedlich: 0,01 $ pro Million für Claude Haiku 5.5 gegenüber 0,06 $ pro Million für Ling 3.1 Flash — eine 6-fache Spanne bei der einen Position, die die Rechnung dominiert. Die veröffentlichte Preisliste vergleicht 0,10 $ mit 0,30 $. Die Position, die über die Rechnung entscheidet, vergleicht 0,01 $ mit 0,06 $.
Unser eigener Katalog gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, woran man die beiden Situationen auf einer echten Rechnung und nicht auf einer modellierten auseinanderhalten kann. Ling 3.1 Flash ist im Katalog unter keiner Schreibweise seines Anbieterpfads zu finden, die wir auflösen konnten – weder unter InclusionAI noch unter Ling noch unter einer der acht Formen, die wir versucht haben –, die oben genannten $0.30 und $0.90 sind also die eigenen veröffentlichten Preise des Anbieters und nichts, was wir heute für Sie routen können. Claude Haiku 5.5 ist ebenfalls nicht im Katalog; es läuft über Anthropics eigene API. Was der Katalog aus der Nachbarschaft dieses Vergleichs tatsächlich führt, sind GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash und Gemini 3.8 Flash – jeweils zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters uns am selben Tag erreicht, an dem sie ihn erreicht. Wenn das Ergebnis unten lautet, dass das agentische Profil von Ling 3.1 Flash das ist, was Ihre Workload braucht, ist der praktische nächste Schritt ein direkter Vergleich mit den agentisch fähigen Modellen, die wir tatsächlich routen – auf einem einzigen Schlüssel mit automatischem Failover darunter und der Routing-DSL, wenn die Kostenobergrenze in die Route gehört und nicht in den Anwendungscode.

Sieben Zeilen, in denen beide gemessen wurden
Artificial Analysis ist das einzige Board, das beide Modelle ausgeführt hat, und die Überschneidung ist gering, aber aufschlussreich. Die Zeilen stimmen nicht miteinander überein, und die Richtung der Abweichung ist nicht zufällig.
• Intelligence Index v4.3.2 — 43,40 für Claude Haiku 5.5 (Max) gegenüber 41,09 für Ling 3.1 Flash. Ein Vorsprung von 2,31 Punkten für Anthropic.
• Kosten pro abgeschlossener Index-Aufgabe — 0,21 $ gegenüber 0,99 $ auf demselben Board.
• Zeit pro Index-Aufgabe — 424,6 Sekunden für Claude Haiku 5.5 gegenüber 360,4 Sekunden für Ling 3.1 Flash. Dies ist die Zeile, in der die Erwartung durchbrochen wird: Das 560-Milliarden-Parameter-Modell ist über den Index insgesamt hinweg das schnellere der beiden, und zwar um etwa 15 %.
• Terminal Bench 4.0 — 0,3283 gegen 0,3333. Ling 3.1 Flash liegt einen halben Punkt vorn, was bei einem Benchmark, den beide Anbieter anführen, einem Gleichstand gleichkommt.
SciCode — 0,5498 gegenüber 0,5405. Claude Haiku 5.5 um 0,9 Punkte. Auch ein Gleichstand.
• Humanity's Last Exam, ohne Werkzeuge — 0,4439 gegenüber 0,3943. Claude Haiku 5.5 um 5 Punkte, die erste echte Trennung.
• AutomationBench, Teilpunktzahl — 0.3541 gegenüber 0.6174. Ling 3.1 Flash um 26 Punkte, und mit einem größeren Vorsprung als alle anderen Abstände auf dieser Liste zusammengenommen.
Zwei weitere Zeilen existieren außerhalb dieser gemeinsamen Menge und lohnen sich mitzunehmen, denn sie fallen Käufern am stärksten auf. Bei GDPval-AA, das Artificial Analysis über 44 Berufe hinweg durchführt, liegen die beiden bei 1620,05 und 1621,75 — ein statistisches Unentschieden. Bei AA-Briefcase v1.1, einer Elo-bewerteten Evaluation für professionelle Langformarbeit, steht Claude Haiku 5.5 mit 1577,72 gegen Ling 3.1 Flash mit 1400,35, eine Lücke von 177 Punkten zugunsten von Anthropic. Das ist der größte nicht-agentische Abstand zwischen ihnen, den es irgendwo auf dem Board gibt.
Die eine Zeile, die die meisten dieser Gespräche entscheiden sollte
Durchschnitte auf Indexebene verschleiern, wohin die Zeit und das Geld tatsächlich geflossen sind, und dieses Paar ist der klarste Fall dafür in diesem Batch. Die Zahlen pro Auswertung auf Terminal Bench 4.0 liegen in keiner Dimension nahe beieinander, außer beim Score.
• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 bei 5,49 $ pro Aufgabe und 1.283 Sekunden pro Aufgabe.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0,3283 bei 0,65 $ pro Aufgabe und 908 Sekunden pro Aufgabe.
Fünf Tausendstel eines Score-Punkts trennen sie. Die Kosten liegen bei 8,4× und die Wall-Clock-Zeit bei 1,4×. Ein Team, das die Benchmark-Tabelle liest und das Modell mit einem Score von 0,3333 auswählt, hat sich nach der eigenen Rechnung von Artificial Analysis dafür entschieden, achtmal so viel zu zahlen, um eine Drittelminute später mit derselben Antwort anzukommen.
Dies ist kein Argument dafür, dass die Punktzahl bedeutungslos ist; es ist ein Argument dafür, dass eine Punktzahl ein Verhältnis von erledigter zu versuchter Arbeit ist und nichts über die Ressourcen aussagt, die bis dahin verbraucht wurden. Benchmarks für agentische Aufgabenerfüllung sind genau das Szenario, in dem dieser Unterschied am härtesten zuschlägt, denn ein Agent, der es erneut versucht, ist ein Agent, der bei jedem erneuten Versuch den vollen Preis zahlt, und ein Modell, das pro Versuch achtmal so viel kostet, verwandelt eine Wiederholungsschleife in einen Budgetposten.

Die 560 Milliarden Parameter, ohne dass etwas heruntergeladen werden muss
Hier ist der Teil des Datenblatts von Ling 3.1 Flash, der wirklich ungewöhnlich ist, und es ist nicht die Größe.
Ling 3.1 Flash ist ein dünn besetztes Mixture-of-Experts-Modell – insgesamt 560 Milliarden Parameter, 25 Milliarden pro Token aktiv – und Artificial Analysis klassifiziert es als proprietär. Es gibt keine Gewichte, keine Lizenzdatei und kein Repository. Ein großes dünn besetztes Modell dieser Art würde normalerweise als Open-Release erscheinen, weil genau das der Rest dieser Klasse tut: GLM 5.3 Flash liefert MIT-lizenzierte Gewichte mit insgesamt 320 Milliarden Parametern und 18 Milliarden aktiven, und DeepSeek V4.1 Flash liefert MIT-lizenzierte Gewichte mit insgesamt 552 Milliarden Parametern und 16 Milliarden aktiven. Ling 3.1 Flash gehört derselben Architekturklasse und Größenordnung an, wurde aber nur als API veröffentlicht.
Diese Entscheidung hat eine Konsequenz, die die Benchmark-Zeilen nicht zeigen. Ein Modell mit 25 Milliarden aktiven Parametern muss irgendwo bereitgestellt werden, und wenn du den Checkpoint nicht selbst vorhalten kannst, kannst du nicht wählen, wo oder zu welcher Marge – du mietest die Bereitstellung des Modells durch den Anbieter. Der oben genannte Task-Preis von 5,49 $ für Terminal Bench ist nicht in erster Linie ein Artefakt des Token-Preises; er ist das, was es kostet, ein großes Sparse-Modell von der einzigen Partei zu mieten, die es ausführen kann. Die Open-Weights-Geschwistermodelle in dieser Klasse geben dir die Möglichkeit, diese Zahl selbst zu verändern.
Es schneidet auch in die andere Richtung, und dieselbe Ehrlichkeit gilt. Ein offenes Release ist nicht automatisch das bessere Produkt: Man erbt die Serving-Last, die Quantisierungsentscheidungen und die Upgrade-Tretmühle zusammen mit den Gewichten, und eine Lizenzdatei ist kein Support-Vertrag. Anthropic veröffentlicht für Claude Haiku 5.5 eine Zusage zur Außerbetriebnahme nicht vor dem 7. Oktober 2027, auf einer First-Party-API mit Systemkarte. Welches der beiden Arrangements Sie wollen, ist eine Frage Ihres Teams, nicht eines der beiden Modelle.
Wofür Ling 3.1 Flash ist
Liest man das Profil als Ganzes, beschreibt es ein kohärentes Produkt und nicht ein kompromissbehaftetes: ein großes, dünn besetztes Long-Context-Modell, das autonome mehrstufige Workflows besser abschließt als alles andere, was in dieser Preisklasse gemessen wurde, bei schwierigem Single-Shot-Reasoning unauffällig ist und dies zu einem Pauschalpreis ohne Prompt-Längen-Klippe tut. Auf AutomationBench liegt es 26 Punkte vor Claude Haiku 5.5, und sein AA-Briefcase-Score ist der einzige Punkt in diesem Vergleich, an dem es hinter dem Mittelfeld statt an der Spitze landet.
Das ist eine vertretbare Beschreibung eines Batch-Agentic-Workers: Richte ihn auf eine Warteschlange strukturierter Jobs, die jeweils abgeschlossen werden müssen, akzeptiere, dass die Aufgabe in Minuten gemessen wird, halte den Prompt lang genug, dass sich ein Schwellenwert-Schritt bestrafend auswirken würde, und schätze die Zuverlässigkeit am Ziel höher ein als die Kosten eines einzelnen Tokens. Wofür er nicht gut ist, ist das, wofür Flash-Tier-Modelle üblicherweise gekauft werden. Er akzeptiert nur Text – überhaupt keine Bildeingabe, während Claude Haiku 5.5 Text und Bilder annimmt. Seine Index-Aufgabenzeit ist kürzer, aber seine Terminal-Bench-Aufgabenzeit ist länger, und bei 0,99 $ pro abgeschlossener Index-Aufgabe gegenüber 0,21 $ gibt er viereinhalbmal so viel aus, um auf nahezu denselben Composite-Wert zu kommen.

Welche der beiden, angesichts der vorhandenen Beweise
Wenn Ihre Arbeit darin besteht, Text reinzugeben und Text herauszubekommen, und bei hohem Volumen pro Token abgerechnet wird, gewinnt Claude Haiku 5.5 diesen Vergleich in jeder Zeile, die auf einer Rechnung landet: niedrigere Index-Aufgabenkosten, niedrigere reale Aufgabenkosten im wichtigsten Benchmark für Agenten, höherer Composite-Wert, bessere Bewertungen bei langen professionellen Arbeiten, bessere Wiedergabetreue und Bildeingabe, die das andere Modell überhaupt nicht bietet.
Wenn es bei deiner Arbeit um einen unbeaufsichtigten Agenten geht, der einen mehrstufigen Workflow abschließen muss, dann erzielt Ling 3.1 Flash 26 Punkte mehr als Claude Haiku 5.5 in dem einen gemeinsamen Benchmark, der genau das misst, und das ist es wert, getestet zu werden, statt es wegen des Preises abzutun. Teste es anhand deines eigenen Traces, nicht anhand dieser Tabelle – und berechne den Preis des Tests pro abgeschlossenem Job, denn das ist die Zahl, die sich ändert, wenn ein Agent einen erneuten Versuch unternimmt.
Wenn Sie die Gewichte selbst halten müssen, ist keines dieser beiden Modelle das richtige für Sie. Ling 3.1 Flash ist proprietär und hat 560 Milliarden Parameter; Claude Haiku 5.5 ist proprietär, ohne veröffentlichte Parameterzahl. Die offenen Veröffentlichungen in dieser Klasse finden sich an anderer Stelle auf dem Board, und dieser Vergleich beginnt mit einer ganz anderen Reihe von Zeilen.
Das Composite sagt 2,31 Punkte. Der agentische Benchmark sagt 26 in die andere Richtung. Die Rate Card sagt 3× beim Input; die Kosten für abgeschlossene Aufgaben sagen 4,6× in dieselbe Richtung wie die Karte. Vier Zahlen, zwei Richtungen — weshalb die einzige verlässliche Möglichkeit, das zu klären, darin besteht, beide gegen einen Trace Ihrer eigenen Arbeit laufen zu lassen und die Kosten an den abgeschlossenen Jobs statt an den Tokens abzulesen.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
