Eine generierte Titelkarte für „Claude Haiku 5.5 vs. Xiaomi MiMo-V2.6-Flash“, mit den beiden Modellnamen auf beiden Seiten einer Trennlinie und der Bildunterschrift „Günstiger pro Token, günstiger pro Aufgabe und trotzdem nicht dieselbe Entscheidung“, über der Fußzeile „Preislisten vom Anbieter veröffentlicht; Aufgabenkosten laut Artificial Analysis.“ Das echte OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

Claude Haiku 5.5 vs. Xiaomi MiMo-V2.6-Flash: Wenn Tarifkarte und gemessene Abrechnung nicht übereinstimmen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Nimmt man die beiden Tarifkarten zum Nennwert, wirkt Claude Haiku 5.5 gegen Xiaomi MiMo-V2.6-Flash wie ein Kantersieg für das Xiaomi-Modell: 0,14 $ und 0,28 $ pro Million Tokens gegenüber 0,10 $ und 0,50 $, ein 1,8-facher Vorsprung bei der Ausgabe zu einem Pauschaltarif statt einem, der oberhalb von 100.000 Tokens ansteigt. Schaut man sich dann an, was die unabhängigen Task-Runs tatsächlich kosten, kippt die Reihenfolge – MiMo-V2.6-Flash kommt auf 0,06231 $, um eine Aufgabe abzuschließen, die der Haiku für 0,2128 $ erledigt, und doch erzielt der Haiku auf demselben Board eine um fünfzehn Prozent höhere Punktzahl und schließt die Aufgabe in einem Drittel der Wall-Clock-Zeit ab. Keine dieser vier Aussagen ist falsch; sie messen unterschiedliche Dinge. In diesem Beitrag geht es darum, welche von ihnen Ihre Rechnung vorhersagt und wo jede einzelne aufhört, nützlich zu sein.

Die beiden Tarifkarten

Beginne mit den Zahlen, die jeder Anbieter veröffentlicht, denn sie sind diejenigen, die verglichen werden, und sie sind meistens nicht die, auf die es ankommt:

• Preis — Claude Haiku 5.5 0,10 $ / 0,50 $ pro Million unter 100K Token, 0,50 $ / 2,50 $ darüber (Anthropic-Liste); Xiaomi MiMo-V2.6-Flash 0,14 $ / 0,28 $ pauschal (Anbieterliste)

• Kontextfenster — 1.000.000 Token für Claude Haiku 5.5, 1.000.000 für MiMo-V2.6-Flash, beide vom Anbieter veröffentlicht

• Maximale Ausgabe — 128.000 Tokens beim Haiku (300.000 bei Batch); nicht als separate Obergrenze für MiMo-V2.6-Flash ausgewiesen

• Architektur — für das Haiku nicht angegeben; 309 Mrd. Parameter insgesamt, davon 15 Mrd. aktiv, Mixture-of-Experts, für MiMo-V2.6-Flash (vom Anbieter veröffentlicht)

• Lizenz — geschlossen und nur über API für den Haiku; MIT für MiMo-V2.6-Flash (vom Anbieter veröffentlicht)

• Unabhängiger Index — 43,395 für Claude Haiku 5.5 gegenüber 37,884 für MiMo-V2.6-Flash (Artificial Analysis)

Drei dieser Zeilen entscheiden die meisten echten Käufe, und sie weisen in drei verschiedene Richtungen. Beim Ausgabepreis ist das Xiaomi-Modell günstiger – 0,28 $ gegenüber 0,50 $ bei kurzem Kontext. Beim Eingabepreis ist das Haiku unter 100.000 Tokens günstiger und darüber deutlich teurer. Beim Kontextfenster gibt das Xiaomi-Modell doppelt so viel Platz an. Nur eine dieser drei – die letzte – ist überhaupt eine Aussage über Fähigkeiten, und die Pauschaltarif-Stufe des Haiku bei 100.000 Tokens bedeutet, dass der Preisvergleich eine Nahtstelle hat, die ein einzelnes Zahlenpaar verbirgt.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, context window 1,000,000 tokens, weights closed and API-only, cost per task $0.2128, seconds per task 426. Right column Xiaomi MiMo-V2.6-Flash: input price (flat) $0.14 per million, output price (flat) $0.28 per million, context window 1,000,000 tokens, weights open under MIT, cost per task $0.0623, seconds per task 1,320. Footer reads 'Task costs and timings per Artificial Analysis; prices vendor-published.' The real OrcaRouter logo is composited bottom-right.

Die gemessene Rechnung

Preislisten bepreisen Tokens. Arbeit kostet Geld. Artificial Analysis lässt beide Modelle dieselbe Aufgaben-Suite durchlaufen und veröffentlicht, was es tatsächlich gekostet hat, jede Aufgabe zu erledigen – eine andere Größe als der Preis pro Token und häufig eine andere Rangfolge:

• Kosten pro Aufgabe — MiMo-V2.6-Flash 0,06231 $ vs. Claude Haiku 5.5 0,2128 $

• Ausgabe-Token pro Aufgabe — MiMo-V2.6-Flash 77.792 vs. Claude Haiku 5,5 162.164

• Wall-Clock-Zeit pro Aufgabe — MiMo-V2.6-Flash 1.320,08 s vs. Claude Haiku 5.5 426,26 s

• Intelligenz-Index — Claude Haiku 5.5 43.395 vs. MiMo-V2.6-Flash 37.884

• Terminal-Bench Hard — Claude Haiku 5.5 0,329 vs. MiMo-V2.6-Flash 0,227

Alle fünf Zahlen stammen von Artificial Analysis und wurden Anfang Oktober 2026 den eigenen Modellseiten des Boards entnommen; sie sind die Zahlen, die man verwenden sollte, wenn eine Entscheidung einer Überprüfung durch jemanden standhalten muss.

Die Kosten-pro-Aufgabe-Lücke ist größer, als die Preisliste vermuten lässt, und der Grund dafür ist die zweite Zeile. Claude Haiku 5.5 gibt 162.164 Ausgabe-Tokens aus, um eine Aufgabe zu erledigen, die MiMo-V2.6-Flash in 77.792 abschließt – rund 2,1-mal so viele Tokens, vor allem, weil es standardmäßig ausgiebig nachdenkt. Ein Modell, das pro Ausgabe-Token 1,8-mal günstiger ist und pro Aufgabe weniger als halb so viele davon ausgibt, ist am Ende nicht 1,8-mal günstiger; es ist bei dieser speziellen Suite um fast eine Größenordnung günstiger. Das ist die wichtigste einzelne Sache auf dieser Seite, und keine Preisliste irgendwo veröffentlicht sie.

Die Wall-Clock-Zeile verläuft andersherum, und darüber sollte man ehrlich sein. MiMo-V2.6-Flash brauchte 1.320 Sekunden pro Aufgabe gegenüber 426 bei Haiku – dreimal so lange, trotz einer höheren gemessenen Ausgabegeschwindigkeit von 56,69 Tokens pro Sekunde, weil das Reasoning von Haiku in dieser Suite nicht so der Engpass ist, wie es die reine Token-Rate vorhersagen würde. Wenn eine Workload latenzgebunden statt kostenbegrenzt ist, ist das günstige Modell nicht automatisch das richtige, und das unabhängige Board ist der einzige Ort, an dem eine dieser beiden Zahlen existiert.

A screenshot of the Artificial Analysis model page for MiMo-V2.6-Flash, marked 'Open weights model' and 'Released September 2026', showing its Intelligence Index rank of #8 of 117, a speed measured at 56.7 output tokens per second, and the comparison summary.

Wo die fünfzehn Punkte tatsächlich liegen

43,395 gegenüber 37,884 ist ein Abstand von fünfzehn Prozent im Intelligence Index und das stärkste Argument für Haiku in diesem Duell. Ob das eine Rolle spielt, hängt ganz von der Aufgabe ab. Bei Terminal-Bench Hard liegen die beiden bei 0,329 und 0,227 – ein größerer relativer Abstand, und einer, der auf der agentischen, mehrstufigen Seite des Feldes liegt, wo sich ein fünfzehnprozentiger Unterschied im Index tendenziell zu einem deutlich größeren Unterschied bei der Aufgabenbewältigung auswächst. Bei den allgemeinen Reasoning- und Wissens-Sub-Benchmarks liegen die beiden näher beieinander, als es der Schlagzeilen-Index vermuten lässt, und MiMo-V2.6-Flash liegt bei mehreren davon vorn.

Die praktische Lesart: Am unteren Ende der Schwierigkeitskurve sind die beiden Modelle austauschbar, und der Kostenunterschied sollte entscheiden. Am oberen Ende – Agenten mit langem Zeithorizont, Codebasen, alles, bei dem eine fehlgeschlagene Aufgabe erneut ausgeführt werden muss – sind die fünfzehn Punkte des Haiku der Unterschied zwischen einer Aufgabe, die abgeschlossen wird, und einer Aufgabe, die dasselbe Geld zweimal kostet, und der Kostenvorteil pro Aufgabe des günstigen Modells kann sich auf eine Weise umkehren, die der Durchschnitt des Boards Ihnen nicht zeigen kann. Dies ist der Fall, in dem Sie Ihre eigene Evaluation durchführen müssen, statt den Index von jemand anderem zu lesen, weil kein veröffentlichter Durchschnitt es auflöst.

Was die MIT-Lizenz wert ist

MiMo-V2.6-Flash wird unter MIT veröffentlicht – der am wenigsten restriktiven der offenen Lizenzen, ohne Obergrenze für die kommerzielle Nutzung und ohne Share-Alike-Klausel. Das räumt mehr Rechte ein als die Qwen Community Licence und bedeutet, dass die 309B/15B-MoE-Gewichte von jedem, der möchte, selbst gehostet, feinabgestimmt und weiterverbreitet werden können. Für ein Team, dessen Einschränkung darin besteht, dass die Inferenz auf eigener Hardware stattfindet, oder dessen Volumen hoch genug ist, dass der Besitz eigener GPUs besser ist als das Mieten von Tokens, ist dies keine Fußnote – es ist die einzige Zeile im Vergleich, die zählt, denn Claude Haiku 5.5 kann von Ihnen überhaupt nicht betrieben werden.

Das verändert auch das Ausfallprofil. Ein geschlossenes Modell, das von einem Anbieter und dessen Cloud-Partnern bereitgestellt wird, fällt aus, wenn diese ausfallen; bei einem MIT-lizenzierten Modell mit mehreren unabhängigen Hosts kann zwischen ihnen ein Failover durchgeführt werden, sofern etwas das Failover übernimmt. Keines davon ist ein Grund, MiMo-V2.6-Flash für ein Team zu wählen, das eine API und sonst nichts will. Beides ist ausschlaggebend für ein Team, das das nicht will.

Anbieteraussagen, die es wert sind, selbst überprüft zu werden

Die MiMo-Reihe stammt von Xiaomi, und Xiaomi nennt im Launch-Material eigene Geschwindigkeits- und Qualitätswerte. Das sind Herstellerangaben, die zum Zeitpunkt des Verfassens nicht reproduziert wurden, und das unabhängige Board misst das Modell derzeit unterhalb dessen, wo die Darstellung des Herstellers es verorten würde – 37,884 im Index und 0,227 bei Terminal-Bench Hard gegenüber 0,329 für das Haiku. Das ist kein Vorwurf; es ist die normale Kluft zwischen dem eigenen Testaufbau eines Herstellers und dem eines Dritten, und genau deshalb sollte jedes Mal, wenn eine Zahl wiederholt wird, gekennzeichnet werden, welche von wem stammt.

Die Prüfung, die sich bei deinem eigenen Traffic lohnt, kostet einen Nachmittag und klärt die Frage besser als jeder Index. Schick dieselben zwanzig Aufgaben mit deinen eigenen Prompts durch beide Modelle, protokolliere pro Aufgabe und Modell die Input-Tokens, Output-Tokens und die Wanduhrzeit und multipliziere das Ganze mit den obigen Sätzen. Die vier Zahlen, die den Ausschlag geben, sind allesamt Dinge, die du messen kannst: Tokens rein, Tokens raus, Sekunden und ob die Aufgabe erfolgreich war. Die Kosten-pro-Aufgabe-Zahl auf dem unabhängigen Board ist das Bild für eine generische Testsuite; deine wird abweichen, und der Unterschied zwischen beiden ist meistens die Weitschweifigkeit – genau das, was die Preisliste verschweigt. Wenn das standardmäßige Reasoning von Haiku dir Aufgabenabschlüsse erkauft, für die du sonst mit Wiederholungen bezahlen würdest, ist es bei 3,4-fachem Preis pro Aufgabe günstig. Wenn nicht, bezahlst du für Tokens, die die Antwort nicht verändert haben.

Beides über einen Endpoint abrufen

Weder Claude Haiku 5.5 noch Xiaomi MiMo-V2.6-Flash werden von OrcaRouter angeboten – für diese sind die eigene API des Anbieters und mehrere Drittanbieter-Plattformen die Bezugsquellen. Was wir betreiben, ist die umgebende Riege: qwen/qwen3.8-flash für 0,15 $ und 0,47 $ pro Million und z-ai/glm-5.3-flash für 0,15 $ und 0,50 $, beide zum Listenpreis des Anbieters, mit demselben Schlüssel und derselben Abrechnung wie ein Katalog mit über 200 Modellen mit durchgereichten Preisen und automatischem Failover.

Das ist für diesen Vergleich auf ganz spezifische Weise relevant: Wenn die beiden Modelle, zwischen denen Sie wählen, genau diejenigen sind, die Sie nicht routen können, entscheidet darüber meist ein direkter Parallelvergleich mit echtem Traffic – das bedeutet, sie neben den Modellen verfügbar zu halten, die Sie tatsächlich routen, ohne einen zweiten Vertrag oder ein zweites SDK für eines von beiden. Stellen Sie den Kandidaten auf den Produktionspfad, mit einem funktionierenden Modell dahinter als Fallback, lassen Sie die Anfrage an dasjenige gehen, das die Routing-Schicht auswählt, und lassen Sie Ihre eigenen Token-Logs die Kosten-pro-Aufgabe-Zahl liefern, die Ihnen die Rate Cards verweigert haben. Die Suite des unabhängigen Boards ist ein Proxy; Ihre Workload ist die Messung.

A screenshot of the OrcaRouter models index, headed 'Models — 207 models' with the line '16 providers: one API key, one bill', a filter row for input modalities, context length, input price, status, series and supported parameters, and the first steps of the 'How to call any model' walkthrough.

Der Anruf.

Wenn die Arbeitslast durch hohes Volumen, kurze Ausgaben und Toleranz gegenüber gelegentlichen Wiederholungen geprägt ist, ist Xiaomi MiMo-V2.6-Flash das günstigere Modell – und das mit einem größeren Abstand, als die Tarifkarte suggeriert: 0,06231 $ pro Aufgabe gegenüber 0,2128 $ – und die MIT-Lizenz bietet Ihnen eine Ausstiegsluke, die der Haiku nicht hat. Ist die Arbeitslast langfristig angelegt und agentisch, sind die fünfzehn Indexpunkte und die dreimal schnellere Aufgabenerledigung von Claude Haiku 5.5 den Mehrpreis wert, und die Kostendifferenz verringert sich oder kehrt sich um, sobald Wiederholungen mitgezählt werden.

Das Einzige, was man nicht tun sollte, ist, allein anhand der Preisliste auszuwählen. Zwei Modelle hier liegen im Preis pro Token um höchstens den Faktor zwei auseinander und pro fertiggestellter Aufgabe um eine Größenordnung, und nur eine dieser Zahlen steht auf der Seite, die der Anbieter Ihnen zeigt.

ein Katalog mit über 200 Modellen

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert