Qwen 3.8 vs Claude Fable 5: Alibabas 2.4T-Flaggschiff hat endlich einen Preis
Guides & Insights

Qwen 3.8 vs Claude Fable 5: Alibabas 2.4T-Flaggschiff hat endlich einen Preis

Autor

jinhao song

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Als Alibaba Qwen3.8-Max am 19. Juli 2026 in Shanghai vorstellte, hob es eine Behauptung stärker hervor als jede andere: dieses Modell mit 2,4 Billionen Parametern ist nahe am Spitzenniveau und liegt nur hinter Claude Fable 5. Damals war das nicht zu bewerten. Es gab keine Preisliste, keine Benchmark-Tabelle und keine Lizenz – nur eine Positionierungsaussage.

Am 3. August 2026 wurde Qwen3.8-Max allgemein verfügbar, und der Vergleich hat damit endlich auf beiden Seiten Substanz. Alibaba veröffentlichte Preise von $2 / $6 pro Million Tokens und eine Benchmark-Tabelle mit echten Zahlen. Fable 5 steht weiterhin an der Spitze des unabhängigen Artificial Analysis Intelligence Index mit geprüften 95,0 % bei SWE-bench Verified. Die Frage spitzt sich also zu: Hält ‚nur von Fable 5 übertroffen' jetzt, wo Qwen seine Zahlen gezeigt hat, stand?

Ein Hinweis für Entwickler — der schnellste Weg, eine solche Behauptung zu klären, ist, beide Modelle mit eigenen Prompts zu testen. OrcaRouter stellt über 200 Modelle hinter einem OpenAI-kompatiblen Endpoint bereit, sodass du Qwen 3.8 Max gegen Fable 5 bei derselben Aufgabe antreten lassen kannst, ohne zwei SDKs einzubinden.

TL;DR verdict. Qwen3.8-Max at GA is a much stronger challenger than its preview suggested — and dramatically cheaper. At $2 / $6 flat across 1M tokens it undercuts Fable 5's $10 / $50 by roughly 5× on input and 8× on output, and its self-reported numbers are frontier-shaped (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, FrontierSWE 73.5 against a predecessor's 40.7). But Fable 5 keeps the crown for one reason that has not changed since July: it is the only one of the two with a referee. Fable's ~60 Intelligence Index and 95.0% SWE-bench are third-party audited; every Qwen figure is Alibaba's own, and neither Artificial Analysis nor LMArena has posted a Qwen3.8-Max score. Fable 5 wins on proof; Qwen 3.8 wins decisively on price and, once the weights land, on openness.

Wichtige Erkenntnisse

Qwen3.8-Max ist seit dem 3. August 2026 allgemein verfügbar — keine Vorschau mehr. Veröffentlichte Preisliste, OpenAI- und DashScope-kompatible API, Benchmark-Tabelle des Anbieters.

Der Preisunterschied ist enorm: Qwen liegt bei 2 $ / 6 $ pro 1 M, während Fable 5 bei 10 $ / 50 $ liegt. Das ist etwa das 5-fache beim Input und das 8-fache beim Output, und Qwens Preis ist über den gesamten 1M-Token-Kontext konstant, ohne Aufschlag für lange Prompts.

Fable 5 bleibt die einzige geprüfte Seite.~60 im Artificial Analysis Intelligence Index (#1) und 95,0 % SWE-bench Verified, gegenüber Qwen3.8-Max, der noch von keinem unabhängigen Bewerter bewertet wurde.

Die selbst gemeldeten Zahlen von Qwen sind wirklich stark: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 — aber sie stammen vom Hersteller, und Labore veröffentlichen nur die Benchmarks, bei denen sie gewinnen.

Alibaba hat nie eine Anzahl aktiver Parameter veröffentlicht, daher sagt die 2.4T-Schlagzeile sehr wenig über die tatsächlichen Bereitstellungskosten aus. Auch die Architektur von Fable 5 ist nicht offengelegt – was Transparenz betrifft, ist keine Seite sauber.

Offene Gewichte werden noch in dieser Woche versprochen, und ein Qwen3.8-27B, das Berichten zufolge mit ~17 GB VRAM läuft. Fable 5 ist dauerhaft geschlossen und ausschließlich über eine API verfügbar.

Genauigkeitshinweis: Alle Qualitätszahlen für Qwen3.8-Max werden von Alibaba angegeben und wurden nicht unabhängig repliziert. Die Zahlen für Fable 5 stammen von Artificial Analysis und Anthropic und können je nach Tracker abweichen. Die Preisgestaltung von Qwen basiert auf der GA-Preisliste von Alibaba Model Studio und nicht mehr auf dem temporären Vorschaurabatt, der im Juli galt.

Die technischen Daten und der Preis, Seite an Seite

Hier sind die harten Daten, jede Zahl mit ihrer Quelle versehen.

• Hersteller / Status — Qwen3.8-Max: Alibaba; GA (3. August 2026); Claude Fable 5: Anthropic; GA-Flaggschiff

• Architektur — Qwen3.8-Max: ~2,4T insgesamt, sparse MoE (aktive Parameter weiterhin nicht offengelegt); Fable 5: Geschlossen; Architektur nicht offengelegt

• Kontextfenster — Qwen3.8-Max: 1M Tokens (983.616 mit Denken; maximale Ausgabe 131.072); Fable 5: Flaggschiff für lange Kontexte

• AA Intelligence Index — Qwen3.8-Max: Noch nicht bewertet; Fable 5: ~60 — #1 (Artificial Analysis)

• SWE-bench Verified — Qwen3.8-Max: Nicht gemeldet (Alibaba meldet stattdessen FrontierSWE 73.5); Fable 5: 95.0% (Anthropic / buildfastwithai)

• Vom Anbieter gemeldete Stärken — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, PaperBench 93.0, OSWorld-Verified 86.1 (alle von Alibaba gemeldet); Fable 5: auditiert, insgesamt #1

• Preisgestaltung (Eingabe / Ausgabe) — Qwen3.8-Max: $2,00 / $6,00 pro 1M, pauschal über 1M Kontext; Cache-Eingabe $0,25; Fable 5: $10 / $50 pro 1M

• Offene Gewichte — Qwen3.8-Max: Noch diese Woche versprochen (noch keine Lizenz); Fable 5: Nein — geschlossen / nur API

• Multimodalität — Qwen3.8-Max: Text, Bild, Video rein → Text raus; Fable 5: Multimodales Flaggschiff

Zwei Dinge rahmen den gesamten Vergleich ein, und beide änderten sich am 3. August.

Zunächst ist die Preisspalte nun das auffälligste Element auf der Seite. Im Juli war Qwens Kostenvorteil ein Rabattgutschein — 90 % Rabatt auf Credits, befristet, ohne einen Preis pro Token als Planungsgrundlage. Jetzt ist er eine Preisliste, und der Abstand ist strukturell, nicht aktionsbedingt. Bei einem Output-Preis von 6 $ gegenüber 50 $ bei Fable können Sie für den Preis eines einzigen Fable-Aufrufs etwa acht Qwen-Aufrufe ausführen. Für jede Arbeitslast, bei der Sie für Volumen bezahlen und nicht für die einzelne, schwierigste Antwort, verändert dieses Verhältnis die Architektur dessen, was Sie bauen.

Zweitens, die Benchmark-Spalte ist nicht mehr leer – aber sie ist auch nicht vergleichbar. Das ist die Feinheit, die am meisten zählt. Alibaba meldet FrontierSWE 73,5; Anthropic meldet SWE-bench Verified 95,0 %. Das sind verschiedene Benchmarks mit unterschiedlichen Schwierigkeitskurven, und 73,5 gegen 95,0 zu setzen, als ob sie dasselbe messen würden, wäre schlicht irreführend. Was wir sagen können, ist enger und ehrlicher: Der Wert von Fable 5 wurde von einem Dritten unter Bedingungen erzeugt, die andere einsehen können, und der von Qwen wurde von Alibaba auf einer Testumgebung erzeugt, die niemand sonst ausgeführt hat. Bis Artificial Analysis oder LMArena einen Qwen3.8-Max-Score veröffentlicht, ist die korrekte Einschätzung unverändert seit Juli — plausibel nah, aber weiterhin unbewiesen.

Was die Preisdifferenz tatsächlich einbringt

Viele abstrakte Beispiele sind weniger nützlich als ein ausgearbeitetes Beispiel, hier ist also eines. Nehmen Sie einen Code-Review-Agenten, der 150.000 Token an Repository-Kontext sendet und 6.000 Token an Review pro Aufruf generiert.

Qwen3.8-Max: 0,15 M × 2 $ = 0,30 $, plus 0,006 M × 6 $ = 0,036 $. ≈ 0,34 $ pro Aufruf.

Claude Fable 5: 0,15M × 10 $ = 1,50 $, plus 0,006M × 50 $ = 0,30 $. ≈ 1,80 $ pro Anruf.

• Bei 2.000 Aufrufen pro Tag: Qwen ≈ $672/Tag; Fable ≈ $3.600/Tag. Über einen Monat sind das grob $20.000 gegenüber $108.000.

• Mit Prompt-Caching in einem stabilen Repo-Kontext senkt Qwens gecachter Input bei 0,25 $/1M die Input-Seite von 0,30 $ auf unter 0,04 $, was den Aufruf auf ≈ 0,08 $ bringt — etwa 22× günstiger als Fable pro Aufruf.

Das ist keine marginale Ersparnis; es ist der Unterschied zwischen einem Reviewer für jeden Pull-Request und einem nur für die riskanten. Und Qwens Flatrate-Kontext verstärkt den Effekt, je größer die Prompts werden: Da Alibaba keinen Aufpreis für lange Prompts erhebt, kostet das Durchschieben eines 900.000-Token-Kontexts pro Token genauso viel wie ein 5.000-Token-Kontext.

Das ehrliche Gegengewicht ist, dass der Preis pro Token nicht der Preis pro gelöste Aufgabe ist. Wenn Fable 5 ein Problem in einem Durchlauf löst, während ein günstigeres Modell drei Versuche plus menschliche Korrektur braucht, kann das günstigere Modell in der Summe teurer sein — und bei der schwierigsten Denkarbeit ist das geprüfte #1-Ranking von Fable 5 der beste verfügbare Beleg, dass es in einem Durchlauf tatsächlich mehr löst. Das Kostenargument für Qwen ist bei hochvolumigen, fehlertoleranten Arbeitslasten am stärksten und bei niedrigvolumigen, risikoreichen am schwächsten.

Beweis, und warum es dieses Matchup immer noch entscheidet

Der am häufigsten zitierte Praxisbeleg für Qwen3.8-Max stammt aus einem Review aus der Vorschauzeit (thomas-wiegold.com), das das Modell durch vier reale Builds schickte. Die Ergebnisse waren wirklich beeindruckend: Qwen meisterte eine Go-Poker-Simulation in einem einzigen Durchgang – erst das dritte Modell überhaupt, das diesen Prompt in einem einzigen Durchgang schaffte, neben Fable 5 und Grok 4.5 – und bei einem Prompt für eine Kaffeeröster-Website erzeugte es die beste Ausgabe, die der Tester je bei diesem Test gesehen hatte, und fügte aus purer Gründlichkeit einen nicht angeforderten Warenkorb, einen Großhandelsbereich und eine Instagram-Integration hinzu.

Der Haken war die Geschwindigkeit: 30+ Minuten auf der Website und 1 Stunde 20 Minuten bei der Pokersimulation, was es zum langsamsten Modell machte, das dieser Rezensent je verwendet hatte. Diese Feststellung benötigt nun eine Einschränkung, die sie im Juli nicht brauchte. Gemessen wurde auf der Preview-Infrastruktur, von einem Rezensenten, bei ungewöhnlich langen Agentenläufen. Das GA-Serving ist ein anderes System. Was auch immer das wert ist, OrcaRouters eigene 7-Tage-Telemetrie zeigt derzeit eine p50-Zeit bis zum ersten Token von 1,64 Sekunden für Qwen3.8-Max — eine Messung aus erster Hand, auch wenn TTFT und End-to-End-Durchsatz bei einstündigen Builds unterschiedliche Größen sind. Die ehrliche Position ist, dass der Befund zur Langsamkeit der Preview erneut getestet werden sollte, anstatt als aktuelle Tatsache wiederholt zu werden.

Was sich nicht geändert hat, ist die Asymmetrie der Beweislage. Alibabas GA-Benchmark-Tabelle ist eine echte Verbesserung gegenüber dem Veröffentlichen von nichts, aber sie bleibt dennoch ein Hersteller-Artefakt: Labore wählen aus, welche Benchmarks sie melden, und Alibabas eigene schwächste gemeldete Zahl – IFBench 82.8, Instruktionsbefolgung – stimmt genau mit der Beschwerde aus der Vorschau überein, dass das Modell zu viel liefert und den Rahmen ignoriert. Fable 5 wird hingegen von einem Bewerter bewertet, der kein Eigeninteresse am Ergebnis hat. Bei der Frage „welches Modell Arbeiten bewältigt, die ich mir nicht leisten kann, falsch zu machen“, ist dieser Unterschied keine Formalität. Er ist die gesamte Grundlage für die Wahl.

Offenheit: die Achse, auf der Qwen dauerhaft gewinnen könnte

Fable 5 wird nie selbst hostbar sein. Qwen3.8-Max könnte es sein, und Alibaba sagt jetzt, dass die Gewichte innerhalb der Woche eintreffen. Aber zwei Einschränkungen verdienen gleiches Gewicht.

Der erste Punkt ist rechtlicher Natur: Es gibt immer noch keinen Lizenztext und keine Modellkarte. „Open weights coming" ist keine Gewährung kommerzieller Rechte, solange es kein Dokument zu lesen gibt, und die Lizenz wird entscheiden, ob die Veröffentlichung überhaupt in einem Produkt verwendbar ist.

Der zweite Punkt ist physischer Natur. Ein 2.4T-Modell benötigt bei 4-Bit-Quantisierung grob 1,2 TB, verglichen mit etwa 141 GB pro H200 – also acht oder mehr High-End-Beschleuniger, bevor man auch nur einen Token ausliefert. Und da Alibaba die Anzahl der aktiven Parameter weiterhin nicht offengelegt hat, kann man nicht einmal den Durchsatz abschätzen, den diese Ausgabe erkaufen würde. Für fast jedes Team ist Selbsthosting des Flaggschiffs keine realistische Option.

Was Qwen3.8-27B – das ebenfalls angekündigt wurde, ebenfalls offene Gewichte erhält und Berichten zufolge in ~17 GB VRAM läuft – zur praktisch wichtigeren Veröffentlichung macht. Wenn Ihr Grund, Qwen gegenüber Fable 5 zu bevorzugen, Datenresidenz oder On-Premise-Kontrolle statt roher Leistungsfähigkeit ist, dann ist 27B das Modell, das genau das liefert. Der Vergleich des 2.4T-Flaggschiffs mit Fable 5 in Bezug auf Offenheit ist größtenteils theoretisch; der Vergleich des 27B in Bezug auf Offenheit ist konkret.

FAQ

Ist Qwen 3.8 besser als Claude Fable 5?

Nicht angesichts der vorhandenen Evidenz. Alibabas GA-Benchmark-Tabelle ist stark (GPQA Diamond 92,6, Terminal-Bench 2.1 86,6), aber jede Zahl ist selbstberichtet, und kein unabhängiger Bewerter hat das Modell bewertet. Fable 5 besitzt einen auditierten Intelligence Index von ~60 (#1) und 95,0 % SWE-bench Verified. Fable 5 führt bei den Belegen; Qwen 3.8 führt überwältigend beim Preis.

Ist die Behauptung "nur hinter Fable 5" wahr?

Es bleibt Alibabas eigene Positionierung. GA brachte eine Benchmark-Tabelle, aber keine Verifizierung durch Dritte – Artificial Analysis und LMArena sind beide weiterhin unbewertet. Zum Vergleich: Der Vorgänger Qwen3.7-Max erreichte 46 im AA Intelligence Index gegenüber Fable 5 mit ~60, sodass die Behauptung einen sehr großen Generationssprung erfordert, um buchstäblich wahr zu sein.

Wie viel günstiger ist Qwen 3.8 als Fable 5?

Erheblich, und es ist jetzt ein echter Preis und kein Rabatt. Qwen3.8-Max kostet 2 $ / 6 $ pro 1M Token, während Fable 5 bei 10 $ / 50 $ liegt – etwa 5× günstiger beim Input und 8× beim Output. Qwens Preis ist außerdem über den gesamten 1M-Kontext hinweg konstant, und zwischengespeicherter Input zu 0,25 $/1M macht wiederkehrende Kontext-Workloads noch günstiger.

Hat Qwen 3.8 Max die Vorschauphase verlassen?

Ja. Es wurde am 3. August 2026 allgemein verfügbar, mit einer veröffentlichten Preisliste und einem OpenAI- und DashScope-kompatiblen Endpunkt. Die Qoder-Credits-Kampagne und das im Juli kursierende Framing des Previews mit 90 % Rabatt beschreiben nicht mehr, wie das Modell verkauft wird.

Ist Qwen 3.8 immer noch das langsamste Modell, wie frühe Rezensionen sagten?

Diese Erkenntnis stammt von einem einzigen Reviewer auf Preview-Infrastruktur, auf der einstündige Agentic-Builds ausgeführt wurden, und sie sollte gegen GA-Serving erneut getestet werden, statt als aktuelle Tatsache behandelt zu werden. Die 7-Tage-Telemetrie von OrcaRouter zeigt eine p50-Time-to-First-Token von 1,64 Sekunden, wobei dies die First-Token-Latenz misst und nicht den Durchsatz bei sehr langen Builds.

Kann ich Qwen 3.8 selbst hosten, anstatt für Fable 5 zu bezahlen?

Noch nicht, und wahrscheinlich nicht das Flaggschiff. Zwar sind die Gewichte für diese Woche versprochen, aber es gibt immer noch keine Lizenz; und bei ~1,2 TB in 4-Bit bräuchte man acht oder mehr GPUs der H200-Klasse. Das gleichzeitig angekündigte Qwen3.8-27B, Berichten zufolge ~17 GB VRAM, ist der realistische Weg zum Selbsthosting. Fable 5 ist dauerhaft geschlossen.

Welches sollte ich heute verwenden?

Fable 5 für Aufgaben, bei denen eine falsche Antwort teuer ist und Sie geprüfte Zuverlässigkeit benötigen — anspruchsvolles Denken, risikoreiche Produktionspfade. Qwen3.8-Max für umfangreiche Aufgaben, bei denen sich der 8-fache Ausgabe-Preis-Vorteil auszahlt: Massen-Code-Review, Analyse langer Dokumente, alles, bei dem Sie Verifizierung tolerieren können. Viele Teams sollten beide einsetzen und nach Aufgabenwert weiterleiten.

Fazit

Qwen 3.8 vs Claude Fable 5 ist ein grundlegend anderer Vergleich als noch vor zwei Wochen. Qwen3.8-Max ist keine Vorschau mit einem Gutschein mehr — es ist ein allgemein verfügbares Modell mit einer Preisliste, die Fable 5 bei der Eingabe um das 5-fache und bei der Ausgabe um das 8-fache unterbietet, konstant über eine Million Tokens, mit selbst gemeldeten Zahlen, die wie Spitzenwerte aussehen, und einem Codierungssprung gegenüber seinem Vorgänger, der bemerkenswert wäre, wenn er sich replizieren lässt.

Aber Fable 5 behält die Krone, und zwar aus genau dem Grund, aus dem es sie im Juli behalten hat: Es ist die Seite mit einem Schiedsrichter. Ein geprüfter #1 Intelligence Index und 95,0 % SWE-bench Verified sind Behauptungen, die jemand anderes überprüft hat. Alibabas Tabelle, so stark sie auch sein mag, ist Alibabas eigene. Beobachten Sie zwei Ereignisse: den ersten unabhängigen Intelligence-Index-Wert für Qwen3.8-Max und das Erscheinen der Gewichte mit beigefügter Lizenz. Wenn beides zu Qwens Gunsten ausgeht, ist „nur hinter Fable 5“ kein Marketing mehr. Bis dahin ist die vernünftige Antwort nicht, einen Sieger zu küren, sondern nach dem aufzuteilen, was auf dem Spiel steht — Fable, wo man sich keine Fehler leisten kann, Qwen, wo man sich keine hohen Kosten leisten kann — und beide mit den eigenen Prompts zu testen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Sie betreiben eine Inferenz-Plattform? Bringen Sie Ihre Modelle auf OrcaRouter.

Kontaktieren Sie uns

Community beitreten

DiscordEmailXGitHubYouTube