
Qwen3.8-LiveTranslate vs Qwen 3.8: Eine Namenskollision, kein fairer Kampf
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Suchen Sie nach einem dieser Modelle, wird Ihnen das andere angezeigt. Qwen3.8-LiveTranslate, veröffentlicht am 19. September 2026, und Qwen3.8-Max — das Modell, das die meisten meinen, wenn sie „Qwen 3.8" ohne Suffix schreiben, allgemein verfügbar seit dem 3. August 2026 und am 2. September als Qwen3.8-Max-0902 aktualisiert — teilen ein Generationspräfix und sonst so gut wie nichts. Eines ist ein Simultandolmetsch-System, das Audio entgegennimmt und übersetztes Audio und Text zurückgibt, abgerechnet über einen WebSocket unter der ID qwen3.8-livetranslate-flash-realtime. Das andere ist ein generalistisches Sparse-Mixture-of-Experts-Modell mit 2,4 Billionen Parametern und einem Kontextfenster von 1 Mio. Token, das überhaupt nichts hören kann. Sie direkt gegeneinander antreten zu lassen, ist ein Kategorienfehler, und die Tatsache, dass so viele Menschen bei diesem Fehler landen, ist die eigentliche Geschichte hier: Der Anbieter liefert inzwischen mindestens vier verschiedene Dinge unter dem Namen Qwen 3.8 aus, und das Namensschema verrät Ihnen nicht, welches davon Sie wollen.
Was jedes einzelne tatsächlich ist
Die Qwen-3.8-Generation wurde in der zweiten Hälfte des Jahres 2026 in Schichten ausgeliefert, und diese Schichten sind nicht austauschbar.
Qwen3.8-Max ist das gehostete Flaggschiff: ein Sparse-MoE-Modell mit insgesamt rund 2,4 Billionen Parametern und etwa 95 Milliarden aktiven pro Forward-Pass, einem Kontext von 1 Million Token sowie Text-, Bild- und Videoeingabe mit rein textlicher Ausgabe. Der Preis liegt bei 2,00 US-Dollar pro Million Eingabe-Token und 6,00 US-Dollar pro Million Ausgabe-Token, wobei Cache-Lesevorgänge 0,250 US-Dollar pro Million kosten. Vom Anbieter gemeldete Werte ergeben 86,6 bei Terminal-Bench 2.1, 92,6 bei GPQA Diamond, 67,7 bei SWE-bench Pro und 43,6 bei Humanity's Last Exam.
Qwen3.8-2.4T-A95B ist die Open-Weights-Veröffentlichung derselben Generation, veröffentlicht am 12. August 2026: 512 geroutete Experten über 92 Schichten hinweg, wobei 69 dieser Schichten lineare Attention nutzen, und rund 4,89 TB an Gewichten. Es ist das Modell, das die meisten mit „Qwen 3.8" meinen, wenn sie davon sprechen, selbst etwas zu betreiben, statt eine API aufzurufen.
Qwen3.8-27B ist der kleine offene Checkpoint in derselben Familie, und Qwen3.8-LiveTranslate ist der Spezialist – ein Interpreter mit Interleave-Architektur, der auf einem Hybrid-MoE-Thinker-Talker-Design basiert, wobei 60 Quellsprachen erkannt werden und 29 für die gesprochene Ausgabe verfügbar sind.
Die Achse, die sie trennt, ist nicht die Größe. Sie ist die Modalität. Qwen3.8-Max hat keinen Audioeingabepfad und überhaupt keine Audioausgabe. Qwen3.8-Max zu bitten, ein Live-Gespräch zu interpretieren, ist keine Frage eines besseren Promptings; die Fähigkeit ist im Modell nicht vorhanden.
Der Spec-Kontrast
Nebeneinandergelegt überschneiden sich die beiden Modelle in kaum einer Dimension, die für einen Käufer von Bedeutung ist:
• Hauptaufgabe — Qwen3.8-LiveTranslate: simultane Sprach-zu-Sprach-Dolmetschung. Qwen3.8-Max: allgemeines Reasoning, Coding, agentische und multimodale Textarbeit.
• Eingabemodalität — Qwen3.8-LiveTranslate: Audio und Bild. Qwen3.8-Max: Text, Bild und Video.
• Ausgabemodalität — Qwen3.8-LiveTranslate: Text und synthetisiertes Audio. Qwen3.8-Max: nur Text.
• Kontextfenster — Qwen3.8-LiveTranslate: 53.248 Token (49.152 Eingabe / 4.096 Ausgabe). Qwen3.8-Max: 1.000.000 Token.
• Gewichte — Qwen3.8-LiveTranslate: geschlossen, nur API. Qwen3.8-Max: gehostet, mit dem offenen Schwestermodell Qwen3.8-2.4T-A95B, das in derselben Generation veröffentlicht wurde.
• Ratenbegrenzungen — Qwen3.8-LiveTranslate: 10 Anfragen und 100.000 Tokens pro Minute. Qwen3.8-Max: Standard-Durchsatz im Hosting, keine Echtzeit-Obergrenze pro Anfrage.
Die Kontext-Diskrepanz ist die, die die Leute überrascht. Qwen3.8-Max hat eine Million Token Kontext; der Interpreter hat etwa fünf Prozent davon. Aber ein Echtzeit-Interpreter braucht keinen langen Kontext – er braucht ein kurzes Gedächtnis und ein sehr schnelles. Seine Eingabeobergrenze von 49.152 Token ist darauf ausgelegt, die letzten paar Minuten eines Gesprächs mitzuführen, um Namen und Terminologie konsistent zu halten, was genau die Aufgabe ist, die die „Long-Context-Disambiguation“ erfüllt. Den Interpreter anhand seiner Kontextzahl zu beurteilen, ist wie einen Rennmotor anhand seines Tanks zu beurteilen.

Warum der Preisvergleich eine Falle ist
Auf Pro-Million-Token-Basis wirkt der Dolmetscher dramatisch teurer als das Flaggschiff: 7,50 $ pro Million Audio-Eingabe-Token gegenüber 2,00 $ pro Million Text-Eingabe-Token und 30,00 $ pro Million Audio-Ausgabe gegenüber 6,00 $ pro Million Text-Ausgabe.
Dieser Vergleich ist bedeutungslos, und er ist der mit Abstand häufigste Fehler, der bei dieser Modellklasse gemacht wird. Audio- und Text-Tokens sind nicht dieselbe Einheit. Sprache wird mit einer Dichte in Audio-Tokens kodiert, die in keiner Beziehung zu demselben schriftlich festgehaltenen Inhalt steht – eine Minute Gespräch verbraucht deutlich mehr Audio-Tokens, als ihr Transkript Text-Tokens verbraucht, und das ausgegebene Audio fügt obendrein einen zweiten Strom hinzu. Die beiden Raten nebeneinanderzustellen impliziert ein Kostenverhältnis, das es in der Praxis nicht gibt.
Der strukturelle Unterschied ist wichtiger als der Preisunterschied. Qwen rechnet den Interpreter pro Token ab, während ein großer Teil des Echtzeit-Sprachmarkts pro Sitzungsminute abrechnet. Diese beiden Preismodelle verhalten sich völlig unterschiedlich, wenn Ihr Audio leiser wird, Ihre Sitzungen kürzer werden oder Ihre Sprecher pausieren – ein Minutenzähler berechnet Stille, ein Token-Zähler nicht. Wenn Sie ein Kostenmodell erstellen, lautet die Frage nicht, welcher Tarif niedriger ist, sondern welcher Zähler Ihre Nutzungsform bestraft. Und beachten Sie die regionale Aufteilung: Die Pekinger Preisgestaltung liegt bei ¥40 / ¥3,3 / ¥100 / ¥160 pro Million für Audio-Eingabe, Bild-Eingabe, Text-Ausgabe bzw. Audio-Ausgabe und damit deutlich unter den Singapur-Preisen – eine Art von Unterschied, die erst sichtbar wird, wenn man die beiden Zeile für Zeile vergleicht.
Ein weiterer Punkt, der in Sachen Kosten für den Interpreter spricht: Qwen hielt diese Preise im Wesentlichen unverändert gegenüber Qwen3.5-LiveTranslate, wobei die Preise in Peking unverändert blieben und die in Singapur etwas niedriger ausfielen. Dass eine neue Generation ohne Preiserhöhung auf den Markt kommt, ist in diesem Markt nicht die Norm.
Offene Gewichte versus nur API ist die eigentliche Trennlinie
Wenn Sie sich bei diesen beiden aus Prinzip und nicht wegen der Leistungsfähigkeit entscheiden, ist die Lizenzierung der ausschlaggebende Faktor.
Qwen3.8-Max ist als gehostetes Angebot verfügbar, und die Max-Klasse-Gewichte dieser Generation wurden im August als Qwen3.8-2.4T-A95B als Open Source freigegeben. Dieser Weg existiert, ist aber kein beiläufiger: 4,89 TB an Gewichten bedeuten Rechenzentrums-Hardware, und die Open-Weight-Lizenz verlangt von Organisationen, die in einem Zwölfmonatszeitraum mehr als 50 Millionen US-Dollar einnehmen, eine kommerzielle Lizenz von Alibaba Cloud einzuholen.
Qwen3.8-LiveTranslate bietet keinen solchen Weg. Es hat geschlossene Gewichte und ist nur per API verfügbar, und zwar über eine WebSocket-Realtime-API, die erfordert, dass target_language in einem session.update-Ereignis festgelegt wird, bevor irgendein Audio übertragen wird. Sie unterstützt keine Funktionsaufrufe, keine strukturierte Ausgabe, kein Kontext-Caching, keine Batch-Inferenz und kein Fine-Tuning. Wenn Ihre Anforderung darin besteht, den Interpreter auf Ihrer eigenen Hardware auszuführen, erfüllt dieses Modell sie nicht, und kein noch so großer Entwicklungsaufwand wird das ändern.
Das ist für eine bestimmte Art von Käufer relevant: für denjenigen, der Audio nicht an Dritte senden darf – ein Krankenhaus, eine Anwaltskanzlei, einen staatlichen Auftragnehmer. Für alle anderen ist die praktische Frage, ob der Dolmetscher gut genug ist, um die Abhängigkeit zu rechtfertigen, und die Antwort darauf ist eine Messung, die Qwen bisher niemandem erlaubt hat.

Auswahl nach Job, nicht nach Namen
Die richtige Antwort auf „Qwen3.8-LiveTranslate oder Qwen 3.8“ ist, dass Sie wahrscheinlich die Antwort auf eine andere Frage benötigen.
• Wenn es um Live-Dolmetschen geht – ein Meeting, ein Anruf, eine Übertragung –, kann das nur eines davon, und es ist nicht das Flaggschiff.
• Wenn es bei der Aufgabe darum geht, das Gesagte zusammenzufassen, Handlungspunkte zu extrahieren, Fragen zum Transkript zu beantworten oder das Follow-up zu schreiben – kann das nur das Flaggschiff, und das ist nicht der Interpreter.
• Wenn es bei der Aufgabe um beides geht, bauen Sie eine Pipeline auf, und Sie werden an zwei Anbieter mit zwei Verträgen und zwei Sätzen von Zugangsdaten zahlen, es sei denn, Sie konsolidieren bewusst.
Dieser dritte Fall ist der übliche, und hier hört es auf, ein Komfort zu sein, dass beide Hälften hinter einem einzigen Endpunkt laufen, und beginnt, Architektur zu sein. Qwen3.8-Max läuft auf OrcaRouter zum Listenpreis des Anbieters von 2,00 $ pro Million Eingabe- und 6,00 $ pro Million Ausgabe-Tokens mit null Aufschlag, der durchgereicht wird, sodass eine Qwen-Preissenkung noch am selben Tag auf Ihrer Rechnung ankommt statt erst bei der nächsten Vertragsverlängerung, und automatisches Failover bedeutet, dass die Zusammenfassungs-Hälfte der Pipeline nicht ausfällt, wenn ein Anbieter eine schlechte Stunde hat.
Um Klarheit über die andere Hälfte zu schaffen, denn die Unterscheidung ist wichtig: Qwen3.8-LiveTranslate ist nicht in unserem Katalog. Es ist über Alibabas eigene Model-Studio-API und den Test-Endpunkt des Anbieters unter omni.qwen.ai/live-translate verfügbar, und wir werden nicht andeuten, dass wir ein Modell routen, das wir nicht routen. Was Sie heute hinter einem einzigen Schlüssel betreiben können, ist der Downstream-Stack – die Modelle, die konsumieren, was der Interpreter erzeugt.

Das Benennungsproblem ist der eigentliche Befund.
Vier Modelle, ein Präfix, keine Suffix-Konvention, auf die sich ein Leser verlassen kann. „Qwen 3.8“ verweist je nachdem, wer gerade tippt und was er zuletzt gelesen hat, auf das gehostete Flaggschiff, den offenen 2,4T-Checkpoint, das kleine 27B-Modell oder den Interpreter. Die veröffentlichten Benchmark-Tabellen helfen nicht weiter, denn für das Flaggschiff gibt es sie, für den Interpreter größtenteils nicht: Qwen3.8-Max lässt sich auf Terminal-Bench oder GPQA Diamond einordnen, während die Belege für Qwen3.8-LiveTranslate eine durchschnittliche Verzögerung von 2,3 Sekunden, ein vom Anbieter gemeldeter Wert von 85,7 xCOMET-XXL auf FLEURS und eine selbst gemeldete Diarisierungsfehlerrate von 9,7 % ohne unabhängige Reproduktion sind.
Der Vergleich, den diese Seite beantworten soll, ist eigentlich eine Warnung. Bevor du Qwen 3.8 mit irgendetwas vergleichst, stelle klar, welches Qwen 3.8 du meinst. Wenn es Audio verarbeitet, ist es der Dolmetscher, und es ist ein Spezialist, den man für eine einzige Aufgabe kauft. Wenn es Video verarbeitet, ist es das Flaggschiff, und es ist ein Generalist, den man für die anderen zwanzig kauft. Jede Bewertung, die beide vermischt, wird zu keinem von beiden eine Schlussfolgerung liefern.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
