Eine generierte Titelkarte mit der Aufschrift „Ember-1 vs Qwen3.8-Max“ und dem Untertitel „Ein token-sparsames Derivat gegen das Flaggschiff“, über zwei Karten: Ember-1 — „40 % weniger Token, wie behauptet“ und „kein veröffentlichter Preis“; Qwen3.8-Max — „2 Dollar rein, 6 Dollar raus“ und „1M-Token-Kontext“.
Guides & Insights

Ember-1 vs. Qwen3.8-Max: Das token-sparsame Derivat gegen das Flaggschiff

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die beiden Modelle in diesem Duell haben beide eine echte Zahl auf demselben Benchmark, und trotzdem klärt das nichts. Ember-1 ist das spezialisierte Derivat, das Fireworks Research von Moonshot AIs Kimi K3 abgeleitet hat, veröffentlicht am 23. September 2026, und meldet 82,0 % auf Terminal Bench 2.1 bei ungefähr der Hälfte der Tokens, die sein Basismodell verbraucht. Qwen3.8-Max ist Alibabas Flaggschiff – ein Sparse-Mixture-of-Experts-Modell mit rund 2,4 Billionen Parametern und etwa 95 Milliarden aktiven pro Token – allgemein verfügbar seit dem 3. August 2026, und meldet 86,6 % auf demselben Benchmark. Beide Zahlen sind vom Anbieter gemeldet, beide Labore haben ihren eigenen Harness ausgeführt, und eine Lücke von 4,6 Punkten zwischen zwei unveröffentlichten Evaluations-Setups ist kein Urteil. Vergleichbar ist das Geld, und genau da wird dieses Duell interessant: Die gesamte These des einen Modells ist, dass man nicht für Tokens bezahlen sollte, die man nicht braucht, und das andere ist ein Flaggschiff mit einem Preis von 2 $ pro Million Eingabe und 6 $ pro Million Ausgabe.

Was jedes Modell tatsächlich ist

Ember-1 ist in architektonischer Hinsicht kein neues Modell. Es ist ein erneut trainiertes Kimi K3, das prägnanteres Reasoning beherrschen soll, entwickelt von Fireworks Research im Rahmen von mehr als 50 Trainingsexperimenten und über 200 Evaluierungen auf dem eigenen serverlosen Trainings-Stack. Die Behauptung des Labors ist, dass das Reasoning von K3 länger ist als für die Aufgaben erforderlich und dass das Übermaß entfernt werden kann, ohne die Antworten zu ändern — die Reasoning-Länge sank um 35–50 % ohne Genauigkeitsverlust über sieben Benchmarks und zwei A/B-Tests in Kundenproduktionsumgebungen hinweg. Es ist als Research Preview auf der eigenen serverlosen Plattform des Anbieters verfügbar, ohne veröffentlichte Gewichte und ohne veröffentlichten Preis.

Qwen3.8-Max ist eine völlig andere Art von Objekt. Es ist Alibabas Frontier-Stufe, nativ multimodal für Text-, Bild- und Videoeingabe, mit einem Kontextfenster von einer Million Token, und seit dem Start zweimal aktualisiert: ein nachtrainiertes Update am 2. September 2026, das auf Coding und professionelle Büroarbeit ausgerichtet ist, sowie eine schnellere Serving-Stufe, angekündigt am 22. September 2026. Alibaba positioniert es im Wettbewerb mit GPT-5.5, Claude Opus 4.7 und Gemini 3.1 Pro, und das veröffentlichte Evaluierungsblatt spiegelt diesen Anspruch wider – GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 und Humanity's Last Exam mit 43,6, alle vom Anbieter angegeben.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

Die Tarifkarten, nebeneinander

Eines davon hat einen Preis und das andere nicht, was die erste praktische Asymmetrie ist.

• Eingabe — Ember-1: keine veröffentlicht; die Benchmark-Tabelle berechnet Dollar anhand der Preisliste von Kimi K3. Qwen3.8-Max: 2,00 $ pro Million Token auf OrcaRouter.

Ausgabe — Ember-1: keine veröffentlicht. Qwen3.8-Max: 6,00 $ pro Million Token.

• Zwischengespeicherte Eingabe — Ember-1: nicht zutreffend. Qwen3.8-Max: 0,25 $ pro Million Tokens für Cache-Lesevorgänge, was ein Achtel des Eingabetarifs ist und in Agenten-Schleifen, in denen derselbe Kontext in jeder Runde erneut gesendet wird, enorm wichtig ist.

• Kontextfenster — Ember-1: für die Vorschau nicht veröffentlicht; sein Basismodell umfasst 1.048.576 Token. Qwen3.8-Max: 1.000.000 Token.

• Multimodalität — Ember-1: Text. Qwen3.8-Max: Text-, Bild- und Videoeingabe, Textausgabe.

• Gewichte — Ember-1: keine. Qwen3.8-Max: Ein Open-Weights-Release existiert, ist aber text-only und ihm fehlen das volle Kontextfenster und der Vision-Input des bereitgestellten Endpunkts.

• Zugang — Ember-1: Research Preview, zweiwöchiges serverloses Zeitfenster, Dauerhaftigkeit an die Nachfrage geknüpft. Qwen3.8-Max: allgemein verfügbar und bepreist.

Beachte eines zu den Qwen3.8-Max-Tarifen, bevor du irgendetwas modellierst: Alibaba hat die Paketierung dieses Modells seit dem Start mehrfach überarbeitet, und die internationale Preisliste hat nicht immer dem entsprochen, was im August als Headline-Preis verkündet wurde. Betrachte $2.00 und $6.00 als den aktuellen Route-Preis auf unserer Plattform – die den Listenpreis des Anbieters ohne Aufschlag weitergibt, sodass eine Änderung beim Anbieter noch am selben Tag sichtbar wird – und prüfe die Preisliste, bevor du ein Budget dafür festlegst.

Warum der Benchmark-Vergleich nicht funktioniert

82,0 % von Ember-1 und 86,6 % von Qwen3.8-Max sind beide Terminal Bench 2.1, was sie vergleichbar aussehen lässt und sie nicht vergleichbar macht. Das Datenblatt von Ember-1 weist seine Zahl im Vergleich zu Kimi-K3-Varianten aus, die von Fireworks Research evaluiert wurden, auf 89 Stichproben, mit angehängten Token- und Kostendeltas. Die Zahl von Qwen3.8-Max stammt aus Alibabas eigenem Evaluierungsbogen. Unterschiedliche Labore, unterschiedliche Harnesses, unterschiedliche Agent-Scaffolds – und in einem Benchmark, dessen Ergebnisse sich allein durch die Wahl des Scaffolds um mehrere Punkte verschieben, liegt eine Lücke von 4,6 Punkten innerhalb des Grundrauschens der Methodik.

Was sich aus Ember-1s Datenblatt ablesen lässt, ist die Token-Spalte – das Einzige, auf dessen Änderung das Modell trainiert wurde. Im Vergleich zu seiner eigenen Basis verbraucht Ember-1 51,9 % weniger Tokens auf Terminal Bench 2.1, 32,5 % weniger auf SWE-Interact, 23,7 % weniger auf DeepSWE 1.1 und nur 5,9 % weniger auf τ-2 Bench Airline. Die Spannbreite ist die ehrliche Schlagzeile. Ein Modell, das den Überlegungsaufwand senkt, ist sehr viel wert bei Benchmarks, bei denen das Basismodell zu viel nachdenkt, und fast nichts wert bei denen, bei denen es das nicht tut, und man kann nicht wissen, welche Art von Workload man hat, ohne die eigene zu messen.

Kosten pro abgeschlossener Aufgabe, durchgerechnet

Hier ist die Rechnung, die das tatsächlich entscheidet, wobei die veröffentlichten Preise von Kimi K3 als Ersatz für die Kosten von Ember-1 dienen, da Ember-1 keine hat. Kimi K3 kostet $3,00 pro Million Eingabe-Tokens, $0,30 gecacht und $15,00 für die Ausgabe — genau die Preisliste, die Fireworks Research in ihrem eigenen Vergleich verwendet hat. Qwen3.8-Max kostet $2,00 für die Eingabe und $6,00 für die Ausgabe, wobei Cache-Lesezugriffe bei $0,25 liegen.

Auf der Eingabeseite ist Qwen3.8-Max bereits um ein Drittel günstiger. Auf der Ausgabeseite ist es pro Token 2,5-mal günstiger. Das bedeutet, dass die Token-Reduktion von Ember-1 nicht gegen eine statische Abrechnung antritt – sie tritt gegen ein Flaggschiff an, das bereits vor jeglicher Effizienzarbeit pro Token günstiger ist. Der eigene Produktions-A/B-Test von Fireworks Research zeigte, dass die Ausgabe-Token von 49,3K auf 29,9K fielen, eine Gesamtreduktion von 39 %; wendet man das auf die Ausgaberate von Qwen3.8-Max an, erhält man dieselbe Ersparnis von 39 %, was ein kleinerer absoluter Gewinn ist als derselbe Prozentsatz, angewendet auf die 15-$-Rate von K3.

Der Effizienzfall für Ember-1 ist daher am stärksten, wenn man ihn gegen sein eigenes Basismodell misst, und genau diesen Fall führt die Veröffentlichung an. Gegenüber Qwen3.8-Max verschiebt sich der Vergleich auf Leistungsfähigkeit pro Dollar, wo der größere Kontext des Flaggschiffs, multimodaler Input und die kostenpflichtige Verfügbarkeit die Gegenargumente sind — und wo niemand einen Direktvergleich veröffentlicht hat, der das klären würde.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

Was unsere eigenen Routing-Daten zeigen

Zwei der drei hier beteiligten Modelle sind Live-Routen auf OrcaRouter, was einen Einblick gewährt, den keine Benchmark-Tabelle bietet. Qwen3.8-Max wird mit 1.000.000 Tokens Kontext bereitgestellt, mit einer medianen Latenz bis zum ersten Token von etwa 2,0 Sekunden und ungefähr 52,7 Ausgabe-Tokens pro Sekunde in den letzten sieben Tagen, bei einer Fehlerrate von etwa 4,2 %. Kimi K3 – Ember-1s Basismodell und der Referenzpunkt für jede von Ember-1 behauptete Einsparung – läuft mit 1.048.576 Tokens Kontext, einer medianen Latenz von nahezu 8,0 Sekunden, etwa 43,6 Ausgabe-Tokens pro Sekunde und einer Fehlerrate von ungefähr 0,27 %, bei deutlich höherem Verkehrsaufkommen. Ember-1 selbst ist nicht auf OrcaRouter vertreten.

Diese Zahlen ordnen die Entscheidung neu ein. Kimi K3 ist beim ersten Token deutlich langsamer und pro Ausgabe-Token ungefähr doppelt so teuer wie Qwen3.8-Max, weist dabei aber unter deutlich höherer Last eine viel niedrigere Fehlerrate auf. Eine token-sparsame Ableitung von K3 verringert die Kostendifferenz, schließt aber nicht die Latenzlücke, weil eine Verkürzung des Reasonings die Generierungsphase verkürzt, nicht die Warteschlange. Wenn Ihre Arbeitslast latenzempfindlich statt kostenempfindlich ist, ist das Flaggschiff heute die bessere Wahl, und die Effizienzgeschichte ist nebensächlich.

Welche weiterleiten

Setzen Sie Qwen3.8-Max ein, wenn Sie das Kontextfenster, die multimodale Eingabe, einen veröffentlichten Preis und einen Dienst benötigen, gegen den sich ein Budget planen lässt. Von der Konstruktion her ist es die sicherere der beiden Optionen: allgemein verfügbar, bepreist und innerhalb von zwei Monaten zweimal aktualisiert – von einem Anbieter, der nachweislich den Endpunkt aktuell hält.

Probieren Sie Ember-1, wenn Ihre Rechnung von Reasoning-Tokens in langen Agent-Loops dominiert wird und Sie ein gehostetes Modell statt eigener Hardware nutzen. Der richtige Test sind die zwei Wochen, die Ihnen die Vorschau bietet: im Schattenbetrieb gegen Produktionsverkehr laufen zu lassen und dabei Tokens pro abgeschlossener Aufgabe statt Tokens pro Anfrage zu messen. Was Sie nicht tun sollten, ist, es aufgrund einer 40-%-Zahl, die je nach Workload zwischen 6 % und 52 % schwankt, als Eins-zu-eins-Ersatz für ein Flaggschiff einzutauschen.

Wenn die eigentliche Frage ist, ob Kimi K3 überhaupt weiter betrieben werden soll, können Sie diese heute ohne jede Vorschau beantworten: sowohl Kimi K3 als auch Qwen3.8-Max sind auf OrcaRouter hinter einem Schlüssel, zum Anbieterlistenpreis ohne Aufschlag, mit automatischem Failover zwischen Anbietern. Die Kosten Ihrer Workload auf beiden zu vergleichen ist eine Routing-Änderung, kein Beschaffungsprojekt – und sie liefert Ihnen die Baseline, die jede Effizienzaussage über Ember-1 an Ihren eigenen Zahlen statt an denen des Labors messbar macht.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Die ehrliche Zusammenfassung lautet, dass diese beiden Modelle auf unterschiedliche Randbedingungen hin optimiert sind. Qwen3.8-Max ist darauf ausgelegt, das leistungsfähigste verfügbare Modell zu sein, und wird entsprechend bepreist; Ember-1 ist darauf ausgelegt, ein bereits teures Modell günstiger im Betrieb zu machen. Beide sind legitim, und der Grund, warum dieser Vergleich kein eindeutiges Urteil zulässt, ist, dass die Einsparungen des Derivats relativ zu einer Preisliste definiert sind, die das Flaggschiff deutlich unterbietet.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert