Eine generierte Titelkarte mit der Aufschrift „Boreal vs Qwen3.8 Max“ und dem Untertitel „Die Zeile, die jeder Anbieter am liebsten überspringen würde“, flache Liniensymbole eines Video-Play-Rahmens, einer Punktetafel mit einer hervorgehobenen Zeile und einer Lupe, mit dem unten rechts eingefügten OrcaRouter-Logo.
Guides & Insights

Boreal vs Qwen3.8 Max: Die Zeile, die jeder Anbieter hofft, dass Sie sie überspringen

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Jeder Modellstart veröffentlicht eine Karte voller Zahlen, und jede Karte hat eine Zeile, auf der der Anbieter es lieber sähe, wenn man nicht verweilte. Für Qwen3.8 Max, veröffentlicht am 3. August 2026, sind die schmeichelhaften Zeilen leicht zu finden: Mit 1.691 Punkten belegte es Platz eins im Frontend-Leaderboard von CodeArena, erreichte einen Agentic Index von 58 bei Artificial Analysis und zog damit bei hohem Aufwand mit Claude Opus 5 gleich – so nah war ein chinesisches Labor der Spitze dieser Rangliste noch nie gekommen – und es erzielte einen GDPval-AA-Wert von 1.739 Elo, vor GPT-5.6 Sol. Die Zeile darunter ist schwerer zu lesen. In derselben Testsuite desselben Bewerters stieg die gemessene Halluzinationsrate von 23 % in der vorherigen Generation auf 40 %, und der Long-Context-Retrieval-Wert des Modells fiel um zwei Punkte. Boreal, Creatifys Werbevideomodell, am 15. September 2026 zu einem Cent pro Sekunde gestartet, hat auf seiner eigenen Karte eine Zeile derselben Art – und sie ist konkreter, weil der Anbieter sie veröffentlicht hat.

Keine der beiden Zeilen ist ein Ausschlusskriterium. Beide sagen mehr aus als die Schlagzeilenwerte, weshalb es sich lohnt, sie nebeneinanderzustellen, statt die Banner zu vergleichen.

Worin Qwen3.8 Max wirklich am besten ist

Die Erfolge sind real und sie sind nicht klein.

Qwen3.8 Max ist ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, von denen pro Token rund 95 Milliarden Parameter aktiv sind, und es ist das erste Qwen der Max-Klasse, von dem Alibaba angekündigt hat, dass es als offene Gewichte veröffentlicht werden soll – angekündigt für die Woche vom 10. August 2026, ohne Lizenz oder festes Datum, ein erwähnenswertes Detail, denn die Ankündigung ist nicht die Veröffentlichung. Es verfügt über ein Kontextfenster von 1 Mio. Token bei einer Ausgabegrenze von 131.072 Token und akzeptiert Text, Bilder und Video als Eingabe. Dieser letzte Punkt verdient in diesem speziellen Vergleich besondere Betonung: Von den vier Frontier-Textmodellen, die diese Serie Boreal gegenüberstellt, ist Qwen3.8 Max eines von nur zwei, denen man einen fertigen Videoclip übergeben und eine Frage dazu stellen kann.

Die Preisgestaltung ist aggressiv – so sehr, dass sie das Segment neu geformt hat. Bei 2,00 $ pro Million Eingabe-Tokens und 6,00 $ pro Million Ausgabe-Tokens, mit Cache-Lesevorgängen zu 0,25 $, unterbietet sie die vorherige Generation um etwa 20 % und verdoppelt gleichzeitig die maximale Ausgabelänge. Auf unserem Board landet das bei 2,00 $ und 6,00 $, einem 1M-Token-Kontext, einer p50-Zeit bis zum ersten Token von 10,00 Sekunden — das ist die Obergrenze, die unsere Instrumentierung meldet, also eher als „langsam“ denn als präzise zu lesen — und 183,0 Millionen Tokens Traffic in den letzten sieben Tagen.

Und die Zeile darunter

Hier ist der Teil, der es nicht in die Schlagzeile des Launch-Posts schafft.

Die unabhängige Bewertung von Artificial Analysis verzeichnete zwei Regressionen zwischen Qwen3.7-Max und Qwen3.8 Max. Sein Long-Context-Retrieval-Maß fiel um zwei Punkte. Sein Allwissenheitsmaß fiel um zehn Punkte, und die vom Evaluator gemessene Halluzinationsrate stieg von 23 % auf 40 %. Gleichzeitig stiegen die Kosten des Modells pro Aufgabe im Intelligence Index von 0,53 $ auf 1,14 $ — es benötigte ungefähr 64 Runden pro Aufgabe, während sein Vorgänger 14 benötigte.

Liest man sie zusammen, ergibt sich ein stimmiges Bild. Qwen3.8 Max ist ein Modell, das besser wurde bei den Dingen, die Benchmarks mit einer einzigen richtigen Antwort messen können – Code, agentische Aufgabenbewältigung, strukturiertes Problemlösen –, und schlechter bei dem, was am schwersten zu bewerten ist: zu wissen, wann es etwas nicht weiß. Ein Modell, das mehr abwägt und mehr halluziniert, widerspricht sich nicht selbst. Längere Reasoning-Traces schaffen mehr Gelegenheiten, sich auf eine selbstsichere falsche Antwort festzulegen, und ein Benchmark, der Aufgabenabschluss belohnt, bestraft das nicht – bis die Aufgabe eine verborgene Invariante hat, die verletzt werden kann.

Für einen Käufer ist die praktische Konsequenz eng begrenzt und konkret. Wenn Ihre Nutzung des Modells Codegenerierung oder ein agentischer Workflow ist, bei dem eine falsche Antwort deutlich sichtbar scheitert – ein Test schlägt fehl, ein Build bricht ab –, sind die Regressionen weitgehend unsichtbar, und die Verbesserungen sind alles, was zählt. Wenn Ihre Nutzung Retrieval, Zusammenfassung oder irgendetwas ist, bei dem eine flüssig formulierte falsche Antwort einen Menschen ohne Prüfung erreicht, ist die Verschiebung von 23 auf 40 die Zahl, die Ihre Bewertung entscheiden sollte, nicht die Platzierung in CodeArena.

Boreals eigene schlechteste Zeile, veröffentlicht vom Anbieter

Der Kontrast, der diese Paarung nützlich macht, ist, dass Creatify etwas getan hat, was die meisten Anbieter nicht tun: Es hat sein schwächstes Ergebnis in denselben Beitrag gepackt wie sein stärkstes.

Boreal wurde blind gegen sein eigenes unangetastetes Basismodell getestet, wobei Prompt, Auflösung, Frame-Anzahl und Seed konstant gehalten wurden, über 40 Produktionsfälle hinweg. Creatify meldet eine Präferenz von 81 % für Boreal – 25 zu 6 bei 9 Gleichständen, Vorzeichentest p<0,001 – und schlüsselt diesen Durchschnitt anschließend auf. Produktanzeigen: 83 %. Creator- und UGC-Szenen: 85 %. Talking-Head-Clips mit einer Person: 60 %.

Diese letzte Zahl ist die Zeile. Talking Heads gehören zu den häufigsten Formaten in der Direktwerbung, und es ist das Format, in dem der Vorsprung des Modells gegenüber seinem eigenen Basismodell am dünnsten ist – kaum besser als ein Münzwurf gegen ein Modell, das ohnehin niemand ausliefern wollte. Das Rendering wird mit 1:1 zur Echtzeit in der 720p-Klasse angegeben, und die Erhaltung feiner Details verbesserte sich um 11,3 % bei p = 0,004, sodass die Gesamtbilanz wirklich positiv ist. Die Aufschlüsselung verrät lediglich, für welche Hälfte der Kategorie dieses Modell optimiert wurde, und es ist nicht die Hälfte, in der eine Person in die Kamera spricht.

Beachte außerdem, welche Art von Beleg jede dieser Zeilen darstellt. Die Regression von Qwen3.8 Max wurde von einer unabhängigen Prüfinstanz gefunden, die ihren eigenen Harness ausführte. Die schwache Zeile von Boreal wurde vom Anbieter offengelegt, in einem Test, den der Anbieter entworfen und durchgeführt hat. Die zweite ist als Tatsachenaussage vertrauenswürdiger und als Vergleich weniger informativ, weil es in Boreals Datei nirgends eine unabhängige Zahl gibt.

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

Der Spec-Kontrast

• Ausgabe — Boreal: gerendertes Video, 720p-Klasse, Text-zu-Video und Bild-zu-Video. Qwen3.8 Max: nur Text, bis zu 131.072 Token.

• Eingabe — Boreal: eine Texteingabe oder ein Standbild. Qwen3.8 Max: Text, Bilder und Video.

• Preis — Boreal: 0,01 $ pro Sekunde fertigen Videos. Qwen3.8 Max: 2,00 $ pro 1 Mio. Input / 6,00 $ pro 1 Mio. Output, Cache-Reads zu 0,25 $.

• Kontext — Boreal: nicht veröffentlicht. Qwen3.8 Max: 1 Mio. Tokens Eingabe, 131K Ausgabe.

• Latenz — Boreal: mit 1:1 zur Echtzeit angegeben. Qwen3.8 Max: p50 Zeit bis zum ersten Token von 10,00 Sekunden auf unserem Board.

• Gewichte — Boreal: proprietär, im Besitz von Creatify und von Creatify bereitgestellt. Qwen3.8 Max: zum Start proprietär; Alibaba hat eine Open-Weights-Veröffentlichung für das erste Qwen der Max-Klasse angekündigt, wobei weder Lizenz noch Datum bestätigt sind.

• Belege — Boreal: vom Anbieter durchgeführter Blindtest mit 40 Fällen, keine unabhängige Bewertung. Qwen3.8 Max: unabhängige Benchmark-Abdeckung einschließlich zweier gemessener Regressionen, daneben Anbieterzeilen von 86,1 bei OSWorld-Verified und 86,6 bei Terminal-Bench 2.1.

Was eine Regression für jemanden wert ist, der kauft

Regressionen in Bestenlisten werden meist als Randnotiz abgetan. Dabei kommen sie dem, was ein Benchmark an Entscheidungsrelevanz veröffentlicht, am nächsten – denn sie sind die einzigen Zeilen, die dir verraten, was ein Anbieter dafür hergegeben hat.

Das sinnvolle Vorgehen ist nicht, eine der beiden Karten zu lesen, sondern beide Modelle mit Ihrem eigenen Traffic laufen zu lassen – und das praktische Hindernis besteht darin, dass dies normalerweise zwei Verträge, zwei SDKs und zwei Abrechnungsbeziehungen bedeutet, was genug Reibung erzeugt, dass die meisten Teams den Test überspringen und stattdessen aufgrund des Schlagzeilen-Scores kaufen.

Diese Reibung ist der Teil, den eine Routing-Schicht beseitigt. Qwen3.8 Max ist in unserem Katalog zusammen mit der vorherigen Generation, sodass der Vergleich der beiden mit Ihrem eigenen Evaluierungsset eine einzeilige Änderung am Modell-String ist statt eines Beschaffungszyklus, und derselbe Schlüssel erreicht den Rest des Katalogs, wenn der Vergleich ergibt, dass Sie für eine andere Phase der Pipeline ein anderes Modell wünschen. Es liegt bei Anbieter-Listenpreis mit 0 % Aufschlag, was hier aus einem bestimmten Grund wichtig ist: Qwen3.8 Max kam etwa 20 % günstiger als die Generation, die ersetzt wurde, und eine solche Preisanpassung seitens des Anbieters ist genau die Art von Sache, die auf Ihrer Rechnung landen sollte, wenn sie passiert, und nicht erst bei der nächsten Verlängerung.

Boreal ist nicht in unserem Katalog. OrcaRouter bietet keine Videogenerierungsmodelle an, und nichts hier sollte so gelesen werden, als würde etwas anderes behauptet. Was wir anbieten, ist die Ebene darüber – die Werbetexte, die Varianten, den Compliance-Durchlauf, die Analyse dessen, was performt hat – und zwei der Modelle in dieser Reihe, darunter Qwen3.8 Max, können den fertigen Clip zur Überprüfung erhalten.

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

Wie man eine der beiden Karten liest

Qwen3.8 Max ist der stärkere Kauf, wenn es bei Ihrer Arbeit um Code, Agenten oder strukturiertes Reasoning geht – und zwar zu einem Preis, der den eigenen Vorgänger unterbietet; die beiden unabhängigen Regressionen sind der Grund, es mit Ihrem Retrieval- und Zusammenfassungs-Traffic zu testen, bevor Sie Produktionsverkehr dorthin leiten. Die 40%-Halluzinationsrate ist kein Grund, das Modell zu meiden; sie ist ein Grund zu wissen, welche Ihrer Workloads sie tolerieren können.

Boreal ist der einzige der beiden, der das Artefakt erzeugt, um das es in diesem Vergleich nominell geht, und er ist die günstigste glaubwürdige Option zu veröffentlichten Preisen für Kurzformat-Werbevideos. Seine Einschränkung ist formatspezifisch und wird von seinem eigenen Anbieter genannt: 60 % Präferenz bei Clips, in denen eine einzelne Person spricht. Teste dieses Format vor den Produktanzeigen, denn dort ist der Spielraum am kleinsten.

Zwei Dinge würden hier etwas bewegen. Wenn Alibaba die offenen Gewichte ausliefert, die es für Qwen3.8 Max angekündigt hat, ändern sich sowohl die Preisgestaltung als auch die Langlebigkeit des Modells, und die Lizenz, unter der es erscheint, wird wichtiger sein als das Datum. Und für Boreal würde die erste unabhängige Bewertung – gleich welcher Art, von wem auch immer – einen Anbietertest mit 40 Fällen ersetzen, der derzeit die gesamte Beweislast für ein Modell trägt, das in ein Format verkauft wird, in dem Marken ungewöhnlich empfindlich darauf reagieren, wie ihr Produkt aussieht.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert