Generierte Titelkarte mit dem Titel „Union Alpha vs. Qwen3.8 Flash“ und dem Untertitel „Nur einen Punkt Unterschied beim einzigen Test, bei dem beide liefen“, über drei abgerundeten Karten mit der Aufschrift „Official A: 136/157 vs. 137/157“, „Kontext: 262.144 vs. 1.000.000 Tokens“ und „Zeit bis zum ersten Token: 10,00 s vs. 6,62 s“. Die Fußzeile lautet Official A laut SMF Clearinghouse mit Latenz laut OrcaRouter über die letzten 7 Tage.
Guides & Insights

Union Alpha vs. Qwen3.8 Flash: Ein Punkt sagt alles

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Union Alpha und Qwen3.8 Flash liegen bei dem einzigen Test, der beide gemessen hat, nur einen Punkt auseinander. In der Suite SMF Clearinghouse Official A – 157 Tests, Reasoning aus – erreichte Union Alpha 136 und ein lokaler Lauf von Qwen3.8-Flash-Next 137. Das ist das knappste Kopf-an-Kopf-Ergebnis, das eines der beiden Modelle vorzuweisen hat, und zugleich die irreführendste Zahl in diesem Vergleich, denn die beiden Einträge liefen nicht unter denselben Bedingungen, und nur eines von ihnen ist ein Modell, das man derzeit tatsächlich mieten kann.

Was die Ein-Punkt-Lücke verrät – und was nicht

Beginne mit dem, was es belegt. Union Alpha ist kein Bluff im trivialen Sinne – eine breite Testsuite mit 157 Tests ohne Fehler, perfektes Reasoning (30/30) und perfekte Tool-Nutzung (2/2) ist nichts, was ein hohler Endpunkt hervorbringt. Sein Coding-Ergebnis von 26/30 und sein Mathe-Ergebnis von 24/30 verorten es in einem glaubwürdigen Bereich, und seine Schreibbewertung von 2/5 bringt es nicht einmal in die Nähe allgemeiner Prosaarbeit.

Nun die Einschränkungen, die tragend sind.

Der Eintrag Qwen3.8 Flash war ein lokaler Lauf von Qwen3.8-Flash-Next – dem Checkpoint mit offenen Gewichten –, nicht die gehostete Qwen3.8 Flash API. Lokales Serving bedeutet Ihre eigene Quantisierung, Ihren eigenen Inferenz-Stack, Ihren eigenen Parser für Tool-Aufrufe. Nichts davon stimmt garantiert mit dem überein, was der gehostete Endpunkt zurückgibt, und die Personen, die den Test durchgeführt haben, haben den Vergleich genau aus diesem Grund als nicht abschließend eingestuft.

Eine Suite ist kein Profil. Official A ist breit, aber pro Kategorie flach: Tools sind 2 Tests. Eine Tool-Kategorie mit zwei Tests, die 2/2 erzielt, ist ein gutes Zeichen, kein Beleg für agentische Zuverlässigkeit, und Union Alpha ist ausdrücklich als agentisches und Coding-Modell positioniert. Das Instrument misst etwas, das neben der Behauptung liegt.

Und der eine Punkt selbst liegt im Rauschen einer Testsuite mit 157 Tests. Behandeln Sie 136 und 137 als „diese liegen im selben Bereich“, nicht als Ranking.

Seite an Seite

• Kontextfenster — Union Alpha 262.144 Token vs. Qwen3.8 Flash 1.000.000 bereitgestellte Token (262.144 nativ, erweitert via YaRN).

• Maximale Ausgabe — Union Alpha 131.072 Token vs. Qwen3.8 Flash 131.000 Token. Effektiv gleichauf.

• Eingaben — Text und Bild bei Union Alpha vs. Text, Bild und Video bei Qwen3.8 Flash.

• Preisgestaltung — 0 $ während der Vorschauphase von Union Alpha im Vergleich zu Qwen3.8 Flash mit 0,150 $/M Eingabe, 0,470 $/M Ausgabe, 0,018 $/M Cache-Lesen, 0,230 $/M Cache-Schreiben.

• Reasoning-Steuerungen – keine bei Union Alpha gegenüber einem Denkmodus bei Qwen3.8 Flash, der standardmäßig aktiviert ist und deaktiviert werden kann.

• Zeit bis zum ersten Token — Union Alpha 10,00 s p50 gegenüber Qwen3.8 Flash 6,62 s p50, beide auf unserem Endpunkt über dasselbe Sieben-Tage-Fenster gemessen. Die reine Dekodiergeschwindigkeit liegt näher beieinander, als der Ruf vermuten lässt: 170 Token pro Sekunde gegenüber 103.

• Herkunft – anonymer Betreiber, keine Gewichte im Gegensatz zu Alibaba/Qwen, wobei die Gewichte von Qwen3.8-Flash-Next auf Hugging Face und ModelScope quelloffen veröffentlicht wurden.

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash: eine Wette auf Effizienz mit 6B aktiven Parametern

Qwen3.8 Flash wurde am 26. August 2026 als produktive, verwaltete Version des Open-Weight-Checkpoints Qwen3.8-Flash-Next eingeführt, den Alibaba zeitgleich veröffentlichte. Es ist ein Mixture-of-Experts-Modell mit 125 Mrd. Parametern, das pro Token rund 6 Mrd. Parameter aktiviert, plus 51 Mrd. N-Gramm-Einbettungsparameter, aufgebaut auf hybrider Attention, die Gated DeltaNet mit einem Sparse-Attention-Indexer kombiniert.

Bei der Darstellung des Anbieters geht es um Trainingsökonomie: Alibaba gibt an, dass die Laufkosten etwa ein Neuntel der von Qwen3.7-Plus betragen, mit angeblich bis zu 7,6× schnellerem Prefill und bis zu 4,9× schnellerem Decode bei 1M-Token-Workloads mit hohen Cache-Hit-Raten. Dies sind Anbieterangaben und wurden nicht unabhängig reproduziert.

Auch seine Benchmark-Tabelle ist vom Anbieter angegeben und nicht reproduziert: SWE-bench Pro 62,5, DeepSWE v1.1 58,7, SWE-bench Multilingual 81,0, NL2Repo 48,1, CoWorkBench 73,9, JobBench 55,7, RealWorldQA 88,5, LVBench 76,6, AndroidWorld 84,5. Die Zahl, die man dem Marketing entgegenhalten sollte, ist Humanity's Last Exam mit 35,9, die im selben Vergleich unter den 40,0 von Claude Opus 4.6 liegt.

Auf unserer eigenen Modellseite steht im öffentlichen Benchmark-Abschnitt noch immer „ausstehend“ – bislang hat keine dritte Partei eine Bewertung abgegeben. Was wir haben, sind unsere eigenen Traffic-Daten: eine mediane Time-to-First-Token von 6,62 Sekunden, eine Ausgaberate von 103 Tokens pro Sekunde und eine Fehlerrate von 4,5 %. Diese Fehlerrate ist hoch genug, um sie im Auge zu behalten, und sie ist die Art von Zahl, die nur auftaucht, wenn man einen Live-Endpunkt misst und nicht bloß einen Launch-Post.

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha: das Modell ohne Besitzer

Union Alpha erschien am 16. September 2026 in Drittanbieter-Katalogen und läuft auf OrcaRouters kostenloser Tarifstufe. Es hat kein benanntes Labor, keine Gewichte, keine Lizenz, keine Parameteranzahl und keine Architekturnotiz. Sein Anbieterfeld lautet „Stealth“.

Zumindest sein Endpunkt ist lesbar: 262.144-Token-Kontext, maximale Ausgabe von 131.072 Token, Text- und Bildeingabe mit reiner Textausgabe, Tool-Aufrufe, JSON-Ausgabe, temperature, top_p und max_tokens – und überhaupt keine Reasoning-Steuerungen. Die Tool-Auswahl beachtet effektiv nur "auto". Sein kostenloses Zeitfenster wurde als etwa eine Woche beschrieben, ratenbegrenzt, und es wurden keine Preise nach der Preview-Phase angekündigt.

Die geäußerte Behauptung – „Frontier-Level-Leistung über ein breites Spektrum allgemeiner Aufgaben“ – ist vom Betreiber gemeldet und nicht auditiert. Das 136/157-Ergebnis von Official A ist die einzige unabhängige Messung, die existiert.

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

Geschwindigkeit ist der Punkt, an dem sie aufhören, sich zu ähneln

Die plakativen Durchsatzwerte grenzen sie nicht so voneinander ab, wie man es erwarten würde, und es lohnt sich, den Grund dafür zu verstehen.

Laut unserer eigenen Routing-Telemetrie der letzten sieben Tage streamt Qwen3.8 Flash mit 103 Ausgabe-Tokens pro Sekunde, bei einer p50-Zeit bis zum ersten Token von 6,62 Sekunden und einer Fehlerrate von 4,5 %. Union Alpha, auf dieselbe Weise gemessen, streamt mit 170 Tokens pro Sekunde. Bei der reinen Dekodiergeschwindigkeit ist das anonyme Modell das schnellere der beiden.

Was es nicht tut, ist starten. Bei Union Alpha liegen die p50- und p95-Werte für die Zeit bis zum ersten Token beide exakt bei 10,00 Sekunden, was bedeutet, dass mindestens die Hälfte aller Anfragen zehn Sekunden oder länger wartet, bevor das erste Token erscheint, und seine Fehlerrate im selben Zeitfenster liegt bei 7,7 % – etwa 1,7-mal so hoch wie bei Qwen. Der Durchlauf Official A mit 157 Tests, auf den sich die früheren Abschnitte stützen, dauerte 4,6 Stunden Wanduhrzeit, bei einer Medianlatenz von 91,9 Sekunden und einem Mittelwert von 104,8 Sekunden pro Test, und vier Tests liefen in das 300-Sekunden-Timeout des Test-Harness. Unabhängige Tester, die es am Starttag laufen ließen, meldeten einen weitaus geringeren Durchsatz als unser Endpunkt zeigt, was man von einem Dienst erwarten würde, der noch dabei ist, eine enorme Last des ersten Tages zu verkraften.

Der praktische Unterschied ist also nicht die Dekodiergeschwindigkeit. Er liegt bei der Zeit bis zum ersten Token und der Zuverlässigkeit. Union Alpha ist für nichts Interaktives nutzbar – keine Autovervollständigung, keine Inline-Unterstützung, keine enge Agentenschleife –, weil sich zehn Sekunden Stille nicht von einem Hänger unterscheiden lassen. Es eignet sich für asynchrone Arbeit: nächtliche Batch-Jobs, lange Dokumentdurchläufe, Offline-Evaluierungsläufe, bei denen nichts auf das erste Token wartet und eine Ausfallrate von 7,7 % durch einen Wiederholungsversuch aufgefangen wird.

Qwen3.8 Flash ist mit 103 Tokens pro Sekunde und einer medianen Zeit bis zum ersten Token von 6,62 Sekunden auch nicht schnell. Die ehrliche Betrachtung ist, dass beide langsam sind, und nur bei einem von ihnen schlägt ungefähr eine von dreizehn Anfragen fehl.

Das Effizienzargument und wer es vorbringen darf

Alibaba führt ein Argument zu den Trainingskosten an: ein Neuntel der Kosten von Qwen3.7-Plus für das Training, sechs Milliarden aktive Parameter pro Token, also günstig im Betrieb. Das ist eine Behauptung über ein Modell, dessen Gewichte existieren und dessen Abstammung dokumentiert ist.

Union Alphas Effizienzgeschichte wird eher angedeutet als ausgesprochen – ein anonymes 256K-Modell, dessen Aufruf kostenlos ist. Kostenlos ist nicht dasselbe wie günstig. Irgendjemand bezahlt für diese GPUs, die Vorschau hat ein genanntes Ende, und das eigene Eingeständnis des Betreibers, dass sie auf Geschwindigkeit optimiert haben, legt nahe, dass die Serving-Ökonomie noch nicht geklärt ist. Ein Modell, das eine Woche lang kostenlos und danach nicht bepreisbar ist, hat ein Effizienzargument, das mit dem Zeitfenster abläuft.

Das Unbekannte ausprobieren, ohne darauf zu setzen

Der Grund, warum genau diese Paarung es wert ist, im Kopf behalten zu werden, ist, dass sie der günstigstmögliche Test eines nicht erprobten Modells ist. Qwen3.8 Flash ist die bekannte Größe: benannter Anbieter, offene Gewichte, veröffentlichte (wenn auch anbietergefärbte) Benchmarks, ein echter Preis pro Token von 0,150 $/0,470 $. Union Alpha ist die Unbekannte, zum Preis von null, deren gesamter Wettbewerbsanspruch auf einem einzigen 157-Test-Ergebnis beruht.

Statt dich festzulegen, stell das Unbekannte hinter eine Failover-Regel. OrcaRouter reicht den Listenpreis des Anbieters mit 0 % Aufschlag durch und unterstützt automatisches anbieterübergreifendes Failover, sodass ein rate-limitierter oder verschwundener Union-Alpha-Endpunkt auf ein Modell durchfällt, das noch antwortet, statt um 3 Uhr morgens als fehlgeschlagener Job aufzutauchen. Beide Modelle liegen auf demselben Schlüssel, sodass das Experiment nur eine Konfigurationsänderung statt einer zweiten Integration kostet – und keines davon muss eine Entscheidung sein, die du verteidigst, weil du das Routing umschalten kannst, wenn sich das kostenlose Fenster schließt.

Urteil

Qwen3.8 Flash ist das Modell, auf dem man aufbauen sollte. Sechs Milliarden aktive Parameter, quelloffene Gewichte der Schwestermodelle, ein 1M-Token-Fenster, Videoeingabe, funktionierende 103 Token pro Sekunde und ein veröffentlichter Preis, den man prognostizieren kann. Die Benchmarks stammen vom Anbieter, und seine Fehlerquote ist es wert, im Auge behalten zu werden, aber es gehört jemandem, und dieser Jemand liefert aus.

Union Alpha ist das Modell, an dem man sich messen muss. Die Ein-Punkt-Lücke bei Official A ist wirklich interessant – sie deutet darauf hin, dass dieses Ding, was auch immer es ist, kein Spielzeug ist – und bei 0 $ mit einer Ausgabegrenze von 131K und Vision-Eingabe ist es eine Woche Ihrer Aufmerksamkeit wert. Doch eine Ein-Punkt-Lücke in einer einzigen Suite, erzeugt von einem anonymen Betreiber mit einer Fehlerquote von 7,7 %, ist ein Grund zum Nachforschen statt ein Grund zu wechseln.

Worauf man achten muss, ist dasselbe, was das schon immer entschieden hat: ein Name. Ox Alpha, der vorherige Eintrag in dieser Serie, wurde sechs Tage, nachdem er als Zhipus GLM-5.3-Flash aufgetaucht war, enthüllt. Wenn Union Alpha einen bekommt, geht es bei dem Vergleich nicht mehr um einen Punkt, sondern um einen Preis.

Die bekannte Größe ist bepreist und dokumentiert: Modellseite von Qwen3.8 Flash zeigt die Tarife von $0.150/$0.470, den bereitgestellten Kontext von 1 Mio. Token und die Ausgabengrenze von 131K, während öffentliche Benchmarks noch ausstehen.