Wygenerowana karta tytułowa zatytułowana „Union Alpha vs Qwen3.8 Flash” z podtytułem „O jeden punkt różnicy w jedynym teście, który uruchomił oba”, nad trzema zaokrąglonymi kartami o treści „Official A: 136/157 vs 137/157”, „Kontekst: 262 144 vs 1 000 000 tokenów” i „Czas do pierwszego tokenu: 10,00 s vs 6,62 s”. W stopce podano Official A według SMF Clearinghouse z opóźnieniem według OrcaRouter z ostatnich 7 dni.
Guides & Insights

Union Alpha kontra Qwen3.8 Flash: Jeden punkt to cała historia

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Union Alpha i Qwen3.8 Flash dzieli jeden punkt w jedynym teście, który zmierzył oba. W zestawie SMF Clearinghouse Official A — 157 testów, rozumowanie wyłączone — Union Alpha uzyskał 136 punktów, a lokalne uruchomienie Qwen3.8-Flash-Next uzyskało 137. To najbliższy wynik bezpośredniego porównania, jaki ma którykolwiek z tych modeli, a jednocześnie najbardziej myląca liczba w tym porównaniu, ponieważ oba wpisy nie zostały uruchomione w tych samych warunkach i tylko jeden z nich jest modelem, który można faktycznie wynająć już teraz.

Co mówi, a czego nie mówi różnica jednego punktu

Zacznij od tego, co to ustala. Union Alpha nie jest blefem w trywialnym sensie — rozbudowany zestaw 157 testów z zerową liczbą błędów, doskonałym rozumowaniem (30/30) i doskonałym korzystaniem z narzędzi (2/2) to nie jest coś, co wytwarza pusty endpoint. Jego wyniki w kodowaniu 26/30 i matematyce 24/30 lokują go na wiarygodnym obszarze, a wynik w pisaniu 2/5 stawia go daleko od ogólnego pisania prozą.

A teraz zastrzeżenia, które są nośne.

Wpis dotyczący Qwen3.8 Flash był lokalnym uruchomieniem Qwen3.8-Flash-Next — checkpointu z otwartymi wagami — a nie hostowanego API Qwen3.8 Flash. Lokalne serwowanie oznacza własną kwantyzację, własny stos wnioskowania, własny parser wywołań narzędzi. Nic z tego nie ma gwarancji zgodności z tym, co zwraca hostowany endpoint, a osoby przeprowadzające test oznaczyły to porównanie jako nieostateczne właśnie z tego powodu.

Jeden zestaw testów to nie profil. Official A jest szeroki, ale płytki w poszczególnych kategoriach: kategoria narzędzi to 2 testy. Kategoria narzędziowa złożona z dwóch testów, która uzyskuje wynik 2/2, to dobry znak, a nie dowód niezawodności agentowej, a Union Alpha jest wyraźnie pozycjonowany jako model agentowy i kodujący. Narzędzie mierzy coś pośrednio związanego z tezą.

A sam ten jeden punkt mieści się w szumie zestawu 157 testów. Traktuj 136 i 137 jako „te należą do tego samego przedziału”, a nie jako ranking.

Obok siebie

• Okno kontekstowe — Union Alpha 262 144 tokeny vs Qwen3.8 Flash 1 000 000 tokenów obsługiwanych (262 144 natywnie, rozszerzone przez YaRN).

• Maksymalna liczba tokenów wyjściowych — Union Alpha 131 072 tokeny vs Qwen3.8 Flash 131 000 tokenów. W praktyce ten sam poziom.

• Dane wejściowe — tekst i obraz w Union Alpha vs tekst, obraz i wideo w Qwen3.8 Flash.

• Ceny — 0 USD w okresie podglądu Union Alpha vs Qwen3.8 Flash po 0,150 USD/M za wejście, 0,470 USD/M za wyjście, 0,018 USD/M za odczyt z pamięci podręcznej, 0,230 USD/M za zapis do pamięci podręcznej.

• Kontrola rozumowania — brak w Union Alpha w porównaniu z trybem myślenia w Qwen3.8 Flash, który jest domyślnie włączony i można go wyłączyć.

• Czas do pierwszego tokenu — Union Alpha 10,00 s p50 vs Qwen3.8 Flash 6,62 s p50, oba zmierzone na naszym endpoincie w tym samym siedmiodniowym oknie. Szybkość surowego dekodowania jest bliższa, niż sugeruje reputacja: 170 tokenów na sekundę przeciwko 103.

• Pochodzenie — anonimowy operator, brak wag w przeciwieństwie do Alibaba/Qwen, z wagami Qwen3.8-Flash-Next udostępnionymi na zasadach open source na Hugging Face i ModelScope.

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash: zakład na efektywność oparty na 6B aktywnych parametrów

Qwen3.8 Flash zadebiutował 26 sierpnia 2026 r. jako produkcyjna, zarządzana wersja otwartego checkpointu Qwen3.8-Flash-Next o otwartych wagach, który firma Alibaba udostępniła jednocześnie. Jest to model typu mixture-of-experts o 125 mld parametrów, aktywujący około 6 mld parametrów na token, plus 51 mld parametrów embeddingu N-gram, oparty na hybrydowej uwadze łączącej Gated DeltaNet z indekserem rzadkiej uwagi.

Ujęcie dostawcy dotyczy ekonomiki trenowania: Alibaba podaje, że koszt uruchomienia wynosi około jednej dziewiątej kosztu Qwen3.7-Plus, z deklarowanym prefill do 7,6× szybszym i dekodowaniem do 4,9× szybszym w obciążeniach 1M tokenów przy wysokim współczynniku trafień w pamięci podręcznej. To są dane dostawcy i nie zostały niezależnie odtworzone.

Jej tabela benchmarków również pochodzi od dostawcy i nie została odtworzona: SWE-bench Pro 62,5, DeepSWE v1.1 58,7, SWE-bench Multilingual 81,0, NL2Repo 48,1, CoWorkBench 73,9, JobBench 55,7, RealWorldQA 88,5, LVBench 76,6, AndroidWorld 84,5. Liczbą, którą warto przytoczyć w odpowiedzi działowi marketingu, jest Humanity's Last Exam z wynikiem 35,9, który w tym samym porównaniu plasuje się poniżej 40,0 modelu Claude Opus 4.6.

Na naszej własnej stronie modelu sekcja publicznych benchmarków wciąż widnieje jako „oczekujące” — żadna strona trzecia jeszcze go nie oceniła. To, co mamy, to nasz własny ruch: mediana czasu do pierwszego tokenu wynosząca 6,62 sekundy, przepustowość wyjściowa na poziomie 103 tokenów na sekundę oraz wskaźnik błędów na poziomie 4,5%. Ten wskaźnik błędów jest wystarczająco wysoki, by warto było go obserwować, i jest to rodzaj liczby, która pojawia się tylko wtedy, gdy mierzy się aktywny endpoint, a nie wpis premierowy.

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha: model bez właściciela

Union Alpha pojawił się w katalogach firm trzecich 16 września 2026 r. i jest udostępniany w darmowym planie OrcaRouter. Nie ma nazwanego laboratorium, wag, licencji, liczby parametrów ani informacji o architekturze. W polu dostawcy widnieje „Stealth”.

Jego endpoint jest przynajmniej czytelny: kontekst 262 144 tokenów, maksymalna długość wyjścia 131 072 tokenów, wejście tekstowe i obrazowe z wyjściem wyłącznie tekstowym, wywoływanie narzędzi, wyjście JSON, temperature, top_p i max_tokens oraz całkowity brak mechanizmów kontroli rozumowania. Wybór narzędzia w praktyce uwzględnia tylko „auto”. Jego darmowe okno opisano jako trwające około tygodnia, z limitem szybkości, bez ogłoszonego cennika po zakończeniu wersji preview.

Podane twierdzenie — „wydajność na poziomie frontier w szerokim zakresie zadań ogólnego przeznaczenia” — pochodzi od operatora i nie zostało poddane audytowi. Wynik 136/157 w Official A jest jedynym istniejącym niezależnym pomiarem.

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

Szybkość to obszar, w którym przestają wyglądać podobnie.

Główne liczby dotyczące przepustowości nie rozróżniają ich w sposób, jakiego można by się spodziewać, a powód warto zrozumieć.

Na podstawie naszej własnej telemetrii routingu z ostatnich siedmiu dni, Qwen3.8 Flash strumieniuje z szybkością 103 tokenów wyjściowych na sekundę, ze medianą czasu do pierwszego tokenu (p50) wynoszącą 6,62 sekundy i 4,5% wskaźnikiem błędów. Union Alpha, mierzony w ten sam sposób, strumieniuje z szybkością 170 tokenów na sekundę. Pod względem surowej szybkości dekodowania anonimowy model jest szybszy z tych dwóch.

To, czego nie robi, to nie startuje. p50 i p95 czasu do pierwszego tokenu w Union Alpha są przypięte do 10,00 sekundy, co oznacza, że co najmniej połowa wszystkich żądań czeka dziesięć sekund lub dłużej, zanim pojawi się pierwszy token, a wskaźnik błędów w tym samym oknie wynosi 7,7% — około 1,7 razy więcej niż w Qwen. Przebieg Official A obejmujący 157 testów, na którym opierają się wcześniejsze sekcje, zajął 4,6 godziny czasu zegarowego, z medianą opóźnienia 91,9 sekundy i średnią 104,8 sekundy na test, a cztery testy przekroczyły 300-sekundowy limit czasu harnessa. Niezależni testerzy, którzy uruchomili go w dniu premiery, zgłaszali znacznie niższą przepustowość niż pokazuje nasz endpoint, co jest zgodne z oczekiwaniami wobec usługi, która wciąż absorbuje ogromne obciążenie pierwszego dnia.

Zatem praktyczna różnica nie polega na szybkości dekodowania. Chodzi o czas do pierwszego tokenu i niezawodność. Union Alpha nie nadaje się do niczego interaktywnego — żadnego autouzupełniania, żadnej pomocy inline, żadnej ciasnej pętli agenta — ponieważ dziesięć sekund ciszy jest nie do odróżnienia od zawieszenia. Pasuje do pracy asynchronicznej: nocnych zadań wsadowych, długiego przetwarzania dokumentów, przebiegów ewaluacji offline, w których nic nie czeka na pierwszy token, a 7,7% wskaźnik awaryjności jest niwelowany przez ponowną próbę.

Qwen3.8 Flash z szybkością 103 tokenów na sekundę i medianą czasu do pierwszego tokena wynoszącą 6,62 sekundy też nie jest szybki. Uczciwe ujęcie jest takie, że oba są wolne, a tylko jeden z nich zawodzi w przybliżeniu raz na trzynaście żądań.

Argument o efektywności i kto może go wysunąć

Alibaba wysuwa argument dotyczący kosztów treningu: jedna dziewiąta kosztu treningu Qwen3.7-Plus, sześć miliardów aktywnych parametrów na token, a zatem tanio w obsłudze. To twierdzenie o modelu, którego wagi istnieją i którego pochodzenie jest udokumentowane.

Narracja Union Alpha o wydajności jest sugerowana, a nie wyrażona wprost — anonimowy model 256K, którego wywołanie jest bezpłatne. Darmowe to nie to samo co tanie. Ktoś płaci za te GPU, wersja preview ma podany termin zakończenia, a samo przyznanie operatora, że dostrajano pod kątem szybkości, sugeruje, że ekonomika serwowania nie jest jeszcze ustalona. Model, który jest darmowy przez tydzień, a potem nie da się go wycenić, ma argument dotyczący wydajności, który wygasa wraz z tym oknem.

Próbować nieznanego, nie stawiając na to

Ta konkretna konfrontacja jest warta zapamiętania z tego powodu, że stanowi najtańszy możliwy test nieprzetestowanego modelu. Qwen3.8 Flash to znana wielkość: dostawca o znanej nazwie, otwarte wagi, opublikowane (choć w wydaniu dostawcy) benchmarki, rzeczywista cena za token na poziomie $0.150/$0.470. Union Alpha to niewiadoma, wyceniona na zero, której cała konkurencyjna teza opiera się na jednym wyniku z 157 testów.

Zamiast wybierać, umieść nieznane za regułą przełączania awaryjnego. OrcaRouter przekazuje cenę katalogową dostawcy z zerową marżą i obsługuje automatyczne przełączanie awaryjne między dostawcami, dzięki czemu endpoint Union Alpha ograniczony limitem lub niedostępny przechodzi do modelu, który nadal odpowiada, zamiast pojawiać się jako nieudane zadanie o 3 w nocy. Oba modele działają na tym samym kluczu, więc eksperyment kosztuje zmianę konfiguracji, a nie drugą integrację — i żaden z nich nie musi być decyzją, której musisz bronić, ponieważ możesz przełączyć routing, gdy darmowe okno się zamknie.

Werdykt

Qwen3.8 Flash to model, na którym warto budować. Sześć miliardów aktywnych parametrów, otwartoźródłowe wagi siostrzane, okno 1 mln tokenów, wejście wideo, działająca prędkość 103 tokenów na sekundę i opublikowana cena, którą można prognozować. Jego benchmarki są raportowane przez dostawcę, a jego wskaźnik błędów warto monitorować, ale należy do kogoś, a ten ktoś dostarcza.

Union Alpha to model, który wyznacza punkt odniesienia. Jednopunktowa różnica w Official A jest naprawdę interesująca — sugeruje, że czymkolwiek to coś jest, nie jest zabawką — a za 0 $, z limitem wyjściowym 131K i wejściem wizyjnym, warto poświęcić mu tydzień uwagi. Ale jednopunktowa różnica w jednym zestawie testów, wygenerowana przez anonimowego operatora z 7,7-procentowym wskaźnikiem błędów, to powód, by to zbadać, a nie powód, by się przełączać.

To, na co warto patrzeć, to to samo, co zawsze rozstrzygało tę kwestię: nazwa. Ox Alpha, poprzedni wpis w tej serii, ujawniono sześć dni po tym, jak pojawił się jako GLM-5.3-Flash firmy Zhipu. Jeśli Union Alpha ją dostanie, porównanie przestaje dotyczyć punktu, a zaczyna dotyczyć ceny.

Znana wielkość ma ustaloną cenę i dokumentację: strona modelu Qwen3.8 Flash pokazuje stawki $0.150/$0.470, obsługiwany kontekst 1M tokenów i limit wyjściowy 131K, a publiczne benchmarki wciąż są w toku.