
Union Alpha kontra Gemini 3.8 Flash: jeden ma wynik, drugi ma twierdzenie
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha i Gemini 3.8 Flash to ten sam przekaz sprzedażowy przedstawiony na dwóch zupełnie różnych poziomach dowodu. Operator Union Alpha opisuje go jako mający „wydajność na poziomie frontier w szerokim zakresie zadań ogólnego przeznaczenia” i nie opublikował żadnego benchmarku, liczby parametrów, licencji ani nazwy. Gemini 3.8 Flash trafił na rynek z opatrzoną datą tabelą ewaluacji, indeksem Artificial Analysis Intelligence Index, danymi dotyczącymi kosztów na zadanie od niezależnych testerów oraz udokumentowanym harmonogramem cenowym sięgającym 2027 roku. Jeśli wybierasz między nimi na podstawie czegokolwiek innego niż cena, wybierasz między liczbą, którą możesz sprawdzić, a zdaniem, którego sprawdzić nie możesz.
Obok siebie, przed kłótnią
• Okno kontekstowe — Union Alpha 262 144 tokeny vs Gemini 3.8 Flash 1 048 576 tokenów.
• Maksymalna liczba tokenów wyjściowych — 131 072 tokeny vs 65 536 tokenów. Union Alpha wygrywa w tym przypadku i jest to jedyna oś strukturalna, w której wygrywa.
• Dane wejściowe — tekst i obraz w obu, ale Gemini 3.8 Flash dodatkowo obsługuje wideo, audio i pliki.
• Ceny — Union Alpha: 0 USD w wersji zapoznawczej vs Gemini 3.8 Flash: 0,75 USD/mln za wejście, 3,75 USD/mln za wyjście, 0,075 USD/mln za wejście z pamięci podręcznej, a od 1 stycznia 2027 r. podwajają się do 1,50 USD/7,50 USD.
• Kontrola rozumowania — żadna nie jest udostępniona w Union Alpha w porównaniu z poziomami myślenia w Gemini 3.8 Flash, które bezpośrednio przekładają się zarówno na jakość, jak i koszt.
• Opublikowana ocena — żadna od operatora Union Alpha w porównaniu z pełną tabelą z datami dotyczącą Gemini 3.8 Flash.
• Proweniencja — anonimowy operator, brak wag vs datowana premiera i udokumentowana linia rozwojowa Gemini 3.8 Flash.

Co tak naprawdę mówią liczby Gemini 3.8 Flash
Gemini 3.8 Flash zadebiutował 2 września 2026 r. — to trzecia premiera Flash od Google w ciągu około sześciu tygodni, co pokazuje, jak dużą część historii tego modelu stanowi rytm wydań, a nie przełom. Opublikowana tabela ewaluacyjna przypisuje zasługi artificialanalysis.ai i deepmind.google łącznie, więc należy ją czytać jako mieszankę danych niezależnych i danych dostawcy, a nie jako czysty audyt strony trzeciej.
• AA Coding — 76,3, co jest naprawdę mocnym wynikiem w kodowaniu.
• AA Intelligence — 41,2. Zwróć uwagę, że Artificial Analysis osobno podaje 59 w Intelligence Index przy wysokim wysiłku rozumowania, więc liczba znacząco zmienia się wraz z ustawieniem wysiłku; podaj to ustawienie, bo inaczej liczba nic nie znaczy.
• GPQA Diamond — 95,3, najwyższa pojedyncza wartość w tym porównaniu, i to ze znaczną przewagą.
• HLE-Verified — 54.9, a zwykły Humanity's Last Exam na poziomie 47.8.
• Terminal-Bench 2.1 — 89,4 w tabeli samego Google, minimalnie przed 89,1 Claude Opus 5.
• Przywoływanie w długim kontekście — 81,3; SciCode 56,6; tau_banking 44,9.
• Obserwowana przepustowość — 323 tokeny wyjściowe na sekundę w ostatnim siedmiodniowym oknie, przy współczynniku błędów 0,63%, medianie czasu do pierwszego tokenu wynoszącej 3,46 sekundy i 498,5 mln tokenów zmierzonego ruchu.
Słabości są tak samo udokumentowane jak mocne strony. W Terminal-Bench 4.0 osiąga 19,1 punktu wobec 51,8 w Claude Opus 5. W OSWorld 2.0 uzyskuje 59,0% wobec 75,4%. W GDPVal-AA v2 pozostaje w tyle z wynikiem 1545 Elo wobec 1824. Gemini 3.8 Flash jest doskonały w określonym przedziale zadań, a na najtrudniejszych ewaluacjach ogólnych agentów spada z klifu — i dokładnie taki kształt pozwala zobaczyć opublikowana tabela.
Cenowy haczyk, który zaskakuje ludzi
Google pozostawiło cenę za token bez zmian względem Gemini 3.7 Flash. Rachunek i tak wzrósł.
Model pracuje ciężej: więcej kroków rozumowania, więcej iteracyjnych wywołań narzędzi. Niezależne testy przeprowadzone przez Artificial Analysis zmierzyły około 30% więcej tokenów wyjściowych na zadanie i około 40% wyższy koszt na zadanie niż w przypadku 3.7 Flash. Przy wysokim poziomie rozumowania daje to około 0,58 USD na zadanie; średni poziom wynosi blisko 0,41 USD, a niski blisko 0,24 USD.
To najużyteczniejsza rzecz w tym porównaniu dla każdego, kto planuje budżet, i odnosi się znacznie szerzej niż te dwa modele: cena jednostkowa i koszt na zadanie to różne liczby, a tylko jedna z nich pojawia się na stronie z cennikiem. Google utrzymało 3.7 Flash w ofercie jako tańszą opcję, co jest milczącym uznaniem tej zmiany.
Co Union Alpha oferuje w zamian
Union Alpha pojawił się w katalogach firm trzecich 16 września 2026 roku i działa w ramach darmowego planu OrcaRouter. Jest anonimowy — żadnego laboratorium, żadnych wag, żadnej licencji, żadnej daty granicznej wiedzy — i bezpłatny przez podany okres około tygodnia, z ograniczeniem częstotliwości, bez ogłoszonej ceny po zakończeniu okresu zapowiedzi.
Jego endpoint jest weryfikowalny nawet wtedy, gdy jego pochodzenie nie jest: kontekst 262 144 tokenów, maksymalna długość wyjścia 131 072 tokenów, wejście tekstowe i obrazkowe z wyjściem wyłącznie tekstowym, wywoływanie narzędzi i wyjście JSON, temperature, top_p, max_tokens oraz brak jakichkolwiek mechanizmów sterowania rozumowaniem. Wybór narzędzia w praktyce obsługuje tylko „auto”.
Istnieje dokładnie jeden niezależny pomiar. SMF Clearinghouse przeprowadził 157 testów Official A z wyłączonym rozumowaniem i uzyskał wynik 136/157 — 86,6%, zero błędów, dziesiąty na dwadzieścia sześć. Rozumowanie było perfekcyjne przy 30/30, narzędzia 2/2, kodowanie 26/30, matematyka 24/30. Pisanie wypadło na 2/5.
To nie jest zły wynik. Po prostu nie jest to wynik porównywalny. Official A to szeroki ogólny zestaw 157 testów; AA Coding i GPQA Diamond to różne instrumenty mierzące różne rzeczy na różnych poziomach trudności. Postawienie 136/157 obok 95,3 w GPQA Diamond i ogłoszenie zwycięzcy byłoby dokładnie tym rodzajem prania, które czyni liczby podawane przez dostawców bezużytecznymi.


Porównanie kosztów, którego tak naprawdę nikt nie może dokończyć
Oto rozwiązany przykład, który jest celowo niekompletny.
Weź zadanie, które wykonujesz tysiąc razy w miesiącu. W przypadku Gemini 3.8 Flash przy wysokim poziomie rozumowania opublikowana wartość na zadanie wynosząca około 0,58 USD daje to około 580 USD miesięcznie. To realna, możliwa do obrony liczba oparta na zmierzonym zużyciu tokenów.
W przypadku Union Alpha ten sam tysiąc zadań kosztuje dziś $0. Ile będą kosztować za trzy tygodnie, nie wiadomo, ponieważ nie istnieje cena po zakończeniu okresu zapoznawczego. Nie wiadomo też, ile kosztują pod względem niezawodności, ponieważ model ma limit liczby żądań, działa na pojedynczym punkcie końcowym bez dostawcy zapasowego i odpowiada kodem HTTP 429, gdy przekroczysz limit, którego nikt nie opublikował.
Uczciwa odpowiedź jest więc taka, że Union Alpha wygrywa jedyne dostępne porównanie kosztów i traci możliwość prognozowania kosztu. W przypadku jednorazowego testu porównawczego to nie problem. W pozycji budżetowej to nie liczba — to nadzieja z adresem URL.
Gdzie każdy należy
Gemini 3.8 Flash sprawdza się wszędzie tam, gdzie potrzebujesz miarodajnego poziomu odniesienia: w pracy z dokumentami w długim kontekście z wejściem wideo lub audio, w zadaniach programistycznych, w których właściwym miernikiem jest wynik AA Coding 76,3, oraz w każdym obciążeniu z przypisanym budżetem, ponieważ koszt możesz obliczyć, zanim się zobowiążesz, i wiesz, że 1 stycznia 2027 r. się podwoi.
Union Alpha pasuje do slotu eksploracyjnego — wypróbowania modelu 256K obsługującego wizję, którego pułap wyjściowy jest dwukrotnie wyższy niż w Gemini, w pracy, gdzie zniknięcie endpointu nic cię nie kosztuje.
Powodem, dla którego warto uruchamiać je za jednym punktem końcowym, a nie w ramach dwóch integracji, jest to, że to porównanie będzie wielokrotnie zmieniać kształt. DSL routingu pozwala połączyć oba w jedno wywołanie — Gemini 3.8 Flash jako ścieżkę pomiarową, Union Alpha jako gałąź eksperymentalną — zamiast zakodowywać na sztywno decyzję, do której będziesz chciał wrócić, gdy zamknie się darmowe okno lub gdy wygaśnie cena wprowadzająca Google. Żadna z tych dat nie jest odległa, a obie zmienią rachunek.
Co by to rozstrzygnęło
Jeden opatrzony datą wpis dla Union Alpha w rankingu, w którym znajduje się także Gemini 3.8 Flash. To cały brakujący element. Do tego czasu możliwe do obrony stanowisko to nie „Union Alpha jest tak dobry jak Gemini 3.8 Flash” — lecz „Union Alpha jest darmowy przez tydzień i nikt nie porównał go z niczym, co publikuje Google”. To zupełnie różne zdania i tylko jedno z nich jest obecnie prawdziwe.
Zmierzona połowa pary jest udokumentowana tutaj: strona modelu Gemini 3.8 Flashpodaje stawki 0,75 USD/3,75 USD, 90% zniżki na wejście z pamięci podręcznej oraz limit wyjścia wynoszący 65 536 tokenów, który decyduje o pracy nad długimi raportami.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
