Wygenerowana karta tytułowa z napisem „Boreal vs Qwen3.8 Max” i podtytułem „Wiersz, który każdy dostawca ma nadzieję, że pominiesz”, płaskie ikony liniowe przedstawiające ramkę odtwarzania wideo, tabela wyników z jednym podświetlonym wierszem i lupa, z logo OrcaRouter nałożonym w prawym dolnym rogu.
Guides & Insights

Boreal vs Qwen3.8 Max: wiersz, który każdy dostawca wolałby, żebyś pominął

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Każda premiera modelu wiąże się z publikacją karty liczb, a każda karta ma wiersz, na którym dostawca wolałby, żebyś się nie zatrzymywał. Qwen3.8 Max, wydany 3 sierpnia 2026 roku, ma pochlebne wiersze, które łatwo znaleźć: zajął pierwsze miejsce w rankingu front-endowym CodeArena z 1 691 punktami, osiągnął wynik 58 w Artificial Analysis Agentic Index, dorównując Claude Opus 5 w trybie wysokiego wysiłku — był to najbliższy moment, w jakim chińskie laboratorium zbliżyło się do szczytu tej listy — i uzyskał wynik 1 739 Elo w GDPval-AA, wyprzedzając GPT-5.6 Sol. Wiersz pod nimi jest trudniejszy do odczytania. W tym samym zestawie testów tego ewaluatora mierzony poziom halucynacji wzrósł z 23% w poprzedniej generacji do 40%, a wynik modelu w wyszukiwaniu w długim kontekście spadł o dwa punkty. Boreal, model wideo reklamowych firmy Creatify, zaprezentowany 15 września 2026 roku w cenie jednego centa za sekundę, ma na swojej karcie wiersz tego samego rodzaju — i jest on bardziej konkretny, bo dostawca go opublikował.

Żaden z tych wierszy nie jest dyskwalifikujący. Oba dostarczają więcej informacji niż wyniki z nagłówków, dlatego warto zestawić je obok siebie, a nie porównywać banery.

W czym Qwen3.8 Max jest naprawdę najlepszy

Zwycięstwa są prawdziwe i nie są małe.

Qwen3.8 Max to model typu mixture-of-experts o 2,4 biliona parametrów, z około 95 miliardami parametrów aktywnych na token, i jest to pierwszy Qwen klasy Max, który według Alibaby zostanie udostępniony na otwartych wagach — zapowiedziany na tydzień 10 sierpnia 2026 roku, bez licencji i bez konkretnej daty, co warto odnotować, ponieważ ogłoszenie to nie to samo co wydanie. Ma okno kontekstu wynoszące 1 mln tokenów i limit generowania na poziomie 131 072 tokenów, a jako dane wejściowe przyjmuje tekst, obrazy i wideo. Ten ostatni punkt zasługuje na podkreślenie w tym konkretnym porównaniu: spośród czterech czołowych modeli tekstowych, które ta seria zestawia z Boreal, Qwen3.8 Max jest jednym z zaledwie dwóch, którym można podać gotowy klip wideo i zadać pytanie na jego temat.

Ceny są agresywne w sposób, który przekształcił ten segment. Przy $2.00 za milion tokenów wejściowych i $6.00 za milion tokenów wyjściowych, z odczytami z pamięci podręcznej po $0.25, jest to o około 20% tańsze od poprzedniej generacji, co podwaja maksymalną długość wyjścia. Na naszej tablicy przekłada się to na $2.00 i $6.00, kontekst 1M tokenów, p50 czasu do pierwszego tokenu wynoszący 10.00 sekundy — pułap, który raportuje nasza instrumentacja, więc czytaj to jako „wolno”, a nie jako dokładny pomiar — oraz 183.0 miliona tokenów ruchu w ciągu ostatnich siedmiu dni.

A wiersz poniżej

Oto część, która nie trafiła do nagłówka wpisu o premierze.

Niezależna ewaluacja Artificial Analysis odnotowała dwie regresje między Qwen3.7-Max a Qwen3.8 Max. Jego miara wyszukiwania w długim kontekście spadła o dwa punkty. Jego miara wszechwiedzy spadła o dziesięć, a mierzony przez ewaluatora wskaźnik halucynacji wzrósł z 23% do 40%. Jednocześnie koszt modelu na zadanie w indeksie inteligencji wzrósł z 0,53 USD do 1,14 USD — potrzebował około 64 tur na zadanie, podczas gdy jego poprzednik potrzebował 14.

Przeczytaj je razem, a wyłoni się spójny obraz. Qwen3.8 Max to model, który stał się lepszy w tym, co potrafią mierzyć benchmarki z jedną poprawną odpowiedzią — kod, realizację zadań agentowych, rozwiązywanie ustrukturyzowanych problemów — a gorszy w tym, co najtrudniej ocenić: w wiedzy o tym, kiedy nie wie. Model, który więcej rozważa i więcej halucynuje, nie przeczy sam sobie. Dłuższe ślady rozumowania tworzą więcej okazji, by przyjąć pewną siebie błędną odpowiedź, a benchmark nagradzający ukończenie zadania nie karze za to, dopóki zadanie nie zawiera ukrytego niezmiennika, który można naruszyć.

Dla kupującego praktyczna konsekwencja jest wąska i konkretna. Jeśli używasz modelu do generowania kodu lub w przepływie pracy agentowej, w którym błędna odpowiedź kończy się głośnym niepowodzeniem — test nie przechodzi, kompilacja się psuje — regresje są w dużej mierze niewidoczne, a zyski to cała historia. Jeśli używasz go do wyszukiwania informacji, streszczania lub czegokolwiek, gdzie płynna błędna odpowiedź dociera do człowieka bez sprawdzenia, to przesunięcie z 23 do 40 jest liczbą, która powinna decydować o twojej ocenie, a nie pozycja w CodeArena.

Najgorszy wiersz samego Boreala, opublikowany przez dostawcę

Kontrast, który czyni to zestawienie przydatnym, polega na tym, że Creatify zrobiło coś, czego większość dostawców nie robi: umieściło swój najsłabszy wynik w tym samym poście co najsilniejszy.

Boreal został przetestowany metodą ślepą przeciwko własnemu nienaruszonemu modelowi bazowemu, przy stałym promptcie, rozdzielczości, liczbie klatek i ziarnie, w 40 produkcyjnych przypadkach. Creatify podaje 81% preferencji dla Boreal — 25 do 6 przy 9 remisach, test znaków p<0,001 — a następnie rozbija tę średnią. Reklamy produktów: 83%. Sceny twórców i UGC: 85%. Klipy z mówiącą jedną osobą: 60%.

Ta ostatnia liczba to wiersz. Gadające głowy należą do najczęstszych formatów w reklamie direct-response i to właśnie w tym formacie przewaga modelu nad jego własną wersją bazową jest najmniejsza — ledwie lepsza niż rzut monetą w porównaniu z modelem, którego i tak nikt nie zamierzał wypuścić. Renderowanie jest podawane w stosunku 1:1 do czasu rzeczywistego w klasie 720p, a retencja drobnych szczegółów poprawiła się o 11,3% przy p=0,004, więc ogólny obraz jest naprawdę pozytywny. Podział po prostu mówi, na którą połowę tej kategorii ten model został dostrojony, a nie jest to ta połowa, w której osoba mówi do kamery.

Zwróć też uwagę na to, jakiego rodzaju dowodem jest każdy z tych wierszy. Regresję Qwen3.8 Max wykrył niezależny ewaluator, który uruchomił własny harness. Słaby wiersz Boreala został ujawniony przez dostawcę, w teście, który dostawca zaprojektował i przeprowadził. Drugi jest bardziej wiarygodny jako stwierdzenie faktu, a mniej informacyjny jako porównanie, ponieważ w pliku Boreala nie ma nigdzie niezależnej liczby.

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

Kontrast specyfikacji

• Dane wyjściowe — Boreal: wygenerowane wideo, klasa 720p, tekst na wideo i obraz na wideo. Qwen3.8 Max: tylko tekst, do 131 072 tokenów.

• Dane wejściowe — Boreal: prompt tekstowy lub obraz statyczny. Qwen3.8 Max: tekst, obrazy i wideo.

• Cena — Boreal: 0,01 USD za sekundę gotowego wideo. Qwen3.8 Max: 2,00 USD za 1 mln tokenów wejściowych / 6,00 USD za 1 mln tokenów wyjściowych, odczyty z pamięci podręcznej po 0,25 USD.

• Kontekst — Boreal: niepublikowany. Qwen3.8 Max: 1 mln tokenów na wejściu, 131 tys. na wyjściu.

• Opóźnienie — Boreal: podawane w stosunku 1:1 do czasu rzeczywistego. Qwen3.8 Max: mediana (p50) czasu do pierwszego tokenu wynosi 10,00 sekundy na naszej tablicy.

• Wagi — Boreal: zastrzeżone, stanowiące własność Creatify i udostępniane przez Creatify. Qwen3.8 Max: zastrzeżone w momencie premiery; Alibaba ogłosiła wydanie otwartych wag dla pierwszego Qwena klasy Max, bez potwierdzonej licencji i daty.

• Dowody — Boreal: ślepy test 40 przypadków przeprowadzony przez dostawcę, brak niezależnej oceny. Qwen3.8 Max: niezależne pokrycie benchmarków, w tym dwie zmierzone regresje, obok wierszy dostawcy: 86,1 w OSWorld-Verified i 86,6 w Terminal-Bench 2.1.

Ile warta jest regresja dla kogoś, kto kupuje

Regresje w rankingach są zwykle traktowane jako błahostka. Bliżej im do najbardziej istotnej dla decyzji rzeczy, jaką publikuje benchmark, ponieważ to jedyne wiersze, które mówią, co dostawca oddał w zamian.

Sensownym posunięciem nie jest czytanie żadnej z tych dwóch kart, lecz uruchomienie obu modeli na własnym ruchu — a praktyczną przeszkodą jest to, że zwykle oznacza to dwie umowy, dwa SDK i dwie relacje rozliczeniowe, co stanowi wystarczającą barierę, by większość zespołów pominęła test i zamiast tego kupiła na podstawie wyniku z nagłówka.

To właśnie to tarcie eliminuje warstwa routingu. Qwen3.8 Max jest w naszym katalogu obok poprzedniej generacji, więc porównanie ich na własnym zbiorze ewaluacyjnym to zmiana jednej linii w ciągu modelu, a nie cykl zakupowy, a ten sam klucz daje dostęp do reszty katalogu, gdy porównanie pokaże, że chcesz inny model na inny etap potoku. Znajduje się na poziomie stawki cennika dostawcy z 0% marży, co ma tu znaczenie z konkretnego powodu: Qwen3.8 Max pojawił się około 20% taniej niż generacja, którą zastąpił, a tego rodzaju zmiana ceny u dostawcy powinna trafić na Twój rachunek w momencie, gdy się pojawia, a nie przy kolejnym odnowieniu.

Boreal nie znajduje się w naszym katalogu. OrcaRouter nie obsługuje modeli generowania wideo i nic tutaj nie powinno być odczytywane jako twierdzenie przeciwne. To, co obsługujemy, to warstwa ponad tym — teksty, warianty, kontrola zgodności, analiza tego, co się sprawdziło — a dwóm modelom z tej serii, w tym Qwen3.8 Max, można przekazać gotowy klip do przejrzenia.

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

Jak odczytać dowolną z dwóch kart

Qwen3.8 Max to lepszy zakup, jeśli Twoja praca to kod, agenci lub ustrukturyzowane rozumowanie, w cenie niższej niż cena jego własnego poprzednika, a dwie niezależne regresje to powód, by przetestować go na Twoim ruchu związanym z wyszukiwaniem i streszczaniem, zanim skierujesz tam produkcję. Wskaźnik 40% halucynacji nie jest powodem, by unikać tego modelu; jest powodem, by wiedzieć, które z Twoich obciążeń mogą go tolerować.

Boreal jest jedynym z dwóch, który tworzy artefakt, którego to porównanie nominalnie dotyczy, i jest najtańszą wiarygodną opcją według publikowanych stawek za krótkie reklamowe wideo. Jego ograniczenie jest specyficzne dla formatu i podane przez samego dostawcę: 60% preferencji w przypadku klipów z mówiącą jedną osobą. Przetestuj ten format przed reklamami produktów, ponieważ właśnie tam zapas jest najmniejszy.

Dwie rzeczy mogłyby to zmienić. Gdyby Alibaba udostępniła otwarte wagi, które zapowiedziała dla Qwen3.8 Max, zmieniłyby się zarówno cena, jak i trwałość modelu, a licencja, na podstawie której zostanie udostępniony, będzie miała większe znaczenie niż data. A w przypadku Boreal pierwsza niezależna ocena — jakakolwiek, przeprowadzona przez kogokolwiek — zastąpiłaby test dostawcy obejmujący 40 przypadków, który obecnie dźwiga cały ciężar dowodowy dla modelu sprzedawanego do formatu, w którym marki są wyjątkowo wrażliwe na to, jak wygląda ich produkt.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie