Wygenerowana karta tytułowa do „ARTEMIS vs Qwen3.8” z podtytułem „Ten sam benchmark, dwa różne zadania”, kontrastująca samodzielnie zgłoszony wynik ARTEMIS na poziomie 99,1% w AndroidWorld z deklarowaną przez dostawcę przewagą Qwen3.8-Flash wynoszącą 22,5 punktu nad Opus 4.6 w tym samym benchmarku, z przypisem, że AndroidWorld nie weryfikuje niezależnie zgłoszeń.
Guides & Insights

ARTEMIS vs Qwen3.8: ten sam benchmark, dwa różne zadania

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

ARTEMIS firmy Google i Qwen3.8 są oba mierzone na AndroidWorld, a ten zbieg okoliczności to najbardziej mylący pojedynczy fakt w materiałach premierowych każdego z tych projektów. ARTEMIS to środowisko automatyzacji Androida — udostępnione przez Google jako open source w sierpniu 2026 r. na licencji Apache 2.0; przyjmuje instrukcję w języku naturalnym, steruje prawdziwym telefonem przez ADB i deklaruje wskaźnik ukończenia przekraczający 99% w opracowanym przez Google Research benchmarku AndroidWorld obejmującym 116 zadań, osiągając 99,1% w publicznym rankingu na dzień 11 września 2026 r. Qwen3.8-Flash to multimodalny model typu mixture-of-experts firmy Alibaba, wydany i udostępniony jako open source 26 sierpnia 2026 r., którego materiały premierowe twierdzą, że bije Claude Opus 4.6 o 22,5 punktu na AndroidWorld. Jedna z tych liczb to wynik systemu. Druga to wkład modelu w system, który napisał ktoś inny. Czytaj je jako rywali, a wyciągniesz błędny wniosek na temat obu; czytaj je jako dwie połowy jednego stosu, a interesujące pytanie — ile tak naprawdę kosztuje długi przebieg na Androidzie — wreszcie ma odpowiedź.

Czym jest Qwen3.8 w podziale na rozmiary

"Qwen3.8" to rodzina, a nie pojedynczy checkpoint, a członek, który ma tu znaczenie, nie jest flagowcem.

Qwen3.8-Max — flagowy poziom, pozycjonowany względem wiodących modeli hostowanych.

Qwen3.8-27B — otwarty, średniej wielkości, gęsty brat.

Qwen3.8-Flash — multimodalny MoE na nowej architekturze „Next”: 125B parametrów transformera, z których tylko 6B jest aktywowanych na token, Qwen Sparse Attention połączona z GDN w hybrydowym schemacie uwagi, przyspieszającym długi kontekst w przypadku trafień w pamięci podręcznej, Gated Residual dzielący kanał informacyjny na cztery sposoby oraz 51B parametrów osadzeń N-gram. Alibaba opisuje architekturę Next jako prototyp następnej generacji Qwen4.

Kontekst — natywnie duży, w większości specyfikacji 1M tokenów, a niektóre źródła opisują 262K natywnie rozszerzone do 1M. Maksymalna długość wyjścia to około 131K.

Cena — opublikowana stawka API wynosi ¥1 za milion tokenów wejściowych i ¥3 za milion tokenów wyjściowych, co w naszym katalogu daje $0,15 / $0,47, przy czym odczyt z pamięci podręcznej to $0,018, a zapis do niej $0,230. Alibaba sama ujmuje to tak, że cena trafienia w pamięć podręczną już od ¥0,1 za milion sprawia, że przepływy pracy agentów z długim wejściem stają się opłacalne, a liczby to potwierdzają: odczyt z pamięci podręcznej kosztuje około jednej dwunastej świeżego tokenu wejściowego.

Kwestia otwartych wag — wagi Flash zostały opublikowane w Hugging Face i ModelScope w dniu premiery. Zwróć uwagę, jak liczona jest rodzina: Alibaba twierdzi, że seria Qwen3.8 udostępniła na zasadach open source trzy rozmiary — Max, 27B i Flash — łącznie 2,4 bln parametrów, co jest wartością skumulowaną dla całej serii, a nie liczbą parametrów któregokolwiek modelu.

Twierdzenia dotyczące benchmarków są szerokie i — zgodnie z własnymi materiałami premierowymi Alibaby — wszystkie dotyczą delt, a nie wartości absolutnych: SWE-bench Pro +9,1 względem Opus 4.6, JobBench około +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Delty względem nienazwanej konfiguracji modelu konkurencji nie są tym samym rodzajem dowodów co pozycja w rankingu, a żadnej z nich nie odtworzono niezależnie. Główna narracja firmy — przedefiniowanie branżowej „linii śmierci” kosztów z ceny za token na całkowity koszt ukończonego zadania — to twierdzenie, które faktycznie ma znaczenie w tym porównaniu, i zarazem takie, które możesz sprawdzić samodzielnie.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

Co wnosi ARTEMIS i dlaczego tych dwóch liczb nie można porównywać

ARTEMIS nie zawiera żadnego modelu. Jej plakietka głosi „Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL”, a jej konfiguracja znajduje się w code>config/artemis.jsonc/code>. To, co wnosi, to część, która zamienia przypuszczenie modelu w zweryfikowane działanie: lokalizator działający przede wszystkim dynamicznie, który odczytuje drzewo dostępności, gdy tylko może, i przechodzi na wizję oraz współrzędne, gdy powierzchnia Compose lub Flutter nie daje mu nic; Safety Net, który usuwa przeszkadzające okienka systemowe, zanim dotknięcie nastąpi; weryfikacja punktów kontrolnych na czterech poziomach od code>off/code> do code>strict/code>, oraz rejestr sesji, który kompresuje stare zrzuty ekranu w podsumowania wizualne, dzięki czemu kontekst o stu krokach pozostaje przystępny kosztowo.

Dostarcza również natywny serwer MCP. code>uv run artemis mcp --install all/code> udostępnia code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> i code>mobile_diagnose/code> dla Antigravity, Claude Code, Codex i wszystkiego innego, co mówi w MCP — i to właśnie sprawiło, że projekt rozprzestrzeniał się tak szybko, oraz stanowi najczystsze określenie tego, do czego służy. ARTEMIS to narzędzie, które wywołuje agent. Tak samo jak model, dlatego umieszczanie ich w tej samej kolumnie to błąd kategorii.

Na jedną rzecz trzeba uważać, czytając 99,1% ARTEMIS: ranking AndroidWorld wprost nie weryfikuje niezależnie zgłoszeń. Każda liczba na nim, w tym liczba ARTEMIS, jest podawana przez sam zespół, który ją uzyskał. To samo zastrzeżenie stosuje się z jeszcze większą mocą do delty przytoczonej w poście o premierze.

Czytanie „vs" na dwa sposoby

Istnieją dwie uczciwe interpretacje tego starcia i wskazują one w przeciwnych kierunkach.

Jako rywale, porównanie w rzeczywistości wygląda tak: „czy powinienem użyć modelu hostowanego plus harnessu, czy powinienem użyć modelu, który jest wystarczająco dobry w zadaniach mobilnych, że sam mogę napisać harness?” W takim ujęciu ARTEMIS wygrywa domyślnie, ponieważ model to nie harness — a różnica +22,5 punktu w AndroidWorld nie mówi, czy Qwen3.8-Flash przetrwa krok 74 ze stu kroków, gdy systemowe okno wyskakujące pochłonie jego stuknięcie. Nic w tabeli benchmarków nie mierzy Safety Net.

Jako stack to porównanie jest tym użytecznym: ARTEMIS jest pętlą sterowania, Qwen3.8-Flash jest wiarygodnym silnikiem dla niej, a pytanie staje się kwestią kosztu i niezawodności przy długich kontekstach. Cała argumentacja Alibaby za tierem Flash — że ważną liczbą jest całkowity koszt na ukończone zadanie, a nie cena za token — jest dokładnie metryką, według której ocenia się zestaw automatyzacji Androida, i metryką, którą możesz zmierzyć na własnym zestawie testowym w ciągu dnia.

Niezręczny szczegół, który stoi na przeszkodzie: Qwen3.8-Flash nie znajduje się na liście przetestowanych backendów ARTEMIS, na której wymieniono Gemini, Claude, GPT-4o i Qwen-VL. Qwen-VL to inny model. Harness przyjmuje endpoint modelu, a to zestawienie jest technicznie możliwe, ale nikt nie opublikował jego ewaluacji, a jeśli go uruchomisz, wykonujesz oryginalną pracę, a nie postępujesz zgodnie z dokumentacją.

Arytmetyka, która o tym decyduje

Oto kalkulacja, którą warto przeprowadzić, zanim którykolwiek z wpisów o premierze przekona cię do czegokolwiek. To model z podanymi założeniami, a nie pomiar, i powinieneś podstawić własne liczby — ale chodzi właśnie o jego kształt.

Weź 100-krokowy przebieg Pro. Pro działa w tempie około 15–40 sekund na krok, więc czas rzeczywisty wynosi od 25 minut do godziny, a każdy krok wysyła zrzut ekranu oraz rosnący prompt. Załóż 8 000 tokenów promptu i 300 tokenów wyjściowych na krok — konserwatywny budżet na zrzuty ekranu i instrukcje, znacznie poniżej kosztu surowej klatki w pełnej rozdzielczości. To daje 800 000 tokenów wejściowych i 30 000 tokenów wyjściowych na jeden test.

Przy stawce Qwen3.8-Flash wynoszącej 0,15 USD / 0,47 USD takie uruchomienie kosztuje około 0,12 USD na wejściu i 0,014 USD na wyjściu — mniej więcej trzynaście centów.

• Przy stawce hostowanego modelu frontier wynoszącej kilka dolarów za milion tokenów wejściowych i kilkanaście dolarów za milion tokenów wyjściowych ten sam przebieg kosztuje dolary, a nie centy. Obie stawki są tu celowo podane z grubsza, ponieważ dokładna liczba zależy od tego, który model frontier wybierzesz, a liczy się stosunek: to rząd wielkości, w każdym teście, w każdym przebiegu.

• A ponieważ ARTEMIS przy każdym kroku ponownie odczytuje rosnący kontekst, ten stosunek poprawia się jeszcze bardziej w przypadku modelu, który ma tańszy odczyt z pamięci podręcznej. Odczyt z pamięci podręcznej Qwen3.8-Flash kosztuje $0,018 za milion wobec $0,15 za świeże dane wejściowe — jedną dwunastą ceny, i to dlatego Alibaba stale wskazuje na wskaźniki trafień w pamięć podręczną, gdy mówi o obciążeniach agentów.

Teraz pomnóż to przez swój zestaw testów. Nocny przebieg regresji obejmujący 500 testów to 400 milionów tokenów wejściowych na noc, a różnica między trzynastoma centami a trzema dolarami na test to różnica między narzędziem testowym, na którego ciągłe uruchamianie cię stać, a takim, które uruchamiasz raz w tygodniu.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

Uruchamianie tego i gdzie liczy się infrastruktura

Jeśli chcesz przetestować tę arytmetykę we własnej aplikacji, uczciwą drogą jest wskazanie ARTEMIS na endpoint modelu i zmierzenie. Qwen3.8-Flash jest w naszym katalogu w opublikowanej cenie $0.15 / $0.47, z odczytami z pamięci podręcznej po $0.018 i zapisami do niej po $0.230, na tym samym kluczu i tym samym rachunku co pozostałe rozmiary Qwen3.8 oraz wszystko inne, co kierujemy — a to właśnie ma znaczenie, gdy wyceniany przepływ pracy to harness wykonujący sto wywołań na test, a nie człowiek wykonujący jedno. Strona modelu zawiera też liczby operacyjne, które chcesz znać, zanim przypiszesz do niego zestaw testów: kontekst 1M tokenów z maksymalnym wyjściem 131K, p50 czasu do pierwszego tokenu wynoszące 7.12 sekundy i p95 na poziomie 10.00, a także około 2,3 miliarda tokenów ruchu, który przez niego przeszedł w ciągu ostatnich siedmiu dni. Ta ostatnia liczba jest nasza, a nie dostawcy, i stanowi rozsądne przybliżenie tego, czy inni już uruchamiają na tym endpoincie długie obciążenia agentowe.

Szczegół infrastrukturalny, który w tej skali przestaje być teoretyczny, to to, co dzieje się na kroku 74. Przebieg Pro utrzymuje swój kontekst na jednym endpoincie przez większą część godziny; incydent po stronie dostawcy w jego trakcie nie degraduje przebiegu, tylko go kończy, a płacisz za 73 kroki, które nie przyniosły wyniku. Kierowanie długiej sesji agenta przez warstwę, która przełącza się awaryjnie na innego dostawcę tego samego modelu, to różnica między niestabilnym zestawem testów a zestawem przerwanym. To przyziemna właściwość inżynierska i to ona decyduje, czy zmierzony koszt przypadający na ukończone zadanie przetrwa zetknięcie z tygodniem rzeczywistych przebiegów.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

Do czego właściwie służy każdy z nich

Jeśli masz aplikację na Androida i zestaw testów, chcesz ARTEMIS, a Qwen3.8-Flash jest kandydatem na silnik dla niego, a nie alternatywą dla niego — nieudokumentowanym, wartym eksperymentu na jedno popołudnie, wycenionym tak, że eksperyment nie kosztuje cię nic wymiernego. Jeśli wybierasz model dla agenta mobilnego, którego sam piszesz, delta +22,5 punktu w AndroidWorld jest powodem, by przyjrzeć się Qwen3.8-Flash, a nie powodem, by w nią wierzyć, ponieważ jest to delta zgłoszona przez dostawcę, bez dołączonego wyniku absolutnego i bez niezależnej reprodukcji.

To, o co oba projekty po cichu się spierają, jest tym samym, i żaden z nich nie mówi tego wprost. Google twierdzi, że to harness sprawia, że mobilny agent jest niezawodny, i udostępnia go jako open source, aby można było sprawdzić to twierdzenie. Alibaba twierdzi, że koszt na ukończone zadanie to jedyna liczba, która się liczy, i odpowiednio ustala ceny. Prawdopodobnie oba stanowiska są słuszne, dlatego interesującą konfiguracją nie jest ARTEMIS ani Qwen3.8 — jest nią ARTEMIS na Qwen3.8-Flash, mierzona na własnej aplikacji, z pozostawionym włączonym zapisem śladu.

A ponieważ ARTEMIS ponownie odczytuje rosnący kontekst na każdym kroku, współczynnik poprawia się jeszcze bardziej w przypadku modelu, który ma tańszy odczyt z pamięci podręcznej.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie