
ARTEMIS vs Qwen3.8: ten sam benchmark, dwa różne zadania
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
ARTEMIS firmy Google i Qwen3.8 są oba mierzone na AndroidWorld, a ten zbieg okoliczności to najbardziej mylący pojedynczy fakt w materiałach premierowych każdego z tych projektów. ARTEMIS to środowisko automatyzacji Androida — udostępnione przez Google jako open source w sierpniu 2026 r. na licencji Apache 2.0; przyjmuje instrukcję w języku naturalnym, steruje prawdziwym telefonem przez ADB i deklaruje wskaźnik ukończenia przekraczający 99% w opracowanym przez Google Research benchmarku AndroidWorld obejmującym 116 zadań, osiągając 99,1% w publicznym rankingu na dzień 11 września 2026 r. Qwen3.8-Flash to multimodalny model typu mixture-of-experts firmy Alibaba, wydany i udostępniony jako open source 26 sierpnia 2026 r., którego materiały premierowe twierdzą, że bije Claude Opus 4.6 o 22,5 punktu na AndroidWorld. Jedna z tych liczb to wynik systemu. Druga to wkład modelu w system, który napisał ktoś inny. Czytaj je jako rywali, a wyciągniesz błędny wniosek na temat obu; czytaj je jako dwie połowy jednego stosu, a interesujące pytanie — ile tak naprawdę kosztuje długi przebieg na Androidzie — wreszcie ma odpowiedź.
Czym jest Qwen3.8 w podziale na rozmiary
"Qwen3.8" to rodzina, a nie pojedynczy checkpoint, a członek, który ma tu znaczenie, nie jest flagowcem.
• Qwen3.8-Max — flagowy poziom, pozycjonowany względem wiodących modeli hostowanych.
• Qwen3.8-27B — otwarty, średniej wielkości, gęsty brat.
• Qwen3.8-Flash — multimodalny MoE na nowej architekturze „Next”: 125B parametrów transformera, z których tylko 6B jest aktywowanych na token, Qwen Sparse Attention połączona z GDN w hybrydowym schemacie uwagi, przyspieszającym długi kontekst w przypadku trafień w pamięci podręcznej, Gated Residual dzielący kanał informacyjny na cztery sposoby oraz 51B parametrów osadzeń N-gram. Alibaba opisuje architekturę Next jako prototyp następnej generacji Qwen4.
• Kontekst — natywnie duży, w większości specyfikacji 1M tokenów, a niektóre źródła opisują 262K natywnie rozszerzone do 1M. Maksymalna długość wyjścia to około 131K.
• Cena — opublikowana stawka API wynosi ¥1 za milion tokenów wejściowych i ¥3 za milion tokenów wyjściowych, co w naszym katalogu daje $0,15 / $0,47, przy czym odczyt z pamięci podręcznej to $0,018, a zapis do niej $0,230. Alibaba sama ujmuje to tak, że cena trafienia w pamięć podręczną już od ¥0,1 za milion sprawia, że przepływy pracy agentów z długim wejściem stają się opłacalne, a liczby to potwierdzają: odczyt z pamięci podręcznej kosztuje około jednej dwunastej świeżego tokenu wejściowego.
• Kwestia otwartych wag — wagi Flash zostały opublikowane w Hugging Face i ModelScope w dniu premiery. Zwróć uwagę, jak liczona jest rodzina: Alibaba twierdzi, że seria Qwen3.8 udostępniła na zasadach open source trzy rozmiary — Max, 27B i Flash — łącznie 2,4 bln parametrów, co jest wartością skumulowaną dla całej serii, a nie liczbą parametrów któregokolwiek modelu.
Twierdzenia dotyczące benchmarków są szerokie i — zgodnie z własnymi materiałami premierowymi Alibaby — wszystkie dotyczą delt, a nie wartości absolutnych: SWE-bench Pro +9,1 względem Opus 4.6, JobBench około +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Delty względem nienazwanej konfiguracji modelu konkurencji nie są tym samym rodzajem dowodów co pozycja w rankingu, a żadnej z nich nie odtworzono niezależnie. Główna narracja firmy — przedefiniowanie branżowej „linii śmierci” kosztów z ceny za token na całkowity koszt ukończonego zadania — to twierdzenie, które faktycznie ma znaczenie w tym porównaniu, i zarazem takie, które możesz sprawdzić samodzielnie.

Co wnosi ARTEMIS i dlaczego tych dwóch liczb nie można porównywać
ARTEMIS nie zawiera żadnego modelu. Jej plakietka głosi „Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL”, a jej konfiguracja znajduje się w code>config/artemis.jsonc/code>. To, co wnosi, to część, która zamienia przypuszczenie modelu w zweryfikowane działanie: lokalizator działający przede wszystkim dynamicznie, który odczytuje drzewo dostępności, gdy tylko może, i przechodzi na wizję oraz współrzędne, gdy powierzchnia Compose lub Flutter nie daje mu nic; Safety Net, który usuwa przeszkadzające okienka systemowe, zanim dotknięcie nastąpi; weryfikacja punktów kontrolnych na czterech poziomach od code>off/code> do code>strict/code>, oraz rejestr sesji, który kompresuje stare zrzuty ekranu w podsumowania wizualne, dzięki czemu kontekst o stu krokach pozostaje przystępny kosztowo.
Dostarcza również natywny serwer MCP. code>uv run artemis mcp --install all/code> udostępnia code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> i code>mobile_diagnose/code> dla Antigravity, Claude Code, Codex i wszystkiego innego, co mówi w MCP — i to właśnie sprawiło, że projekt rozprzestrzeniał się tak szybko, oraz stanowi najczystsze określenie tego, do czego służy. ARTEMIS to narzędzie, które wywołuje agent. Tak samo jak model, dlatego umieszczanie ich w tej samej kolumnie to błąd kategorii.
Na jedną rzecz trzeba uważać, czytając 99,1% ARTEMIS: ranking AndroidWorld wprost nie weryfikuje niezależnie zgłoszeń. Każda liczba na nim, w tym liczba ARTEMIS, jest podawana przez sam zespół, który ją uzyskał. To samo zastrzeżenie stosuje się z jeszcze większą mocą do delty przytoczonej w poście o premierze.
Czytanie „vs" na dwa sposoby
Istnieją dwie uczciwe interpretacje tego starcia i wskazują one w przeciwnych kierunkach.
Jako rywale, porównanie w rzeczywistości wygląda tak: „czy powinienem użyć modelu hostowanego plus harnessu, czy powinienem użyć modelu, który jest wystarczająco dobry w zadaniach mobilnych, że sam mogę napisać harness?” W takim ujęciu ARTEMIS wygrywa domyślnie, ponieważ model to nie harness — a różnica +22,5 punktu w AndroidWorld nie mówi, czy Qwen3.8-Flash przetrwa krok 74 ze stu kroków, gdy systemowe okno wyskakujące pochłonie jego stuknięcie. Nic w tabeli benchmarków nie mierzy Safety Net.
Jako stack to porównanie jest tym użytecznym: ARTEMIS jest pętlą sterowania, Qwen3.8-Flash jest wiarygodnym silnikiem dla niej, a pytanie staje się kwestią kosztu i niezawodności przy długich kontekstach. Cała argumentacja Alibaby za tierem Flash — że ważną liczbą jest całkowity koszt na ukończone zadanie, a nie cena za token — jest dokładnie metryką, według której ocenia się zestaw automatyzacji Androida, i metryką, którą możesz zmierzyć na własnym zestawie testowym w ciągu dnia.
Niezręczny szczegół, który stoi na przeszkodzie: Qwen3.8-Flash nie znajduje się na liście przetestowanych backendów ARTEMIS, na której wymieniono Gemini, Claude, GPT-4o i Qwen-VL. Qwen-VL to inny model. Harness przyjmuje endpoint modelu, a to zestawienie jest technicznie możliwe, ale nikt nie opublikował jego ewaluacji, a jeśli go uruchomisz, wykonujesz oryginalną pracę, a nie postępujesz zgodnie z dokumentacją.
Arytmetyka, która o tym decyduje
Oto kalkulacja, którą warto przeprowadzić, zanim którykolwiek z wpisów o premierze przekona cię do czegokolwiek. To model z podanymi założeniami, a nie pomiar, i powinieneś podstawić własne liczby — ale chodzi właśnie o jego kształt.
Weź 100-krokowy przebieg Pro. Pro działa w tempie około 15–40 sekund na krok, więc czas rzeczywisty wynosi od 25 minut do godziny, a każdy krok wysyła zrzut ekranu oraz rosnący prompt. Załóż 8 000 tokenów promptu i 300 tokenów wyjściowych na krok — konserwatywny budżet na zrzuty ekranu i instrukcje, znacznie poniżej kosztu surowej klatki w pełnej rozdzielczości. To daje 800 000 tokenów wejściowych i 30 000 tokenów wyjściowych na jeden test.
Przy stawce Qwen3.8-Flash wynoszącej 0,15 USD / 0,47 USD takie uruchomienie kosztuje około 0,12 USD na wejściu i 0,014 USD na wyjściu — mniej więcej trzynaście centów.
• Przy stawce hostowanego modelu frontier wynoszącej kilka dolarów za milion tokenów wejściowych i kilkanaście dolarów za milion tokenów wyjściowych ten sam przebieg kosztuje dolary, a nie centy. Obie stawki są tu celowo podane z grubsza, ponieważ dokładna liczba zależy od tego, który model frontier wybierzesz, a liczy się stosunek: to rząd wielkości, w każdym teście, w każdym przebiegu.
• A ponieważ ARTEMIS przy każdym kroku ponownie odczytuje rosnący kontekst, ten stosunek poprawia się jeszcze bardziej w przypadku modelu, który ma tańszy odczyt z pamięci podręcznej. Odczyt z pamięci podręcznej Qwen3.8-Flash kosztuje $0,018 za milion wobec $0,15 za świeże dane wejściowe — jedną dwunastą ceny, i to dlatego Alibaba stale wskazuje na wskaźniki trafień w pamięć podręczną, gdy mówi o obciążeniach agentów.
Teraz pomnóż to przez swój zestaw testów. Nocny przebieg regresji obejmujący 500 testów to 400 milionów tokenów wejściowych na noc, a różnica między trzynastoma centami a trzema dolarami na test to różnica między narzędziem testowym, na którego ciągłe uruchamianie cię stać, a takim, które uruchamiasz raz w tygodniu.

Uruchamianie tego i gdzie liczy się infrastruktura
Jeśli chcesz przetestować tę arytmetykę we własnej aplikacji, uczciwą drogą jest wskazanie ARTEMIS na endpoint modelu i zmierzenie. Qwen3.8-Flash jest w naszym katalogu w opublikowanej cenie $0.15 / $0.47, z odczytami z pamięci podręcznej po $0.018 i zapisami do niej po $0.230, na tym samym kluczu i tym samym rachunku co pozostałe rozmiary Qwen3.8 oraz wszystko inne, co kierujemy — a to właśnie ma znaczenie, gdy wyceniany przepływ pracy to harness wykonujący sto wywołań na test, a nie człowiek wykonujący jedno. Strona modelu zawiera też liczby operacyjne, które chcesz znać, zanim przypiszesz do niego zestaw testów: kontekst 1M tokenów z maksymalnym wyjściem 131K, p50 czasu do pierwszego tokenu wynoszące 7.12 sekundy i p95 na poziomie 10.00, a także około 2,3 miliarda tokenów ruchu, który przez niego przeszedł w ciągu ostatnich siedmiu dni. Ta ostatnia liczba jest nasza, a nie dostawcy, i stanowi rozsądne przybliżenie tego, czy inni już uruchamiają na tym endpoincie długie obciążenia agentowe.
Szczegół infrastrukturalny, który w tej skali przestaje być teoretyczny, to to, co dzieje się na kroku 74. Przebieg Pro utrzymuje swój kontekst na jednym endpoincie przez większą część godziny; incydent po stronie dostawcy w jego trakcie nie degraduje przebiegu, tylko go kończy, a płacisz za 73 kroki, które nie przyniosły wyniku. Kierowanie długiej sesji agenta przez warstwę, która przełącza się awaryjnie na innego dostawcę tego samego modelu, to różnica między niestabilnym zestawem testów a zestawem przerwanym. To przyziemna właściwość inżynierska i to ona decyduje, czy zmierzony koszt przypadający na ukończone zadanie przetrwa zetknięcie z tygodniem rzeczywistych przebiegów.

Do czego właściwie służy każdy z nich
Jeśli masz aplikację na Androida i zestaw testów, chcesz ARTEMIS, a Qwen3.8-Flash jest kandydatem na silnik dla niego, a nie alternatywą dla niego — nieudokumentowanym, wartym eksperymentu na jedno popołudnie, wycenionym tak, że eksperyment nie kosztuje cię nic wymiernego. Jeśli wybierasz model dla agenta mobilnego, którego sam piszesz, delta +22,5 punktu w AndroidWorld jest powodem, by przyjrzeć się Qwen3.8-Flash, a nie powodem, by w nią wierzyć, ponieważ jest to delta zgłoszona przez dostawcę, bez dołączonego wyniku absolutnego i bez niezależnej reprodukcji.
To, o co oba projekty po cichu się spierają, jest tym samym, i żaden z nich nie mówi tego wprost. Google twierdzi, że to harness sprawia, że mobilny agent jest niezawodny, i udostępnia go jako open source, aby można było sprawdzić to twierdzenie. Alibaba twierdzi, że koszt na ukończone zadanie to jedyna liczba, która się liczy, i odpowiednio ustala ceny. Prawdopodobnie oba stanowiska są słuszne, dlatego interesującą konfiguracją nie jest ARTEMIS ani Qwen3.8 — jest nią ARTEMIS na Qwen3.8-Flash, mierzona na własnej aplikacji, z pozostawionym włączonym zapisem śladu.
A ponieważ ARTEMIS ponownie odczytuje rosnący kontekst na każdym kroku, współczynnik poprawia się jeszcze bardziej w przypadku modelu, który ma tańszy odczyt z pamięci podręcznej.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
