Ett genererat titelkort för ”ARTEMIS vs Qwen3.8” med undertexten ”Samma benchmark, två olika jobb”, som kontrasterar ARTEMIS:s självrapporterade AndroidWorld-resultat på 99,1 % mot Qwen3.8-Flashs leverantörsrapporterade förbättring på 22,5 punkter jämfört med Opus 4.6 på samma benchmark, med en fotnot om att AndroidWorld inte oberoende verifierar inlämningar.
Guides & Insights

ARTEMIS vs Qwen3.8: samma benchmark, två olika jobb

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Googles ARTEMIS och Qwen3.8 mäts båda på AndroidWorld, och det sammanträffandet är det enskilt mest missvisande faktumet i båda projektens lanseringsbevakning. ARTEMIS är ett Android-automatiseringsramverk — släppt med öppen källkod av Google i augusti 2026 under Apache 2.0, det tar en instruktion på naturligt språk, styr en riktig telefon via ADB och hävdar en slutförandegrad på 99 %+ på Google Researchs AndroidWorld-benchmark med 116 uppgifter, och visar 99,1 % på den offentliga resultattavlan per den 11 september 2026. Qwen3.8-Flash är Alibabas multimodala mixture-of-experts-modell, släppt med öppen källkod den 26 augusti 2026, vars lanseringsmaterial hävdar att den slår Claude Opus 4.6 med 22,5 poäng på AndroidWorld. Ett av dessa tal är ett systems poäng. Det andra är en modells bidrag till ett system som någon annan skrev. Läs dem som rivaler och du kommer att dra fel slutsats om båda; läs dem som två halvor av en stack och den intressanta frågan — vad en lång Android-körning faktiskt kostar — har äntligen ett svar.

Vad Qwen3.8 är, per storlek

"Qwen3.8" är en familj, inte en checkpoint, och medlemmen som spelar roll här är inte flaggskeppet.

Qwen3.8-Max — flaggskeppsnivån, positionerad mot ledande hostade modeller.

Qwen3.8-27B — den öppna medelstora dense-syskonmodellen.

Qwen3.8-Flash — en multimodal MoE på en ny "Next"-arkitektur: 125B transformerparametrar med endast 6B aktiverade per token, Qwen Sparse Attention sammansmält med GDN i ett hybridattentionsschema för snabbhetsvinster vid långa kontexter när cachen får träff, en Gated Residual som delar upp informationskanalen i fyra delar, och 51B parametrar i N-gram-inbäddningar. Alibaba beskriver Next-arkitekturen som prototypen för nästa generations Qwen4.

Kontext — ursprungligen stort, med de flesta angivelser på 1M tokens och vissa källor som beskriver 262K inbyggt utökat till 1M. Maximal utdata är omkring 131K.

Pris — det publicerade API-priset är ¥1 per miljon input-tokens och ¥3 per miljon output-tokens, vilket landar på $0,15 / $0,47 i vår katalog, med cacheläsningar på $0,018 och cacheskrivningar på $0,230. Alibabas egen framställning är att prissättning för cacheträffar så låg som ¥0,1 per miljon är det som gör agentarbetsflöden med långa indata genomförbara, och siffrorna stöder det: en cacheläsning kostar ungefär en tolftedel av en ny input-token.

Frågan om öppna vikter — Flash-vikterna publicerades på Hugging Face och ModelScope samma dag som lanseringen. Notera hur familjen räknas: Alibaba säger att Qwen3.8-serien har öppnat upp tre storlekar — Max, 27B och Flash — för totalt 2,4T parametrar, vilket är en kumulativ siffra för hela serien snarare än parameterantalet för någon enskild modell.

Benchmarkpåståendena är breda och, enligt Alibabas eget lanseringsmaterial, alla deltan snarare än absoluta tal: SWE-bench Pro +9,1 jämfört med Opus 4.6, JobBench omkring +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Deltan mot en namnlös konfiguration av en konkurrentmodell är inte samma typ av bevis som en post på en resultattavla, och inget av dessa har oberoende reproducerats. Företagets huvudbudskap – en omdefiniering av branschens kostnads-”kill line” från pris per token till totalkostnad per slutförd uppgift – är det påstående som faktiskt har betydelse för den här jämförelsen, och det är också det du själv kan testa.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

Vad ARTEMIS bidrar med, och varför de två siffrorna inte är jämförbara

ARTEMIS innehåller ingen modell. Dess märke lyder "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL" och dess konfiguration finns i code>config/artemis.jsonc/code>. Det den tillför är den del som omvandlar en modells gissning till en verifierad åtgärd: en dynamik-först-lokaliserare som läser tillgänglighetsträdet när den kan och faller tillbaka på datorseende och koordinater när en Compose- eller Flutter-yta inte ger den något, ett Safety Net som rensar bort störande systempopupfönster innan tryckningen landar, checkpoint-verifiering på fyra nivåer från code>off/code> till code>strict/code>, och en sessionsliggare som komprimerar gamla skärmbilder till visuella sammanfattningar så att en kontext på hundra steg förblir kostnadsmässigt överkomlig.

Den levereras också med en inbyggd MCP-server. code>uv run artemis mcp --install all/code> exponerar code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> och code>mobile_diagnose/code> till Antigravity, Claude Code, Codex och allt annat som talar MCP — vilket är vad som gjorde att projektet spreds så snabbt som det gjorde, och vilket är den tydligaste beskrivningen av vad det är till för. ARTEMIS är ett verktyg som en agent anropar. Det gäller också en modell, och det är därför det är ett kategorimisstag att placera dem i samma kolumn.

Det enda man behöver vara försiktig med när man läser ARTEMIS 99,1 %: AndroidWorlds resultattavla gör uttryckligen ingen oberoende verifiering av inlämningar. Varje siffra på den, ARTEMIS inräknat, är självrapporterad av teamet som tog fram den. Samma förbehåll gäller i ännu högre grad för ett deltavärde som citeras i ett lanseringsinlägg.

Att läsa "vs" på två sätt

Det finns två ärliga tolkningar av den här matchningen och de pekar i motsatta riktningar.

Som konkurrenter är jämförelsen egentligen: "ska jag använda en hostad modell plus ett ramverk, eller ska jag använda en modell som är tillräckligt bra på mobila uppgifter för att jag ska kunna skriva ramverket själv?" Med den tolkningen vinner ARTEMIS per automatik, eftersom en modell inte är ett ramverk — och deltat på +22,5 punkter i AndroidWorld säger dig inte om Qwen3.8-Flash kan överleva steg 74 i en körning på hundra steg när en systempopup äter upp dess tryckning. Inget i en benchmarktabell mäter Safety Net.

Som en stack är jämförelsen den användbara: ARTEMIS är kontrollslingan, Qwen3.8-Flash är en rimlig motor för den, och frågan blir en om kostnad och tillförlitlighet i längden. Alibabas hela pitch för Flash-nivån – att det viktiga talet är den totala kostnaden per slutförd uppgift snarare än pris per token – är just det mått som en Android-automatiseringssvit bedöms på, och det är ett mått du kan mäta på din egen testuppsättning på en dag.

Den besvärande detaljen som står i vägen: Qwen3.8-Flash finns inte med på ARTEMIS lista över testade backendar, där Gemini, Claude, GPT-4o och Qwen-VL anges. Qwen-VL är en annan modell. Testramverket tar en modellendpoint och kombinationen är tekniskt sett rimlig, men ingen har publicerat en utvärdering av den, och om du kör den gör du eget arbete i stället för att följa dokumentationen.

Aritmetiken som avgör det

Här är beräkningen som är värd att göra innan något av lanseringsinläggen övertygar dig om något. Det är en modell med angivna antaganden, inte en mätning, och du bör byta ut siffrorna mot dina egna — men det är formen på den som är poängen.

Ta en 100-stegs Pro-körning. Pro körs på ungefär 15–40 sekunder per steg, så den faktiska tiden ligger någonstans mellan 25 minuter och en timme, och varje steg skickar en skärmbild plus en växande prompt. Anta 8 000 prompttokens och 300 utdatatokens per steg – en konservativ budget för skärmbild och instruktioner, långt under vad en rå bildruta i full upplösning kostar. Det är 800 000 indatatokens och 30 000 utdatatokens för ett test.

• Med Qwen3.8-Flashs $0,15 / $0,47 kostar den körningen omkring $0,12 i indata och $0,014 i utdata — ungefär tretton cent.

• Vid en frontier-hostad taxa på låga ensiffriga dollar per miljon indata och omkring 15 dollar per miljon utdata hamnar samma körning i dollar, inte cent. De två taxorna är medvetet ungefärliga här, eftersom den exakta siffran beror på vilken frontier-modell du väljer, och det är förhållandet som spelar roll: det är en storleksordning, i varje test, varje körning.

• Och eftersom ARTEMIS läser om en växande kontext vid varje steg förbättras förhållandet ytterligare för den modell som har den billigare cacheläsningen. Cacheläsningen för Qwen3.8-Flash är $0,018 per miljon mot $0,15 för ny indata — en tolftedel av priset, och anledningen till att Alibaba fortsätter att peka på cacheträffrekvenser när företaget talar om agentarbetsbelastningar.

Multiplicera nu med din testsvit. En nattlig regressionkörning med 500 tester är 400 miljoner indatatokens per natt, och skillnaden mellan tretton cent och tre dollar per test är skillnaden mellan en testrigg som du har råd att köra kontinuerligt och en som du schemalägger veckovis.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

Att köra det, och där infrastrukturen spelar roll

Om du vill testa den aritmetiken i din egen app är den ärliga vägen att peka ARTEMIS mot en modellendpoint och mäta. Qwen3.8-Flash finns i vår katalog till det publicerade priset $0,15 / $0,47 med cacheläsningar på $0,018 och cacheskrivningar på $0,230, på samma nyckel och samma faktura som de andra Qwen3.8-storlekarna och allt annat vi routar – vilket är den del som spelar roll när arbetsflödet du prissätter är en testrigg som gör hundra anrop per test i stället för en person som gör ett. Modellsidan innehåller också de operativa siffrorna du vill ha innan du satsar en testsvit på den: en kontext på 1M tokens med maximal utdata på 131K, en p50-tid till första token på 7,12 sekunder och en p95 på 10,00, och ungefär 2,3 miljarder tokens trafik genom den under de senaste sju dagarna. Den sista siffran är vår och inte en leverantörs, och den är en rimlig proxy för huruvida andra redan kör långa agentarbetsbelastningar på den här endpointen.

Den infrastrukturdetalj som upphör att vara teoretisk i den här skalan är vad som händer vid steg 74. En Pro-körning håller sin kontext på en och samma endpoint i större delen av en timme; en leverantörsincident mitt i försämrar inte körningen, den avslutar den, och du betalar för de 73 steg som inte gav något resultat. Att routa en lång agentsession genom ett lager som gör failover till en annan leverantör av samma modell är skillnaden mellan en instabil svit och en avbruten. Det är en vardaglig ingenjörsegenskap, och det är den som avgör om din uppmätta kostnad per slutförd uppgift överlever kontakten med en vecka av verkliga körningar.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

Vad var och en egentligen är till för

Om du har en Android-app och en testsvit vill du ha ARTEMIS, och Qwen3.8-Flash är en kandidatmotor för detta snarare än ett alternativ till det – en odokumenterad sådan, värd ett eftermiddagsexperiment, prissatt så att experimentet inte kostar dig något mätbart. Om du väljer en modell för en mobilagent som du skriver själv, är deltat på +22,5 punkter i AndroidWorld ett skäl att titta på Qwen3.8-Flash och inte ett skäl att tro på det, eftersom det är ett leverantörsrapporterat delta utan någon absolut poäng angiven och utan oberoende reproduktion.

Det båda projekten i tysthet argumenterar om är samma sak, och ingen av dem säger det rakt ut. Google hävdar att testramverket är det som gör en mobil agent tillförlitlig, och släpper det som öppen källkod så att påståendet kan granskas. Alibaba hävdar att kostnaden per slutförd uppgift är det enda tal som spelar någon roll, och prissätter därefter. Båda har förmodligen rätt, vilket är anledningen till att den intressanta konfigurationen inte är ARTEMIS eller Qwen3.8 — utan ARTEMIS på Qwen3.8-Flash, mätt i din egen app, med spårningen påslagen.

Och eftersom ARTEMIS läser om ett växande kontext vid varje steg förbättras förhållandet ytterligare förvilken modell som än har den billigare cacheläsningen.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen