
ARTEMIS vs. Qwen3.8: derselbe Benchmark, zwei verschiedene Aufgaben
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Googles ARTEMIS und Qwen3.8 werden beide auf AndroidWorld gemessen, und dieser Zufall ist die irreführendste Einzeltatsache in der Berichterstattung zum Start beider Projekte. ARTEMIS ist ein Android-Automatisierungs-Harness – von Google im August 2026 unter Apache 2.0 als Open Source veröffentlicht; es nimmt eine natürlichsprachliche Anweisung entgegen, steuert ein echtes Handy über ADB und beansprucht eine Abschlussrate von über 99 % beim 116-Aufgaben-AndroidWorld-Benchmark von Google Research, mit 99,1 % auf der öffentlichen Rangliste Stand 11. September 2026. Qwen3.8-Flash ist Alibabas multimodales Mixture-of-Experts-Modell, veröffentlicht und als Open Source freigegeben am 26. August 2026, dessen Launch-Material behauptet, dass es Claude Opus 4.6 auf AndroidWorld um 22,5 Punkte schlägt. Eine dieser Zahlen ist der Score eines Systems. Die andere ist der Beitrag eines Modells zu einem System, das jemand anderes geschrieben hat. Liest man sie als Rivalen, wird man über beide das Falsche schlussfolgern; liest man sie als zwei Hälften eines Stacks, hat die interessante Frage – was ein langer Android-Lauf tatsächlich kostet – endlich eine Antwort.
Was Qwen3.8 ist, je nach Größe
„Qwen3.8“ ist eine Familie, kein Checkpoint, und das Mitglied, auf das es hier ankommt, ist nicht das Flaggschiff.
• Qwen3.8-Max — die Flaggschiff-Klasse, positioniert gegen führende gehostete Modelle.
• Qwen3.8-27B — das offene, mittelgroße, dichte Geschwistermodell.
• Qwen3.8-Flash — ein multimodales MoE auf einer neuen „Next“-Architektur: 125 Mrd. Transformer-Parameter, von denen pro Token nur 6 Mrd. aktiviert werden, Qwen Sparse Attention, fusioniert mit GDN in einem hybriden Attention-Schema für Beschleunigungen bei langem Kontext, wenn der Cache greift, ein Gated Residual, das den Informationskanal auf vier Wege aufteilt, und 51 Mrd. Parameter an N-Gramm-Embeddings. Alibaba beschreibt die Next-Architektur als den Prototyp für die nächste Qwen4-Generation.
• Kontext — von Natur aus groß, mit den meisten Angaben bei 1 M Token und einigen Quellen, die 262 K nativ und auf 1 M erweitert beschreiben. Die maximale Ausgabe liegt bei etwa 131 K.
• Preis — der veröffentlichte API-Preis beträgt ¥1 pro Million Eingabe-Tokens und ¥3 pro Million Ausgabe-Tokens, was in unserem Katalog $0.15 / $0.47 entspricht, wobei Cache-Lesevorgänge $0.018 und Cache-Schreibvorgänge $0.230 kosten. Alibabas eigene Darstellung ist, dass Cache-Treffer-Preise von nur ¥0,1 pro Million das sind, was Agenten-Workflows mit langen Eingaben wirtschaftlich tragfähig macht, und die Zahlen belegen das: Ein Cache-Lesevorgang kostet etwa ein Zwölftel eines frischen Eingabe-Tokens.
• Die Frage nach den offenen Gewichten — die Flash-Gewichte wurden am Veröffentlichungstag auf Hugging Face und ModelScope publiziert. Beachten Sie, wie die Familie gezählt wird: Alibaba sagt, die Qwen3.8-Serie habe drei Größen als Open Source veröffentlicht – Max, 27B und Flash – für insgesamt 2,4 Billionen Parameter, was eine kumulative Zahl über die gesamte Serie hinweg ist und nicht die Parameterzahl eines einzelnen Modells.
Die Benchmark-Behauptungen sind weitreichend und laut Alibabas eigenem Launch-Material allesamt Deltas statt absoluter Werte: SWE-bench Pro +9,1 gegenüber Opus 4.6, JobBench rund +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Delta-Angaben gegenüber einer nicht genannten Konfiguration eines Konkurrenzmodells sind nicht dieselbe Evidenzkategorie wie ein Leaderboard-Eintrag, und keine davon wurde unabhängig reproduziert. Die plakative Rahmung des Unternehmens – eine Neudefinition der Kosten-„Kill-Linie“ der Branche von Preis pro Token hin zu Gesamtkosten pro abgeschlossener Aufgabe – ist die Behauptung, auf die es bei diesem Vergleich tatsächlich ankommt, und sie ist zugleich diejenige, die Sie selbst überprüfen können.

Was ARTEMIS beiträgt und warum die beiden Zahlen nicht vergleichbar sind
ARTEMIS enthält kein Modell. Auf seinem Badge steht „Multi-Modell — Gemini | Claude | GPT-4o | Qwen-VL“, und seine Konfiguration befindet sich in code>config/artemis.jsonc/code>. Was es bietet, ist der Teil, der aus der Vermutung eines Modells eine verifizierte Aktion macht: ein Dynamic-First-Locator, der den Accessibility Tree liest, wenn er kann, und auf Vision und Koordinaten zurückgreift, wenn eine Compose- oder Flutter-Oberfläche ihm nichts liefert, ein Sicherheitsnetz, das störende System-Popups beseitigt, bevor der Tap ankommt, Checkpoint-Verifizierung auf vier Ebenen von code>off/code> bis code>strict/code>, und ein Session-Ledger, der alte Screenshots in visuelle Zusammenfassungen komprimiert, damit ein Hundert-Schritt-Kontext bezahlbar bleibt.
Außerdem wird ein nativer MCP-Server mitgeliefert. code>uv run artemis mcp --install all/code> stellt code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> und code>mobile_diagnose/code> für Antigravity, Claude Code, Codex und alles andere, das MCP spricht, bereit — was dafür gesorgt hat, dass sich das Projekt so schnell verbreitet hat, und was die klarste Aussage darüber ist, wofür es gedacht ist. ARTEMIS ist ein Werkzeug, das ein Agent aufruft. Ein Modell ist das ebenfalls, weshalb es ein Kategorienfehler ist, sie in dieselbe Spalte zu setzen.
Das Einzige, worauf man beim Lesen von ARTEMIS’ 99,1 % achten sollte: Die Rangliste von AndroidWorld überprüft Einreichungen ausdrücklich nicht unabhängig. Jede darauf verzeichnete Zahl, einschließlich der von ARTEMIS, wird von dem Team, das sie erstellt hat, selbst gemeldet. Derselbe Vorbehalt gilt in noch stärkerem Maße für ein Delta, das in einem Launch-Post zitiert wird.
„vs" auf zwei Arten lesen
Es gibt zwei ehrliche Lesarten dieses Duells, und sie weisen in entgegengesetzte Richtungen.
Als Rivalen betrachtet, läuft der Vergleich eigentlich auf Folgendes hinaus: „Sollte ich ein gehostetes Modell plus ein Harness verwenden, oder sollte ich ein Modell verwenden, das bei mobilen Aufgaben gut genug ist, dass ich das Harness selbst schreiben kann?“ So gelesen gewinnt ARTEMIS standardmäßig, denn ein Modell ist kein Harness — und das +22,5-Punkte-Delta bei AndroidWorld sagt Ihnen nicht, ob Qwen3.8-Flash Schritt 74 eines Hundert-Schritt-Durchlaufs überstehen kann, wenn ein System-Popup seinen Tipp verschluckt. Nichts in einer Benchmark-Tabelle misst das Safety Net.
Als Stack ist der Vergleich der nützliche: ARTEMIS ist die Regelschleife, Qwen3.8-Flash ist eine plausible Engine dafür, und die Frage wird zu einer von Kosten und Zuverlässigkeit bei langen Kontexten. Alibabas ganzes Verkaufsargument für die Flash-Stufe – dass die wichtige Kennzahl die Gesamtkosten pro erledigter Aufgabe und nicht der Preis pro Token sei – ist genau die Metrik, an der eine Android-Automatisierungs-Suite gemessen wird, und es ist eine Metrik, die man an seinem eigenen Testset an einem Tag messen kann.
Das unangenehme Detail, das im Weg steht: Qwen3.8-Flash steht nicht auf der Liste der getesteten Backends von ARTEMIS, die Gemini, Claude, GPT-4o und Qwen-VL nennt. Qwen-VL ist ein anderes Modell. Der Harness nimmt einen Modellendpunkt entgegen, und die Paarung ist technisch plausibel, aber niemand hat eine Evaluierung davon veröffentlicht, und wenn du es ausführst, leistest du originäre Arbeit, statt der Dokumentation zu folgen.
Die Rechnung, die den Ausschlag gibt
Hier ist die Berechnung, die es sich lohnt durchzuführen, bevor dich einer der beiden Launch-Posts von irgendetwas überzeugt. Es ist ein Modell mit angegebenen Annahmen, keine Messung, und du solltest deine eigenen Zahlen einsetzen – aber die Form ist der Punkt.
Nehmen wir einen Pro-Durchlauf mit 100 Schritten. Pro läuft mit ungefähr 15–40 Sekunden pro Schritt, die reale Laufzeit liegt also irgendwo zwischen 25 Minuten und einer Stunde, und jeder Schritt sendet einen Screenshot plus einen wachsenden Prompt. Gehen wir von 8.000 Prompt-Tokens und 300 Output-Tokens pro Schritt aus – ein konservatives Budget für Screenshot und Anweisungen, deutlich unter dem, was ein roher Frame in voller Auflösung kostet. Das sind 800.000 Input-Tokens und 30.000 Output-Tokens für einen Test.
• Bei Qwen3.8-Flash mit $0,15 / $0,47 kostet dieser Durchlauf etwa $0,12 für die Eingabe und $0,014 für die Ausgabe — rund dreizehn Cent.
• Bei einem Frontier-Hosting-Tarif im niedrigen einstelligen Bereich pro Million Input-Token und im mittleren Teen-Bereich pro Million Output-Token landet derselbe Lauf im Dollarbereich, nicht im Centbereich. Die beiden Tarife werden hier absichtlich vage gehalten, weil die genaue Zahl davon abhängt, welches Frontier-Modell man wählt, und das Verhältnis entscheidend ist: Es ist eine Größenordnung – bei jedem Test, bei jedem Lauf.
• Und weil ARTEMIS bei jedem Schritt einen wachsenden Kontext erneut liest, verbessert sich das Verhältnis weiter für dasjenige Modell, dessen Cache-Lesevorgang günstiger ist. Der Cache-Lesevorgang von Qwen3.8-Flash kostet 0,018 US-Dollar pro Million gegenüber 0,15 US-Dollar für frischen Input – ein Zwölftel des Preises und der Grund, warum Alibaba bei Agent-Workloads immer wieder auf Cache-Hit-Raten verweist.
Multiplizieren Sie das nun mit Ihrer Suite. Ein nächtlicher Regressionslauf mit 500 Tests bedeutet 400 Millionen Input-Tokens pro Nacht, und der Unterschied zwischen dreizehn Cent und drei Dollar pro Test ist der Unterschied zwischen einem Testgerüst, das Sie sich leisten können, kontinuierlich laufen zu lassen, und einem, das Sie nur wöchentlich einplanen.

Es betreiben, und wo es auf die Verkabelung ankommt
Wenn Sie diese Rechnung an Ihrer eigenen App testen wollen, ist der ehrliche Weg, ARTEMIS auf einen Modell-Endpunkt zu richten und zu messen. Qwen3.8-Flash ist in unserem Katalog zu den veröffentlichten $0.15 / $0.47 erhältlich, mit Cache-Reads zu $0.018 und Cache-Writes zu $0.230, unter demselben Schlüssel und auf derselben Rechnung wie die übrigen Qwen3.8-Größen und alles andere, was wir routen — und genau das ist der Punkt, der zählt, wenn der Workflow, den Sie kalkulieren, ein Harness ist, das hundert Aufrufe pro Test macht, statt eine Person, die einen einzigen macht. Die Modellseite trägt außerdem die operativen Zahlen, die Sie kennen wollen, bevor Sie eine Suite darauf festlegen: ein Kontext von 1M Token bei maximal 131K Output, eine p50-Zeit bis zum ersten Token von 7,12 Sekunden und eine p95 von 10,00, sowie rund 2,3 Milliarden Token Traffic über den Endpunkt in den letzten sieben Tagen. Die letzte Zahl ist unsere und nicht die eines Anbieters, und sie ist ein brauchbarer Anhaltspunkt dafür, ob andere Leute auf diesem Endpunkt bereits lange Agent-Workloads laufen lassen.
Das Infrastrukturdetail, das in dieser Größenordnung nicht mehr theoretisch ist, ist das, was bei Schritt 74 passiert. Ein Pro-Lauf hält seinen Kontext fast eine Stunde lang an einem Endpunkt; eine Störung beim Anbieter mitten darin beeinträchtigt den Lauf nicht, sondern beendet ihn, und Sie zahlen für die 73 Schritte, die kein Ergebnis geliefert haben. Eine lange Agent-Sitzung durch eine Schicht zu leiten, die auf einen anderen Anbieter desselben Modells ausweicht, ist der Unterschied zwischen einer unzuverlässigen Suite und einer unterbrochenen. Das ist eine banale ingenieurtechnische Eigenschaft, und sie entscheidet, ob Ihre gemessenen Kosten pro abgeschlossener Aufgabe den Kontakt mit einer Woche echter Läufe überstehen.

Wofür jedes einzelne tatsächlich da ist
Wenn Sie eine Android-App und eine Testsuite haben, wollen Sie ARTEMIS, und Qwen3.8-Flash ist eher eine Kandidaten-Engine dafür als eine Alternative dazu – eine undokumentierte, einen Nachmittag Experiment wert, so bepreist, dass das Experiment Sie nichts Messbares kostet. Wenn Sie ein Modell für einen mobilen Agenten auswählen, den Sie selbst schreiben, ist das +22,5-Punkte-Delta bei AndroidWorld ein Grund, sich Qwen3.8-Flash anzusehen, und kein Grund, daran zu glauben, denn es ist ein vom Anbieter gemeldetes Delta ohne beigefügte absolute Punktzahl und ohne unabhängige Reproduktion.
Worüber beide Projekte im Stillen streiten, ist dieselbe Sache, und keines sagt es offen. Google behauptet, dass das Harness das ist, was einen mobilen Agenten zuverlässig macht, und veröffentlicht es als Open Source, damit die Behauptung überprüft werden kann. Alibaba behauptet, dass die Kosten pro abgeschlossener Aufgabe die einzige Zahl sind, auf die es ankommt, und bepreist entsprechend. Beide haben wahrscheinlich recht, weshalb die interessante Konfiguration nicht ARTEMIS oder Qwen3.8 ist – sondern ARTEMIS auf Qwen3.8-Flash, gemessen in Ihrer eigenen App, wobei das Trace eingeschaltet bleibt.
Und weil ARTEMIS bei jedem Schritt einen wachsenden Kontext erneut liest, verbessert sich das Verhältnis weiter für das Modell, das den günstigeren Cache-Lesevorgang hat.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
