'ARTEMIS vs Qwen3.8'을 위한 생성된 타이틀 카드로, 부제는 '같은 벤치마크, 두 개의 다른 작업'이며, ARTEMIS가 자체 보고한 AndroidWorld 99.1% 결과와 Qwen3.8-Flash가 벤더 보고로 같은 벤치마크에서 Opus 4.6 대비 22.5포인트 향상을 기록했다는 점을 대비시키고, AndroidWorld는 제출물을 독립적으로 검증하지 않는다는 각주를 달았다.
Guides & Insights

ARTEMIS vs Qwen3.8: 동일한 벤치마크, 두 가지 다른 작업

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Google의 ARTEMIS와 Qwen3.8은 둘 다 AndroidWorld에서 측정되며, 그 우연은 두 프로젝트의 출시 보도에서 가장 오해를 부르는 단일 사실이다. ARTEMIS는 Android 자동화 하네스다. Google이 2026년 8월 Apache 2.0으로 오픈소스화했고, 자연어 지시를 받아 ADB를 통해 실제 휴대폰을 구동하며, Google Research의 116개 과제 AndroidWorld 벤치마크에서 99%+ 완료율을 주장하며, 2026년 9월 11일 기준 공개 리더보드에서 99.1%를 보여준다. Qwen3.8-Flash는 Alibaba의 멀티모달 전문가 혼합(mixture-of-experts) 모델로, 2026년 8월 26일 출시 및 오픈소스화되었으며, 출시 자료에서는 AndroidWorld에서 Claude Opus 4.6을 22.5점 차로 앞선다고 주장한다. 그 숫자 중 하나는 시스템의 점수다. 다른 하나는 다른 누군가가 작성한 시스템에 대한 모델의 기여다. 그것들을 경쟁자로 읽으면 둘 모두에 대해 잘못된 결론을 내리게 된다. 하나의 스택의 두 절반으로 읽으면, 흥미로운 질문—긴 Android 실행에 실제로 드는 비용은 얼마인가—에 마침내 답이 생긴다.

Qwen3.8이란 무엇인가, 크기별로

"Qwen3.8"은 하나의 체크포인트가 아니라 패밀리이며, 여기서 중요한 멤버는 플래그십이 아니다.

Qwen3.8-Max — 플래그십 등급으로, 프런티어 호스팅 모델에 맞서는 포지션입니다.

Qwen3.8-27B — 공개된 중형 dense 형제 모델.

Qwen3.8-Flash — 새로운 "Next" 아키텍처를 기반으로 한 멀티모달 MoE: 125B 트랜스포머 파라미터 중 토큰당 6B만 활성화되며, 캐시가 적중할 때 장문맥 처리 속도를 높이기 위한 하이브리드 어텐션 방식으로 Qwen Sparse Attention과 GDN을 융합하고, 정보 채널을 네 갈래로 나누는 Gated Residual, 그리고 51B 파라미터의 N-gram 임베딩을 갖추고 있습니다. Alibaba는 Next 아키텍처를 차세대 Qwen4의 프로토타입이라고 설명합니다.

컨텍스트 — 기본적으로 크기가 크며, 대부분의 목록에서 1M 토큰이고 일부 출처는 262K 네이티브가 1M으로 확장된다고 설명합니다. 최대 출력은 약 131K입니다.

가격 — 공개된 API 요금은 입력 토큰 100만 개당 ¥1, 출력 100만 개당 ¥3이며, 당사 카탈로그 기준으로는 $0.15 / $0.47에 해당합니다. 캐시 읽기는 $0.018, 캐시 쓰기는 $0.230입니다. 알리바바가 내세우는 설명은 캐시 적중 가격이 100만 개당 ¥0.1까지 낮아지는 것이야말로 긴 입력을 사용하는 에이전트 워크플로를 실행 가능하게 만드는 요인이라는 것이며, 수치도 이를 뒷받침합니다. 캐시 읽기 비용은 새 입력 토큰의 약 12분의 1에 불과합니다.

오픈 웨이트 문제 — Flash의 가중치는 출시 당일 Hugging Face와 ModelScope에 공개되었다. 이 제품군을 어떻게 집계하는지에 주목할 필요가 있다. 알리바바는 Qwen3.8 시리즈가 세 가지 크기, 즉 Max, 27B, Flash를 오픈소스로 공개했으며 총 2.4T 파라미터에 이른다고 밝혔는데, 이는 개별 모델 하나의 파라미터 수가 아니라 시리즈 전체를 아우르는 누적 수치이다.

벤치마크 주장은 광범위하며, 알리바바 자체의 출시 자료에 따르면 모두 절대 수치가 아니라 델타입니다: SWE-bench Pro는 Opus 4.6 대비 +9.1, JobBench는 약 +20, MathVision은 +25.1, ERQA는 +31.5, AndroidWorld는 +22.5입니다. 이름이 밝혀지지 않은 경쟁 모델 구성 대비 델타는 리더보드 항목과 같은 범주의 증거가 아니며, 이 중 어느 것도 독립적으로 재현되지 않았습니다. 이 회사의 대표적 프레이밍 — 업계의 비용 '킬 라인'을 토큰당 가격에서 완료된 작업당 총비용으로 재정의하는 것 — 은 이 비교에서 실제로 중요한 주장이며, 또한 직접 테스트해 볼 수 있는 주장이기도 합니다.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

ARTEMIS가 기여하는 것, 그리고 두 숫자가 비교 가능하지 않은 이유

ARTEMIS에는 모델이 들어 있지 않습니다. 배지에는 "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL"이라고 적혀 있고, 구성은 code>config/artemis.jsonc/code>에 있습니다. 이것이 제공하는 것은 모델의 추측을 검증된 동작으로 바꿔 주는 부분입니다. 즉, 접근성 트리를 읽을 수 있을 때는 그것을 읽고 Compose나 Flutter 화면이 아무것도 주지 않을 때는 비전과 좌표로 폴백하는 동적 우선 로케이터, 탭이 실행되기 전에 방해가 되는 시스템 팝업을 정리하는 Safety Net, code>off/code>부터 code>strict/code>까지 네 단계에 걸친 체크포인트 검증, 그리고 오래된 스크린샷을 시각적 요약으로 압축해 100단계 컨텍스트도 감당할 수 있게 유지하는 세션 원장입니다.

또한 네이티브 MCP 서버를 함께 제공합니다. code>uv run artemis mcp --install all/code>는 code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> 및 code>mobile_diagnose/code>를 Antigravity, Claude Code, Codex, 그리고 MCP를 구사하는 그 밖의 모든 것에 노출합니다 — 바로 이것이 이 프로젝트가 그토록 빠르게 퍼져나간 이유이며, 이 프로젝트가 무엇을 위한 것인지 가장 명확하게 보여주는 진술입니다. ARTEMIS는 에이전트가 호출하는 도구입니다. 모델도 마찬가지이며, 그래서 둘을 같은 열에 놓는 것은 범주 오류입니다.

ARTEMIS의 99.1%를 읽을 때 주의해야 할 단 한 가지는 이것이다: AndroidWorld의 리더보드는 제출물을 독립적으로 검증하지 않는다고 명시적으로 밝힌다. 그 리더보드에 있는 모든 수치는 ARTEMIS의 수치를 포함해, 해당 수치를 산출한 팀이 스스로 보고한 것이다. 같은 주의 사항은 출시 게시물에서 인용된 델타에 더욱 강하게 적용된다.

"vs"를 두 가지 방식으로 읽기

이 대결에는 두 가지 정직한 해석이 있고, 그것들은 서로 반대 방향을 가리킨다.

경쟁 관계로 보면, 비교는 사실상 이렇습니다. "호스팅 모델에 하네스를 붙여 쓸까, 아니면 모바일 작업을 내가 직접 하네스를 작성할 수 있을 만큼 잘하는 모델을 쓸까?" 그렇게 보면 ARTEMIS가 기본적으로 이깁니다. 모델은 하네스가 아니기 때문입니다. 그리고 AndroidWorld의 +22.5점 차이는 Qwen3.8-Flash가 100단계 실행의 74번째 단계에서 시스템 팝업이 탭을 먹어버릴 때 버틸 수 있는지를 알려주지 않습니다. 벤치마크 표의 그 무엇도 Safety Net을 측정하지 않습니다.

스택으로서, 이런 비교가 유용합니다: ARTEMIS는 제어 루프이고, Qwen3.8-Flash는 그에 걸맞은 그럴듯한 엔진이며, 문제는 장시간 작업에서의 비용과 신뢰성으로 귀결됩니다. Flash 등급에 대한 알리바바의 전체적인 주장, 즉 중요한 수치는 토큰당 가격이 아니라 완료된 작업당 총비용이라는 주장은 바로 안드로이드 자동화 제품군이 평가받는 지표이며, 하루면 자체 테스트 세트에서 측정할 수 있는 지표입니다.

걸림돌이 되는 곤란한 세부 사항은 이것입니다: Qwen3.8-Flash는 ARTEMIS의 테스트된 백엔드 목록에 없으며, 그 목록에는 Gemini, Claude, GPT-4o, Qwen-VL이 이름을 올리고 있습니다. Qwen-VL은 다른 모델입니다. 이 하네스는 모델 엔드포인트를 입력으로 받으며, 이 조합은 기술적으로는 그럴듯하지만, 아무도 이에 대한 평가를 공개하지 않았습니다. 그리고 이를 실행한다면 문서를 따르는 것이 아니라 독자적인 작업을 하는 셈입니다.

그것을 판가름하는 계산

두 출시 포스트 중 어느 쪽이든 당신을 뭔가로 설득하기 전에, 여기 해 볼 가치가 있는 계산이 있습니다. 이것은 명시된 가정을 둔 모델이지 측정값이 아니며, 당신의 숫자로 바꿔 넣어야 합니다 — 하지만 그 형태가 바로 요점입니다.

100단계 Pro 실행을 가정해 보자. Pro 실행은 단계당 대략 15~40초가 걸리므로 실제 소요 시간은 25분에서 1시간 사이이며, 각 단계마다 스크린샷과 점점 길어지는 프롬프트를 전송한다. 단계당 프롬프트 토큰 8,000개와 출력 토큰 300개를 가정하자. 이는 스크린샷과 지침을 위한 보수적인 예산으로, 원본 전체 해상도 프레임에 드는 비용보다 훨씬 낮다. 즉, 테스트 한 번에 입력 토큰 800,000개와 출력 토큰 30,000개다.

• Qwen3.8-Flash의 $0.15 / $0.47 기준으로, 해당 실행에는 입력 약 $0.12, 출력 약 $0.014의 비용이 듭니다 — 대략 13센트입니다.

• 프런티어 호스팅 요율이 백만 입력당 한 자릿수 초반, 백만 출력당 10대 중반일 때, 동일한 실행은 센트가 아니라 달러 단위가 됩니다. 여기서 두 요율을 일부러 두루뭉술하게 넘어간 이유는, 정확한 수치는 어떤 프런티어 모델을 선택하느냐에 따라 달라지고 중요한 것은 그 비율이기 때문입니다. 그 비율은 모든 테스트, 모든 실행에서 한 자릿수, 즉 약 10배 차이입니다.

• 그리고 ARTEMIS는 매 단계마다 늘어나는 컨텍스트를 다시 읽기 때문에, 캐시 읽기 비용이 더 저렴한 모델일수록 그 비율은 더욱 개선됩니다. Qwen3.8-Flash의 캐시 읽기는 백만 개당 $0.018로, 신규 입력 $0.15의 12분의 1에 불과하며, 이는 알리바바가 에이전트 워크로드를 이야기할 때마다 캐시 적중률을 계속 강조하는 이유이기도 합니다.

이제 여러분의 스위트로 곱해 보세요. 500개 테스트로 구성된 회귀 실행을 매일 밤 돌리면 밤마다 4억 개의 입력 토큰이 들며, 테스트당 13센트와 3달러의 차이는 지속적으로 실행할 여력이 되는 하네스와 매주 한 번만 예약해 돌리는 하네스의 차이입니다.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

실행하기, 그리고 기반 구조가 중요한 지점

자체 앱에서 그 계산이 맞는지 시험해 보고 싶다면, 정직한 방법은 ARTEMIS를 모델 엔드포인트로 지정해 측정해 보는 것입니다. Qwen3.8-Flash는 공개된 $0.15 / $0.47에 저희 카탈로그에 올라와 있으며 캐시 읽기 $0.018, 캐시 쓰기 $0.230으로, 다른 Qwen3.8 크기와 저희가 라우팅하는 그 밖의 모든 것과 동일한 키, 동일한 청구서를 사용합니다. 여러분이 가격을 산정하는 워크플로가 한 사람이 한 번 호출하는 것이 아니라 테스트마다 수백 번을 호출하는 하네스일 때 중요한 부분이 바로 이것입니다. 모델 페이지에는 스위트를 이 모델에 맡기기 전에 알아 두면 좋은 운영 수치도 실려 있습니다. 1M 토큰 컨텍스트에 최대 출력 131K, 첫 토큰까지 걸리는 시간 p50 7.12초와 p95 10.00초, 그리고 지난 7일 동안 이 모델을 통과한 약 23억 토큰의 트래픽입니다. 마지막 수치는 벤더가 아니라 저희 것이며, 다른 사람들이 이미 이 엔드포인트에서 긴 에이전트 워크로드를 돌리고 있는지 가늠할 수 있는 합리적인 지표입니다.

이 규모에서 더 이상 이론에 머무르지 않게 되는 배관 세부 사항은 74단계에서 벌어지는 일이다. Pro 실행은 한 시간의 대부분 동안 컨텍스트를 하나의 엔드포인트에 붙들어 두는데, 그 도중에 프로바이더 장애가 나면 실행이 저하되는 게 아니라 끝나버리고, 결과를 내지 못한 73단계에 대한 비용을 치르게 된다. 긴 에이전트 세션을 같은 모델의 다른 프로바이더로 페일오버하는 계층을 거쳐 라우팅하느냐가 간헐적으로 실패하는 스위트와 아예 중단되는 스위트를 가른다. 이는 평범한 엔지니어링 속성이며, 완료된 작업당 측정한 비용이 실제 일주일치 실행과 맞부딪혀도 살아남을지를 결정하는 속성이 바로 이것이다.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

각각이 실제로 무엇을 위한 것인지

Android 앱과 테스트 스위트가 있다면 ARTEMIS를 원할 것이다. 그리고 Qwen3.8-Flash는 ARTEMIS의 대안이라기보다는 ARTEMIS를 위한 후보 엔진이다. 문서화되지 않은 엔진이며, 한나절 실험해 볼 가치가 있고, 실험에 측정 가능한 비용이 들지 않도록 가격이 책정되어 있다. 직접 작성하고 있는 모바일 에이전트를 위한 모델을 고르는 중이라면, +22.5점의 AndroidWorld 델타는 Qwen3.8-Flash를 살펴볼 이유이지 그 델타를 믿을 이유는 아니다. 왜냐하면 그것은 공급업체가 보고한 델타로, 함께 제시된 절대 점수도 없고 독립적인 재현도 없기 때문이다.

두 프로젝트가 은근히 논쟁하는 대상은 같은 것이고, 어느 쪽도 그것을 분명히 말하지 않는다. Google은 하네스가 모바일 에이전트를 신뢰할 수 있게 만드는 것이라고 주장하며, 그 주장을 검증할 수 있도록 이를 오픈소스로 공개하고 있다. Alibaba는 완료된 작업당 비용이 유일하게 중요한 숫자라고 주장하며, 그에 맞게 가격을 책정하고 있다. 둘 다 아마 맞을 것이다. 그래서 흥미로운 구성은 ARTEMIS나 Qwen3.8이 아니라, 여러분의 자체 앱에서 측정하고 트레이스를 켜 둔 상태의 Qwen3.8-Flash 위에서 돌린 ARTEMIS다.

그리고 ARTEMIS가 매 단계마다 커지는 컨텍스트를 다시 읽기 때문에, 그 비율은 더욱 개선됩니다, 캐시 읽기가 더 저렴한 모델일수록.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트