
구글의 ARTEMIS, Android 자동화를 오픈소스로 공개: AndroidWorld 99% 주장이 실제로 포괄하는 범위
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
가장 최신 커밋이 올라온 곳은 google/artemis입니다. 그 커밋은 기능이 아닙니다. 그것은 크레딧 라인입니다 — "fix: complete README and relevant file headers per Apache 2.0 requirements," 2026년 9월 12일에 푸시되었으며, Minitap이 구글에 더 나은 모습을 기대했다라는 제목의 글을 게시한 지 3일 후였습니다. Google의 ARTEMIS는 이 회사가 새로 오픈소스로 공개한 Android 자동화 에이전트입니다: 평범한 영어 지시를 물리적 Android 기기나 에뮬레이터에서의 실제 탭, 스와이프, 타이핑, 검증으로 바꾸고, 그 과정에서 로그와 스크린샷을 캡처하며, Google Research의 AndroidWorld 벤치마크에서 99%+의 작업 완료율을 보고합니다. 이는 올해 8월 Google의 Pixel Test Engineering Fusion 팀이 Apache 2.0에 따라 공개했으며, 정말로 여러분의 오후 시간을 투자할 가치가 있습니다. 또한 9월 중순 현재, 이 저장소는 모바일 에이전트가 어떻게 구축되는지를 벤치마크 수치보다 더 잘 보여주는 오픈소스 출처 표시 분쟁의 중심에 있습니다. 두 이야기 모두 사실입니다. 그중 하나만이 이 저장소의 마지막 커밋이 라이선스 수정이었던 이유입니다.
실제로 출시된 것
ARTEMIS는 모델도 아니고 챗봇 래퍼도 아닙니다. 이것은 제어 하네스입니다 — 비전-언어 모델과 실제 휴대폰 사이에 위치하는 Python 3.12+ 시스템입니다. 영어로 작업을 주면, 화면을 관찰하고, 동작을 결정하고, ADB를 통해 실행하고, 무슨 일이 일어났는지 확인한 뒤 계속 진행합니다. 박스 안에는 다섯 가지가 들어 있습니다:
• CLI와 Python SDK. code>./start.sh/code>는 ADB, scrcpy, FFmpeg 및 uv 환경을 부트스트랩하고, code>uv run artemis run "…" --profile flash/code>는 작업을 헤드리스로 실행합니다. code>artemis-client/code> SDK는 pytest와 CI를 위해 동일한 호출을 감싸며, 나중에 추적할 수 있는 code>succeeded/code>, code>status/code>, code>device_serial/code> 및 code>trace_id/code>를 반환합니다.
• 웹 콘솔. code>uv run artemis ui/code>는 시각적 테스트 콘솔을 제공하며, code>localhost:8000/code>에서 루프를 단계별로 지켜볼 수 있습니다.
• 네이티브 MCP 서버. 바로 이 부분이 그것을 널리 퍼뜨렸습니다. code>uv run artemis mcp --install all/code>은 code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> 및 code>mobile_diagnose/code>를 MCP를 지원하는 모든 어시스턴트에 노출하며, Antigravity, Claude Code, Codex를 위한 최우선 설치 경로와 Cursor, Windsurf, VS Code, Cline/Roo를 위한 구성 생성을 제공합니다. 서버가 연결된 어시스턴트에서는 "APK를 빌드하고, 설치하고, 설정을 열고, 비행기 모드를 전환하고, 결과를 스크린샷으로 남겨"가 더 이상 스크립트가 아니라 한 문장이 됩니다.
• 접근성 도우미. 첫 번째 작업은 Artemis Accessibility Helper를 설치합니다. 이 도우미는 UiAutomation 연결을 점유하지 않고 화면 레이아웃을 읽습니다. 이는 같은 기기에서 실행되는 다른 UiAutomator 기반 도구가 억제되지 않도록 하기 위해 의도적으로 그렇게 설계된 것입니다. 이 도우미는 휴대폰에서 실행되며 외부로 아무것도 전송하지 않고, 연결할 수 없을 때는 UIAutomator2로 대체하며, 이러한 대체 사실은 작업 타임라인에 표시됩니다.
• 로그 및 트레이스 캡처.크래시 스택, 키프레임 스크린샷, 진단 보고서가 호출자가 나중에 덧붙이는 방식이 아니라 자동으로 수집됩니다 — 이것이 단순한 데모가 아니라 회귀 테스트 스위트로 사용할 수 있는 이유입니다.

Flash와 Pro는 하나의 이름을 공유하는 서로 다른 두 제품입니다.
ARTEMIS를 무엇과 비교해 벤치마킹하기 전에 가장 먼저 이해해야 할 점은 code>--profile flash/code>와 code>--profile pro/code>가 하나의 에이전트에 있는 속도 설정이 아니라는 것입니다. 그것들은 서로 다른 두 개의 에이전트입니다.
• Flash — 단계당 대략 3–5초의 반응형 관찰-행동 루프로, 계획도, 메모도, 사전 실행 안전 점검도, 체크포인트 검증도, 최종 보고서도, ADB shell도 없습니다. 이 루프는 기록이 누적되는 대신 압축되기 때문에 기본적으로 무한합니다.
• Pro — 단계당 대략 15–40초가 걸리는 멀티 에이전트 그래프로, 명시적인 code>verify/code> 및 code>assert/code> 항목이 포함된 살아 있는 Markdown 계획을 유지하는 Planner, 전체 도구 세트를 갖춘 Operator, 그리고 체크포인트를 검증하고 종료 리뷰를 실행하는 읽기 전용 Checker로 구성됩니다. code>--verification-level/code>은 code>off/code>, code>final/code> (기본값), code>checkpoints/code> 또는 code>strict/code> 중 하나를 받습니다.
동일한 작업 설명에 대해 5~10배의 지연 시간 차이가 나며, 이는 스모크 테스트와 100단계 이상의 탐색 실행 사이의 차이입니다. Google의 자체 설명에 따르면 Pro는 장기적 작업과 지속적인 code>[Loop:continuous]/code> 모니터링을 위한 것이고, Flash는 일상적이고 결정론적인 UI 작업을 위한 것입니다. 단계 타이밍을 인용하면서 어떤 프로필이 그 타이밍을 생성했는지 알려주지 않는 리뷰를 읽는다면, 그 리뷰는 아무것도 알려주지 않는 것입니다.

위치 결정 전략이 진짜 엔지니어링이다
대부분의 모바일 자동화 프레임워크는 선택자에서 무너진다. ARTEMIS는 동적 우선으로 설계되었다: 접근성 요소 인덱스가 존재하면 이를 사용하고, 존재하지 않으면 — 캔버스, Compose 서피스, Flutter 뷰, 게임 — 좌표와 비전으로 폴백한다. 유지 관리할 XPath 계층도 없고 낡아버릴 ID도 없는데, 이는 가장 테스트하고 싶은 애플리케이션이 매주 새 빌드를 출시하는 애플리케이션이기 때문에 중요하다.
Pro 프로필은 Safety Net을 추가합니다. 모든 액션은 실행 전 검사를 통과하는데, XML 우선 방식에 픽셀 폴백을 적용해 여러분의 탭을 삼키려는 시스템 팝업을 잡아냅니다. 실패하면 별도의 복구 에이전트를 새로 띄우는 대신 "execution incident"가 열리고, 이는 이후의 성공이 해결해 줄 때까지 컨텍스트에 남아 있습니다. 긴 세션은 압축됩니다 — 오래된 스크린샷은 시각적 요약이 되고, 완료된 단계는 code>search_history/code>와 code>replay_steps/code>가 다시 불러올 수 있는 회상 가능한 시대로 묶입니다 — 이것이 바로 100단계 컨텍스트가 감당할 수 없을 만큼 비싸지는 것을 막아줍니다.
리더보드에서 99.1%, 그리고 출시 게시물이 빠뜨린 주의사항
ARTEMIS의 대표적인 주장은 AndroidWorld에서의 99%+ 완료율이다. AndroidWorld는 Google Research가 20여 개 앱에 걸친 116개의 현실적인 작업을 벤치마킹한 것으로, Pass@1로 채점된다. 2026년 9월 11일 기준 AndroidWorld 리더보드에는 ARTEMIS가 99.1%, Minitap의 mobile-use가 91.4%로 등재되어 있었고, 인간 성능은 80%였다. 표에 나타난 바로는, 이는 공개적으로 보고된 결과들 가운데 최고 수준이다.
그 숫자 옆에는 두 가지가 함께 붙어야 합니다. 첫째, AndroidWorld 리더보드는 제출물을 독립적으로 검증하지 않는다는 점을 명시하고 있습니다. 그 리더보드의 모든 수치, ARTEMIS의 수치까지 포함해 모두 해당 결과를 만든 팀이 자체 보고한 것이며, 견고성 분석에 따르면 작업 변형만으로도 에이전트의 점수가 상당히 달라질 수 있습니다. 99.1%는 공개적이고 확인 가능한 벤치마크에 대한 강력한 벤더 주장으로 취급해야 합니다. 이는 실재하고 유용한 것이지만, 감사된 측정은 아니며 실제로 그렇지도 않습니다. 둘째, 비교의 구도가 중요합니다. 그 벤치마크는 고정된 작업 세트이고, ARTEMIS가 공개한 비교 차트는 보도에 따르면 다른 항목들은 포함하면서 mobile-use는 누락했습니다. 가장 강력한 기존 결과가 차트에서 빠져 있는 벤치마크라면, 원시 퍼센트가 시사하는 것보다 더 약한 주장입니다.
이번 달의 실제 뉴스인 그 분쟁
자사 블로그와 해당 저장소의 공개 이슈에서, Android와 iOS에서 같은 작업을 수행하는 오픈소스 mobile-use 프로젝트를 운영하는 모바일 테스트 스타트업 Minitap은 ARTEMIS의 229개 파일 중 228개가 자사 파일과 동일하다고 주장했다. Minitap이 공개한 세부 내용은 이례적으로 구체적이다. 자사 구현과 일치하는 Android 기기 연결 코드, "Hopper"라는 이름의 에이전트에 속한 지침을 단어 하나까지 그대로 재사용한 점, 그리고 Alice, Bob, Charlie에게 새해 메시지를 보내는 WhatsApp 예제가 동일한 주석, 동일한 정리 단계, 동일한 버그까지 그대로 복제된 점 등이다. 또한 Minitap은 Pierre-Louis Favreau, Jean-Pierre Lo, Nicolas Dehandschoewercker 등 세 명의 Minitap 작성자 이름이 담긴 파일이 8월에 force-push로 교체되어 이름이 삭제되고 다른 작성자로 대체되었다고 주장한다.
라이선스 문제는 모호하지 않다. mobile-use는 Apache 2.0이며, Apache 2.0은 바로 이런 종류의 재사용—상업적, 파생적, 비공개—을 정확히 허용한다. 단, 저작권 고지를 유지하고 무엇을 변경했는지 명시하는 조건에서다. 허용하지 않는 것은 고지를 삭제한 채 코드를 배포하는 것이다. 의혹이 제기된 이후, 저장소에는 "This project includes source code developed by Minitap, Inc."라는 문구와 minitap-ai/mobile-use로의 링크가 실려 있으며, 이 출처 표기를 완성한 9월 12일 커밋은 이 글을 쓰는 시점에서 code>main/code>의 가장 최근 변경 사항이다. Minitap은 출처 표기 삭제를 자사의 답변 없는 리더보드 제출과 연결하는 어떠한 증거도 공개하지 않았고, Google도 상세한 공개 답변을 내놓지 않았다. 정직한 해석은 이렇다: 공유되고 있는 코드는 정당하며 언제나 허용되어 왔다. 서류 처리는 한동안 그렇지 않았고, 이제 그것은 바로잡혔다.
아무도 계산에 넣지 않는 부분: 모델 청구서
ARTEMIS에는 "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL"이라고 적힌 배지가 함께 제공되며, 설정 파일은 code>config/artemis.jsonc/code>에 있는데, 여기에서 자격 증명을 보유한 비전 모델을 무엇이든 지정할 수 있습니다. 그 파일 안의 어떤 내용도 실제 워크플로에서 Pro를 실행하고 긴 에이전트가 실제로 얼마를 소모하는지 지켜보기 전까지는 사용자에게 드러나지 않습니다.
프로파일별로 계산해 보세요. 단계당 15~40초로 100단계 Pro를 실행하면 실제 시간으로 25분에서 한 시간이 조금 넘는 사이입니다. 그리고 그 각 단계는 최소 한 번의 스크린샷을 담은 비전 모델 호출입니다. Flash는 단계당 더 저렴하지만 루프를 더 심하게 돌리고, 컨텍스트가 잘리는 대신 압축되기 때문에 당신이 상한이라고 가정한 턴 제한을 기꺼이 넘어서 실행됩니다. 어떤 프로파일을 선택하든, 테스트 스위트와 함께 규모가 커지는 비용 항목은 모델이지 라이선스나 하드웨어가 아닙니다.
여기가 바로 라우팅 계층이 더 이상 추상화로 남지 않는 지점입니다. 긴 Android 세션을 구동하는 비전 모델은 두 가지 까다로운 속성을 지닌 워크로드입니다. 수명이 길다는 것, 그리고 74번째 단계 중간에 프로바이더가 잠깐 삐끗하는 것도 견디지 못한다는 것 — 그 실행의 컨텍스트가 바로 그 프로바이더의 엔드포인트에 있기 때문입니다. ARTEMIS를 하나의 OpenAI 호환 베이스 URL로 향하게 하고, 우리의 페일오버가 실행을 동일한 모델의 다른 프로바이더로 옮기게 하는 것은 불안정한 테스트와 오후를 통째로 날리는 일 사이의 차이입니다. Qwen3.8-Flash는 가장 먼저 시도해 볼 만한 흥미로운 후보입니다 — 100만 토큰 컨텍스트를 갖춘 활성 파라미터 6B 멀티모달 MoE로, 우리 카탈로그에 입력 100만 토큰당 $0.15, 출력 100만 토큰당 $0.47, 캐시 읽기 $0.018, 캐시 쓰기 $0.230으로 등록되어 있습니다. 여기서 관련 있는 가격은 캐시 읽기 가격인데, Pro 실행은 매 단계마다 커지는 컨텍스트를 다시 읽기 때문입니다.
그렇지만 그것이 의미하는 바를 정확히 하세요: Qwen3.8-Flash는 ARTEMIS의 테스트된 백엔드 목록에 없으며, 그 목록에는 Gemini, Claude, GPT-4o, Qwen-VL이 이름을 올리고 있습니다. 이는 하네스에 그럴듯하게 들어맞는 모델이고, 하네스는 그러한 모델을 받아들이도록 명시적으로 만들어졌습니다. 그 조합에 대한 벤치마크를 발표한 사람은 아무도 없으며, 있다고 주장하는 사람은 누구든 그것을 지어낸 것으로 취급해야 합니다.
로드맵, 그리고 그중 얼마나 많은 부분이 핵심을 떠받치고 있는가
공개된 로드맵에는 네 가지 항목이 있습니다: 편집기 내 디버깅, 테스트 기록 및 기기 제어를 지원하는 Android Studio 통합; iOS 지원; 저지연, 프라이버시 우선 작업을 위한 온디바이스 경량 비전-언어 모델; 그리고 실시간 양방향 음성 상호작용.
첫 번째가 믿어야 할 항목이다. 왜냐하면 그것은 Pixel 테스트 엔지니어링 팀이 내놓을 자연스러운 다음 산출물이고 연구 위험이 따르지 않기 때문이다. 에이전트는 이미 기기를 구동하며, 이제 IDE에 패널만 있으면 된다. iOS는 밖에서 보이는 것보다 훨씬 큰 주장이다. 전체 위치 탐색 전략이 Android의 접근성 서비스에 기대고 있고, iOS에는 같은 권한 모델을 가진 동등한 표면이 없으므로, 포팅이 아니라 인식 계층을 다시 작성해야 할 것으로 예상된다. 온디바이스 VLM 항목은 면밀히 지켜볼 가치가 있다. 목록에서 현재 대규모 테스트 스위트를 지배하는 단계별 API 비용을 없앨 수 있는 유일한 항목이며, 이는 UI 작업을 하나로 유지할 수 있는 작고 빠르며 비전을 갖춘 모델을 함의한다. 이는 "도구 사용을 잘하는 작은 모델"보다 훨씬 좁은 목표다.

이번 주에 그걸로 무엇을 해야 할까요?
클론한 뒤 실행하세요: code>./start.sh/code>를 에뮬레이터 하나에 대해 돌리고, 기존 Espresso 스위트가 커버하는 작업을 Flash에 맡겨 보세요. 그러면 동적 우선 로케이터가 앱의 Compose 화면에서 살아남는지를 한 시간 안에 알 수 있는데, 이 질문이 나머지가 중요한지 아닌지를 결정합니다. 그런 다음 같은 작업을 Pro에서 실행하고 두 트레이스를 비교하세요. 단계당 3~5초와 15~40초 사이의 격차가 바로 예산이 좌우되는 지점이며, 그것 없이는 ARTEMIS의 비용을 따져볼 수 없습니다.
코드를 읽고 있다면 헤더도 읽어라. Minitap 출처 표기를 추가한 9월 12일 커밋은 저장소에서 가장 최근 커밋이다. 즉, 네가 읽고 있는 파일 헤더는 나흘 된 것이고, 이 프로젝트는 공개적으로 활발히 수정되고 있다는 뜻이다. 그것은 이 프로젝트를 피할 이유가 아니다. 슬라이드에서 성공률을 인용하기 전에, 네가 들고 있는 이야기가 어느 버전인지 확인할 이유다.
ARTEMIS를 단일 OpenAI 호환 base URL로 지정하고 동일 모델의 다른 제공자로 실행을 옮기는 장애 조치를 허용하는 것이 불안정한 테스트와 날아간 오후의 차이입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
