'ARTEMIS vs Gemma 4 12B'의 생성된 타이틀 카드로, 부제는 '하네스와 두뇌는 같은 구매가 아니다'이며, 자체 모델이 없는 안드로이드 자동화 하네스인 ARTEMIS와 행동할 방법이 없는 12B 밀집 멀티모달 체크포인트인 Gemma 4 12B를 대비시키는 두 장의 카드가 함께 있다.
Guides & Insights

ARTEMIS vs Gemma 4 12B: 하네스와 두뇌는 같은 구매가 아니다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Google의 ARTEMIS와 Gemma 4 12B는 경쟁 관계가 아니며, 이 둘을 비교 표에 올려놓고 승자를 고르는 것이 일주일을 낭비하는 가장 빠른 방법이다. 2026년 8월 Google이 Apache 2.0으로 오픈소스화한 ARTEMIS는 Android 자동화 하네스다. 문장 하나를 입력받아 ADB를 통해 실제 휴대폰을 조작하고, 무슨 일이 일어났는지 보고한다. 2026년 6월 3일 Google DeepMind가 공개한 Gemma 4 12B는 120억 파라미터의 dense 오픈 웨이트 멀티모달 모델, 즉 노트북에서 실행할 수 있는 두뇌이지 화면을 탭할 수 있는 시스템이 아니다. 둘 중 하나는 다른 종류의 것이 붙어 있지 않으면 보지도, 결정하지도, 행동하지도 못하고, 다른 하나는 기기를 아예 잡을 수 없다. 그래도 이 비교는 해볼 가치가 있다. 그 밑에 깔린 질문이 바로 모든 모바일 팀이 지금 던지는 질문이기 때문이다. 완전히 소유한 작은 오픈 모델이 Android 자동화를 할 수 있는가, 아니면 ARTEMIS 같은 하네스 뒤에 호스팅된 프런티어 모델이 필요한가? 이 질문에는 실제 답이 있으며, 어느 벤더의 출시 글이 암시하는 답도 아니다.

먼저, 범주 오류를 분명히 말하자면

ARTEMIS에는 모델이 들어 있지 않습니다. ARTEMIS 자체의 배지에는 "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL"이라고 적혀 있으며, 어느 모델을 사용할지 결정하는 파일은 code>config/artemis.jsonc/code>입니다. ARTEMIS는 하나의 제어 루프입니다. 접근성을 최우선으로 하는 로케이터, 탭이 실제로 들어가기 전에 팝업을 정리하는 안전 검사, 오래된 스크린샷을 시각적 요약으로 압축하는 세션 원장, 그리고 두 가지 실행 프로필 — 단계당 약 3~5초가 걸리는 Flash와, 플래너·오퍼레이터·읽기 전용 체커를 갖추고 단계당 약 15~40초가 걸리는 Pro — 로 구성되어 있습니다. ARTEMIS가 세상에 대해 아는 모든 정보는 ARTEMIS가 직접 작성하지 않은 비전-언어 모델을 통해 들어옵니다.

Gemma 4 12B는 정반대 형태의 객체입니다. 그것은 체크포인트입니다. 기기 연결도, ADB도, 접근성 서비스도 없고, 탭이 실행될 수 있는 동작이라는 개념 자체가 없습니다. 스크린샷을 주고 다음에 무엇을 해야 할지 물으면 답할 것입니다 — 어쩌면 잘 답할 수도 있습니다 — 하지만 그 답하는 것이 그것의 행위 능력의 전부입니다. "모델이 (540, 1180)을 탭하라고 말했다"와 "휴대폰이 (540, 1180)을 탭했다" 사이의 모든 것은 ARTEMIS의 일이며, 그것이 작업의 대부분입니다.

그래서 이 맞대결을 솔직하게 정리하면 ARTEMIS 대 Gemma가 아닙니다. 그것은 바로: 12B 오픈 모델이 Android 에이전트의 추론 계층으로서 여러분에게 무엇을 제공하며, 언제 더 큰 무언가에 비용을 지불해야 할까요?

Gemma 4 12B가 실제로 가져오는 것

중형 모델치고는 이례적으로 사양이 잘 갖춰져 있으며, 그 속성 중 세 가지는 모바일과 관련된 모든 것에 중요하다.

이것은 입력 계층에서 진정으로 멀티모달입니다. 텍스트, 이미지, 오디오, 비디오가 입력되고 텍스트가 출력됩니다. 이것은 별도의 멀티모달 인코더가 없는 최초의 중간 규모 Gemma이며, 오디오를 기본적으로 수용하는 제품군 최초의 모델입니다. 이는 UI 자동화 기능은 아니지만, 테스트 시나리오에 음성 메모, 소리 내어 읽는 알림 또는 오디오 단서를 기반으로 구축된 접근성 경로가 포함된다면 실제로 유용한 기능입니다.

손에 들 수 있는 12B입니다. Artificial Analysis는 이를 Apache 2.0 아래 총 12B 파라미터로 표기합니다 — 매출 제한도, 연구 조항도 없고, 누구에게도 묻지 않고 제품을 만들 수 있는 라이선스 — 256K 컨텍스트 창, 추론 활성화, 그리고 초당 109.2토큰의 측정된 출력 속도를 갖추고 있습니다. 커뮤니티 보고에 따르면 가중치는 SFP8에서 약 13.4GB, Q4_0에서 약 6.7GB이며, 이는 16GB 메모리를 갖춘 노트북에 해당합니다.

저렴하긴 하지만, 동급에서 가장 저렴한 것은 아닙니다. Artificial Analysis는 백만 입력 토큰당 $0.10, 백만 출력 토큰당 $0.30으로 표시하며, 같은 패널에서 이 가격이 비슷한 규모의 오픈 웨이트 모델로서는 비싼 편이라고 언급합니다. 해당 모델군의 중간값은 입력 $0.05, 출력 $0.15입니다. 캐시 읽기는 약 $0.03 수준입니다.

벤치마크 상황은 중간 규모 모델에서 흔히 나타나는 혼란스러운 양상이며, 트래커 사이트의 수치들이 서로 엇갈리기 때문에 신중히 언급할 가치가 있다. Artificial Analysis는 추론 구성에 Intelligence Index 14점을 부여하며, 해당 클래스의 오픈 웨이트 모델 142개 중 21위로 순위를 매긴다. 이는 존중할 만한 중위권 위치이며 최전선과는 거리가 멀다. 구글의 자체 포지셔닝에 따르면 12B는 더 큰 Gemma 4 26B-A4B에 거의 맞먹고, 추론·과학·문서 작업에서 이전 세대의 Gemma 3 27B를 능가한다. 제3자 집계 사이트들은 LiveCodeBench v6에서 약 72%, MMLU-Pro에서 77.2%로 평가하며, GPQA Diamond는 어느 트래커와 어느 구성을 보느냐에 따라 66%에서 79% 범위에 이른다. 이는 12B 모델로서는 존중할 만한 수치다. 또한 이는 감사를 거치지 않은 자기 보고 집계이며, 네 사이트가 13포인트 차이로 엇갈릴 때는 특정 점수보다 범위를 기준으로 삼아야 한다.

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a measured speed of 109.2 output tokens per second, $0.10 per million input tokens and $0.30 per million output, a 256k-token context window, 12B total parameters, an Apache 2.0 licence and reasoning enabled.

ARTEMIS가 무엇을 가져오는지, 한 단락으로 — 여기서는 그것이 주제가 아니니까.

ARTEMIS는 모델이 결코 가질 수 없는 모든 것을 제공합니다. 접근성 요소 인덱스가 존재할 때는 이를 사용하고, 존재하지 않을 때는 비전과 좌표로 폴백하는 동적 우선 로케이터가 그것으로, 유지 관리할 XPath도 없고 Compose나 Flutter 화면에서 만료될 ID도 없습니다. 또한 탭이 막 착지하려던 시스템 팝업을 가로채는 Safety Net, code>off/code>부터 code>strict/code>까지 네 단계의 체크포인트 검증, 자동 크래시 스택, 키프레임 스크린샷과 진단 보고서, 웹 콘솔, pytest와 CI를 위한 Python SDK, 그리고 — 이것이 그토록 빠르게 확산된 이유인 — Antigravity, Claude Code, Codex 및 그 밖의 MCP 지원 어시스턴트에게 이 모든 것을 다섯 개의 도구로 노출하는 네이티브 MCP 서버를 제공합니다. Google Research의 AndroidWorld 벤치마크에서 주장하는 99%+ 완료율은 2026년 9월 11일 기준 공개 리더보드에서 99.1%로, 인간 성능의 80%와 대비됩니다. 이 수치는 자체 보고이며 리더보드는 제출물을 검증하지 않으므로, 감사가 아닌 강력한 벤더 주장으로 취급하십시오.

두 가지가 진정으로 겹치는 유일한 지점

작은 Gemma가 모든 작업을 수행하는 실제 아키텍처가 있으며, 이는 클라우드 모델이 실제로 무엇에 비용을 지불하는지를 보여주므로 살펴볼 가치가 있습니다. Orion이라는 오픈소스 Android 에이전트 프레임워크는 전적으로 온디바이스에서 실행됩니다. MediaProjection이 화면을 캡처하고, 양자화된 Gemma-4-E4B-it가 LiteRT-LM을 통해 Qualcomm Hexagon NPU에서 실행되어 다음 동작을 선택하며, Android Accessibility Service가 탭을 전달합니다. 클라우드 API도, 토큰당 청구서도 없고, 화면은 핸드셋을 떠나지 않습니다. 이는 Galaxy S25 Ultra에서 검증되었으며, 자체 설명에 따르면 Hexagon NPU가 있는 하드웨어에서만 의미가 있습니다. 모델에는 약 3GB의 저장 공간이 필요하고 프레임워크는 arm64에서 QNN HTP v79를 대상으로 합니다.

이것이 오늘날 작동하는 소형 모델 Android 에이전트의 모습이며, 거기에 도달하는 데 드는 대가가 무엇인지 주목하세요. 모델은 양자화되어 있고 NPU에 매핑됩니다. 행동 공간은 픽셀입니다. 스크린샷만 보는 모델은 "element index 12"를 해석할 수 없기 때문입니다. 전체 설계는 수직 스택입니다 — 모델, 런타임, 실리콘, 프레임워크 — 그래서 이것은 프레임워크이며 테스트 스위트에 바로 넣을 수 있는 대체품이 아닙니다. Gemma 4 12B는 그 스택에 있는 E4B의 매개변수 수보다 대략 세 배 많으며, 휴대폰에서 실행 가능한 형식으로 제공되지 않습니다. 4비트 양자화된 12B는 NPU 상주형이 아니라 워크스테이션이나 서비스되는 엔드포인트입니다.

A generated diagram of a four-layer Android agent stack - assistant (Antigravity, Claude Code, Codex) on top, then the ARTEMIS harness with locator, Safety Net, checkpoints and traces, then the vision-language reasoning layer, then the Android device via ADB - with a callout beside the reasoning layer noting that Gemma 4 12B could sit there but is untested with ARTEMIS.

각각이 실제로 이기는 부분

규모 확장 시 비용 — 자체 호스팅 Gemma 4 12B는 토큰당 비용이 전혀 없는 반면, ARTEMIS 실행은 매 단계마다 단계별 비전 호출이 필요합니다. 매일 밤 실행되는 500개 테스트 회귀 스위트에서는 그 차이가 어떤 벤치마크 격차보다도 더 빠르게 누적됩니다.

개인정보 — 자체 하드웨어에서 실행되는 Gemma 4 12B는 스크린샷을 어디에도 전송하지 않습니다. ARTEMIS의 접근성 도우미는 명시적으로 온디바이스에서 동작하며 아무것도 전송하지 않지만, 스크린샷마다 이루어지는 모델 호출은 설정하신 제공업체로 전달됩니다.

실제 앱에서의 작업 신뢰성 — ARTEMIS, 압도적인 차이로 앞섭니다. 안전망과 체크포인트 검증, 복구 기능을 갖춘 하네스이기 때문입니다. 더 나은 모델이라는 것만으로는 그것을 대체할 수 없습니다.

오디오 및 장문 문서 — Gemma 4 12B, 기술 사양서상 네이티브 오디오 입력과 256K 토큰 컨텍스트 창을 갖추고 있습니다. ARTEMIS는 둘 중 어느 것에도 의견이 없습니다.

첫 번째 테스트를 통과하기까지 걸리는 시간 — ARTEMIS, 압도적인 차이로. 클론하고, code>./start.sh/code>를 실행한 뒤, USB 디버깅이 활성화된 기기를 연결하고, 첫 작업이 접근성 도우미를 설치할 때까지 기다리세요. 베어 체크포인트로 동등한 것을 구축하는 것은 수개월에 걸친 프로젝트이며, 위의 Orion 예시는 그 프로젝트가 완성되었을 때의 모습입니다.

추론 계층을 수정할 수 있는 자유 — Gemma 4 12B는 자체 UI 어휘로 미세 조정할 수 있는 Apache 2.0 가중치입니다. ARTEMIS는 Apache 2.0 코드이지만, 추론은 여러분의 모델이 있는 곳에 있습니다.

오늘 실제로 이용 가능한 이 페어링의 버전들

이번 주에 무엇을 배포할 수 있는지 분명히 하세요. ARTEMIS의 테스트된 백엔드 목록은 Gemini, Claude, GPT-4o, Qwen-VL입니다 — Gemma 4 12B는 여기에 없으며, Gemma 4 12B가 ARTEMIS 세션을 구동하는 것에 대한 공개된 평가도 없습니다. 구성 파일은 모델 엔드포인트를 받으므로 이 조합은 입증된 것이 아니라 그럴듯한 것이며, 시도한다면 문서를 따르는 것이 아니라 독자적인 작업을 하는 것입니다. 분명히 말할 가치가 있습니다: ARTEMIS의 로드맵에는 "온디바이스 경량 VLM" 항목이 있으며, 이를 채울 모델은 12B가 아닐 것입니다.

Gemma 4 12B도 저희 카탈로그에 없습니다 — 저희는 다른 Gemma 4 사이즈들을 라우팅합니다. Gemma 4 26B-A4B와 Gemma 4 31B이고, 12B는 아닙니다. 따라서 그것이 원하는 체크포인트라면 벤더 자체 배포판과 일반적인 서드파티 호스트에서 받게 됩니다. 라우팅된 카탈로그가 필요한 이유는 이 문제의 나머지 절반에 있습니다. 호스팅된 비전 모델 위에서 ARTEMIS를 돌릴 계획이라면, 그 모델은 모든 실행의 모든 단계마다 함께 늘어나는 항목이며, 유용한 지렛대는 정가가 아니라 캐시 가격입니다. Pro 실행은 매 단계마다 커져가는 컨텍스트를 다시 읽으므로, 캐시 읽기가 저렴한 모델이 새 입력이 저렴한 모델보다 산술을 훨씬 더 크게 바꿉니다. 이것이 또한 프로바이더 페일오버가 인시던트 로그가 아니라 설정에 속하는 이유입니다 — 긴 Android 세션은 하나의 엔드포인트에 컨텍스트를 붙들고 있고, 74단계에서 프로바이더가 한 번 삐끗하면 실행을 잃게 됩니다.

A generated scoreboard comparing ARTEMIS and Gemma 4 12B across six dimensions: category (harness vs open-weights VLM checkpoint), ability to drive a phone (yes via ADB vs no), parameter count (not a model vs 12B dense, about 6.7GB at Q4), price (per-step model call vs $0.10 in / $0.30 out per 1M), AndroidWorld (99.1% self-reported vs not published) and licence (Apache 2.0 for both).

당신의 다음 수는 어느 쪽인가요?

모바일 앱과 회귀 스위트가 있다면, 당신에게 필요한 것은 ARTEMIS이며, Gemma 4 12B는 그 어떤 부분의 대체재도 아닙니다 — 잘해야 나중에, 문서화되지 않은 채, 당신이 개인 시간을 내어 교체해 넣을 수도 있는 엔진 정도입니다. 네트워크도 없고 호출당 비용도 없는 핸드셋에서 반드시 실행되어야 하는 제품을 만들고 있다면, 작은 모델이 필요하며, Gemma 4 12B는 당신이 실제로 가진 폼 팩터에는 아마도 너무 큽니다. 12B가 들어맞으리라 가정하기 전에 Orion이 NPU에서 4B급 Gemma로 무엇을 했는지 살펴보십시오.

두 결정은 단 한 곳에서만 충돌하는데, 그것은 역량의 문제라기보다 비용의 문제입니다: 하루에 비전 호출을 몇 번이나 살 의향이 있습니까? 그 질문에 솔직하게 답하십시오 — 테스트를 세고, 단계를 세고, 야간 실행을 세십시오 — 그러면 호스티드 모델 위의 하네스와 자체 호스팅 스택 사이의 선택은 스스로 이루어집니다.

무엇을 위한 것인지라우팅된 카탈로그가가 이 문제의 나머지 절반입니다: 계획이 호스팅된 비전 모델에서 ARTEMIS를 사용하는 것이라면, 그 모델은 모든 실행의 모든 단계마다 확장되는 비용 항목입니다

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트