UI-Mate-27B를 위한 히어로 타이틀 카드로, 2026년 8월 14일에 출시된 Tencent의 오픈 웨이트 기반 GUI 파운데이션 에이전트이다. 마우스 커서와 자동화 화살표가 표시된 데스크톱 모니터를 보여주며, 부제목은 'Open-Weight Foundation GUI Agent', 라벨 칩은 'Apache-2.0', '27B params', 'vLLM ready'이고, 오른쪽 하단 모서리에는 OrcaRouter 로고가 있다.
Guides & Insights

Tencent UI-Mate-27B: WindowsAgentArena 상위권을 차지한 조용한 오픈 가중치 GUI 에이전트

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월 14일, 텐센트의 HY Frontier 멀티모달 에이전트 팀은 tencent/ 조직 아래 Hugging Face에 세 개의 체크포인트를 올렸습니다 — UI-Mate-27B, 더 작은 UI-Mate-9B, 그리고 데모 안내 기반의 UI-Mate-democua-27B입니다. 나흘 후에도 어디서도 발표가 없습니다: 출시 포스트도, 보도자료도, 제품 트윗도 없습니다. 대신 조용히 공개된 것치고는 이례적으로 완전한 패키지가 나왔습니다: 프로젝트 페이지, 작동하는 하네스를 갖춘 GitHub 저장소, 그리고 이틀 전 제출된 arXiv 논문으로, 더 큰 모델을 데스크톱 GUI 제어 분야의 새로운 오픈 가중치 최고 수준이라고 설명합니다.

이 글의 모든 내용은 모델 카드, GitHub 리포지토리, 프로젝트 페이지, 그리고 해당 논문에서 나온 것이며, 그 어느 것도 아직 독립적으로 재현되지 않았습니다. 이 글을 쓰는 시점 기준으로 체크포인트는 Hugging Face에서 다운로드 수가 0건이며, 이는 우리가 Tencent 외부에서 이들을 문서상으로 진지하게 다루는 최초의 사람들일 가능성이 높다는 뜻입니다. 다음은 리포지토리에서 실제로 알 수 있는 것과, 다른 누군가가 실행하기 전까지는 확인되지 않은 채로 남아 있는 것입니다.

목차

• 출시된 것과 아직 발표되지 않은 것

• UI-Mate-27B가 실제로 무엇인지

• 차별화된 기능: 데모 기반 실행

• 숫자들 — 모두 벤더가 보고한 것입니다

• 그 숫자들이 놓일 위치 — 만약 그것들이 유지된다면

• 실행 방법

• 새 GUI 에이전트를 둘러싼 스택

• 다음에 볼 것

• 자주 묻는 질문

출시된 것과 아직 발표되지 않은 것

텐센트는 2026년 8월 14일, 9B 형제 모델 및 데모 기반 체크포인트인 UI-Mate-democua-27B와 함께 UI-Mate-27B(270억 개 파라미터, Apache-2.0, BF16 safetensors)를 공개했습니다. 두 27B 체크포인트는 2026년 4월에 출시된 Apache-2.0 멀티모달 모델인 Qwen3.6-27B를 기반으로 구축되었으며, 이는 기본 모델과 파인튜닝 모델을 포함한 전체 스택이 상업적으로 사용 가능함을 의미합니다. 저장소에는 이번 주의 최종 수정 타임스탬프가 기록되어 있고, 데모 기반 체크포인트는 오늘도 수정될 만큼 최근에 업데이트되었으므로 텐센트가 해당 모델들을 활발히 작업 중임을 알 수 있습니다.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

지금까지 공개된 내용:

• Hugging Face의 UI-Mate-27B, UI-Mate-9B, UI-Mate-democua-27B 가중치. 각각 모델 카드, 평가 테이블, 서빙 레시피를 포함합니다.

• ui-mate.github.io의 프로젝트 페이지에서 데모 비디오, 사용 가이드, macOS Apple Silicon 앱(DMG v0.2.4)을 제공합니다.

• 공식 프롬프트, 응답 파서, 상호작용 하네스를 포함하는 GitHub 저장소(github.com/Tencent/UI-Mate) — 카드에는 이것이 "독립형 비주얼 채팅 모델이 아니라 에이전트 체크포인트"라고 명시되어 있으며, 실제 작업에는 하네스가 권장됩니다.

• arXiv 프리프린트(2608.15930), 8월 16일 제출, 제목: "UI-Mate: 오픈 가중치 기반 GUI 에이전트의 인컨텍스트 데모를 통한 발전"

아직 공개되지 않은 사항: Tencent 자체는 아무것도 발표하지 않았습니다 — 이는 출시가 아닌 레포 우선 공개입니다. 프로젝트 페이지에서 아직 공개되지 않은 것으로 표시되었던 데모 안내 변형 모델이 이제 Hugging Face에 실제 가중치로 공개되었습니다: {{1}}tencent/UI-Mate-democua-27B{{/1}} 레포는 8월 14일 동일한 푸시에서 생성되었으며, 해당 제품군의 {{2}}데모 안내 체크포인트{{/2}}로 명시적으로 태그되어 있습니다 — 이는 27B의 브랜드 변경이 아닌 별개의 모델입니다. 어디에도 호스팅된 API는 아직 없습니다. 이것이 중요한 이유: 오늘날 UI-Mate를 실행하는 유일한 방법은 가중치를 직접 다운로드하여 직접 서빙하는 것입니다.

UI-Mate-27B가 실제로 무엇인지

UI-Mate-27B는 '애플리케이션과 운영 체제에 걸친 장기 작업'을 위한 기반 GUI 에이전트입니다. 라이브 스크린샷을 관찰하고, 보이는 상태에 대해 추론하며, 네이티브 데스크톱 상호작용을 위한 구조화된 키보드 및 마우스 동작을 생성합니다. 학습은 지도 미세 조정 후 실행 가능한 GUI 환경에서의 온라인 강화 학습으로 이어지며, 모델은 정적 스크린샷만으로가 아니라 실제로 데스크톱을 조작하면서 학습했습니다.

액션 공간은 개발자들이 관심을 가질 부분입니다: 마우스, 키보드, 스크롤, 대기, 사용자 상호작용, 작업 완료가 포함되며, 출력은 pyautogui와 호환됩니다. 모델은 정규화된 1000×1000 좌표 공간에서 추론하고, 참조 에이전트는 예측값을 실제 스크린샷 해상도로 다시 조정하므로 작업이 기기 간 디스플레이 배율 차이에도 영향을 받지 않습니다. 모델의 자체 README는 OpenAI 호환 엔드포인트 뒤에서 vLLM으로 서빙할 것을 권장합니다.

차별화된 기능: 데모 기반 실행

대부분의 GUI 에이전트는 명령이라는 하나의 입력을 받습니다. UI-Mate는 공개 체크포인트에서는 정말 드문 두 번째 입력, 즉 데모를 받습니다. 프로젝트 페이지의 표현을 빌리자면, "워크플로를 한 번 보여주세요. 에이전트가 당면한 작업에 맞게 적응하게 하세요."

이 메커니즘은 컨텍스트 내 비디오나 고정된 동작 스크립트가 아닙니다. 데모는 각 키보드 또는 포인터 동작 직전과 직후의 스크린샷을 기록하며, 파이프라인은 그 추적 기록을 일관된 동작-프레임 표현으로 정규화하고, 관찰, 의도, 동작, 검증 증거로 주석을 단 다음, 완료 기준이 있는 명명된 하위 작업들로 분할합니다. 추론 시점에는 이것이 활성 하위 작업에 주입되는 간결한 워크플로우가 되지만, 실시간 스크린샷이 전체 과정에서 기준으로 유지되므로 애플리케이션 상태가 데모와 다를 때 모델은 재생하는 대신 재계획을 수행합니다.

Tencent는 이 워크플로우의 배후에 있는 체크포인트를 자체 공개 모델로 만들었습니다: UI-Mate-democua-27B 카드는 동일한 평가에서 지침 전용(instruction-only) 결과와 단일 데모(one-demonstration) 결과를 짝지어 제시하며, 그 도구 스키마에는 subtask_complete 액션이 추가되어 있습니다. 이것은 명명된 하위 작업들 뒤에 있는 메커니즘입니다. OSWorkerBench self-demo 하위 집합에서 데모 1회는 엄격 성공률을 17.17에서 35.35로, 진행률을 67.85에서 81.14로 끌어올립니다. OSWorld 하위 집합에서는 진행률이 40.27에서 65.75로 상승합니다. GameDev 평가 세트에서는 평균 점수가 76.76에서 81.15로 오르는 반면, 평균 궤적 길이는 303.6단계에서 253.1단계로 줄어듭니다. 즉 데모는 작업을 개선할 뿐만 아니라 단축하기도 합니다. 카드는 데모가 33개의 self-demo 작업 중 28개를 개선했고, 지침 없이는 0점을 받는 4개의 작업을 해결했다고 보고합니다. 주의할 점은 이 기사 전체에 흐르는 것과 동일합니다. 즉, 이는 팀 자체의 짝지은 평가 결과로, 3~5회 실행을 평균한 것이며, 아무도 이를 재현하지 못했습니다.

그 숫자들 — 전부 벤더가 보고한 것이다

모델 카드에서 직접 가져온, 지시 전용 실행:

• OSWorld-Verified 평균 점수 — 77.0

• WindowsAgentArena 평균 점수 — 66.2

• OSWorkerBench 엄격 성공 — 41.00

• OSWorkerBench 진행률 — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench는 그 자체로 이 논문의 세 가지 기여 중 하나입니다. 41개 애플리케이션에 걸친 100개의 장기 지평 사무 작업으로 구성된 새로운 벤치마크로, 33개의 셀프 데모와 45개의 변형 데모 하위 집합을 포함합니다. 이는 새로운 평가이므로 이 두 점수를 비교할 기존 연구는 없습니다. 자체 기본 모델 대비 UI-Mate-27B는 OSWorkerBench에서 Qwen3.6-27B보다 엄격 성공 17.7포인트, 진행도 24.5포인트를 앞선다고 주장됩니다. 두 모델이 동일한 하네스를 통해 실행되므로, 이는 이번 릴리스 전체에서 가장 확실한 동등 비교 수치입니다.

위의 모든 수치는 팀 자체의 평가입니다. 아직 독립적인 점수는 없고, 제3자에 의한 재실행도 없으며, 다운로드가 0건이므로 커뮤니티 재현 결과도 없습니다. 여기 있는 모든 숫자는 사실이 아닌 주장으로 간주하십시오.

그 숫자들이 자리 잡을 곳 — 만약 그것들이 유지된다면.

WindowsAgentArena가 진정한 헤드라인이 될 것입니다. 2026년 초 공개적으로 보고된 최고의 WAA 결과는 61.0 부근에 집중되어 있었습니다(2026년 4월, VLAA-GUI라는 모듈식 시스템). 메이투안(Meituan)의 오픈 웨이트 EvoCUA-32B는 56.5를 기록했고, 바이트댄스(ByteDance)의 비공개 UI-TARS-2는 같은 리더보드에서 50대 초중반 수준이었습니다. UI-Mate-27B 자체 평가에서 66.2를 기록한다면, 올해 이 벤치마크에서 보고된 모든 결과(공개든 비공개든)를 웃도는 것입니다. 이는 강력한 주장이며, 독립적인 재실행이 필요합니다.

OSWorld-Verified에서 77.0이라는 점수는 강력하지만, 공개 보드에서 새로운 오픈 가중치 기록은 아닙니다. 2026년 8월 초의 OSWorld-Verified 리더보드 스냅샷을 보면, 오픈 가중치 모델 Holo3-35B-A3B가 82.6으로 등재되어 있으며 그 위에는 여러 최첨단 비공개 모델(Qwen3.8 Max 86.1, Claude Mythos 5와 Claude Fable 5 85.0, Claude Opus 4.8 83.4)이 있습니다. 따라서 논문의 "state of the art"라는 표현은 자체 평가 구성에 대한 주장일 뿐 확정된 사실이 아닙니다. 서로 다른 하네스, 액션 파서, 자가 보고의 편향 때문에 77.0 대 82.6의 문제는 독립적인 재실행만이 판가름할 수 있습니다. 27B 오픈 모델이 77.0을 기록한다는 것의 의미를 맥락에서 보면: 이는 약 72.4인 인간 전문가 기준선보다 높고, 같은 보드에서 Claude Opus 4.6(72.7) 및 Kimi K2.6(73.1)을 포함한 여러 대형 프론티어 시스템보다도 위에 위치하게 됩니다.

텐센트는 이 분야에 처음이 아니다. 2026년 2월에는 8B GUI-그라운딩 모델인 POINTS-GUI-G를 출시했고, 5월에는 Marvis OS 어시스턴트를 출시했으며, 6월에는 GUICrafter 컴퓨터 사용 프로젝트에 기여했다. UI-Mate는 전체 데스크톱 제어를 목표로 하는 별도의 라인으로, 텐센트의 GUI 에이전트 중 그라운딩 구성 요소나 제품이 아닌 오픈 파운데이션 모델로 출시된 첫 번째 사례다.

실행 방법

이 모델은 vLLM용으로 설계되었으며, 모델 카드에는 정확한 명령어가 제공됩니다 — tensor-parallel 크기 2와 OpenAI 호환 채팅 템플릿을 사용하는 `vllm serve tencent/UI-Mate-27B` 말이죠. 한 가지 실용적인 세부 사항이 눈에 띕니다: 에이전트는 기본적으로 컨텍스트에 다섯 개의 스크린샷을 유지하므로, 서버는 프롬프트당 최소 여섯 개의 이미지를 허용해야 합니다. 가장 최신 스크린샷이 가장 오래된 스크린샷이 통합되기 전에 도착하기 때문입니다. 권장 플래그는 `--limit-mm-per-prompt`이며 이미지 여섯 개와 비디오 0개입니다. 데모 기반 체크포인트도 동일한 방식으로 제공됩니다 — 해당 카드에는 OpenAI 호환 엔드포인트 뒤에 vLLM과 SGLang이 명시되어 있습니다.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

일단 서비스되면, Python 에이전트 클래스(UIMateAgent)가 스크린샷과 지시를 받아 응답과 구조화된 액션을 반환하며, 1000×1000 좌표를 사용자의 해상도에 맞게 다시 스케일링합니다. 프로젝트 페이지에서는 데모 안내 모드를 위한 macOS Apple Silicon 앱도 제공하는데, 이는 하네스를 직접 구축하지 않고도 "한 번 보여주면 끝" 워크플로를 시도할 수 있는 가장 쉬운 방법입니다. 라이선스는 전체가 Apache-2.0이므로 로컬 사용, 파인튜닝, 상업적 통합이 모두 허용됩니다.

컴퓨터 사용 에이전트의 '실행 방법' 안내에는 두 가지 경고가 반드시 함께 제공되어야 하며, 두 경고 모두 모델 카드 자체에서 비롯됩니다. 격리되었거나 일회용 환경을 사용하세요. 민감한 작업 전에는 인간의 확인을 요구하고, 작업 궤적을 모니터링하며, 모델이 보고한 성공을 의도된 결과가 실제로 발생했다는 증거로 취급하지 마세요. GUI 에이전트는 잘못 클릭할 수 있으며, 화면 콘텐츠를 통한 프롬프트 주입은 가상의 시나리오가 아닌 현실적인 위협 모델입니다.

새 GUI 에이전트 주변의 스택

아직 OrcaRouter에는 UI-Mate 체크포인트가 하나도 없습니다. 이 제품군은 출시된 지 며칠밖에 안 됐고 다운로드도 0건이며, 기본 모델인 Qwen3.6-27B도 마찬가지입니다. 호스팅된 API가 없으므로 이번 주에 실행하려면 직접 vLLM을 서빙해야 합니다. 실험실에서는 괜찮지만 프로덕션에는 적합하지 않은 형태입니다.

프로덕션 컴퓨터 사용 파이프라인은 단일 체크포인트로 구성되는 경우가 거의 없습니다. 이는 다음 의도를 결정하는 플래너 모델, 화면을 읽는 그라운딩 또는 비전 모델, GUI 에이전트 자체, 그리고 하위 단계 실패 시 작동하는 저비용 폴백으로 이루어져 있습니다. 그리고 GUI 에이전트가 로컬에서 실행되더라도 이러한 구성 요소는 모두 서빙되는 모델입니다. 이러한 혼합 구조는 정확히 라우팅 계층이 존재하는 이유입니다. 200개 이상의 호스티드 모델을 하나의 API로 제공하고, 제공업체 목록 가격을 0% 마크업으로 그대로 전달하며, 한 제공업체의 일시적 장애가 긴 에이전트 실행을 중단시키지 않도록 자동 장애 조치를 수행합니다. 라우팅 DSL을 사용하면 여러 모델을 단일 호출로 구성할 수도 있습니다. 앞부분의 플래너와 마지막의 저비용 검증기를 자체 코드에서 제공업체를 직접 연결하지 않고도 구성할 수 있습니다. 솔직한 요약은 간단합니다. 데스크톱을 구동하는 에이전트는 로컬이지만, 그 주변에서 수행할 작업을 결정하는 모델은 라우팅 가능하며, 검증되지 않은 새로운 체크포인트를 안전하게 시도하는 것이 바로 장애 조치의 목적입니다.

다음에 볼 콘텐츠

UI-Mate-27B에 대한 상황을 바꿀 네 가지 사항이 있으며, 대략적인 중요도 순서는 다음과 같습니다:

• OSWorld-Verified 및 WindowsAgentArena의 독립적인 재실행. 특히 WAA 수치는 큰 의미가 있거나 하네스 아티팩트일 뿐이며, 외부 평가만이 어느 쪽인지 결정합니다.

• 공식 기술 보고서. 현재 인용은 임시적이며, 전체 논문은 초록이 간략히 언급한 데이터 엔진 세부 사항을 드러낼 것으로 예상됩니다.

• 텐센트 자체 발표. 이런 레포 우선 공개는 대개 무언가를 앞서는 경우가 많습니다 — Marvis 통합, 호스팅 제공, 또는 더 광범위한 오픈 모델 추진.

• 호스팅 API. 현재 세 체크포인트의 가중치가 모두 공개되어 있지만, 어디에서도 서비스되지 않습니다 — Tencent 엔드포인트도, 제3자 추론 제공자도 없습니다 — 따라서 자체 호스팅만이 유일한 방법이며, Tencent의 발표나 제공자의 채택만이 그 상황을 바꿀 수 있습니다.

자주 묻는 질문

Tencent UI-Mate-27B는 무엇인가요?

UI-Mate-27B는 Tencent의 HY Frontier 멀티모달 에이전트 팀이 Qwen3.6-27B를 파인튜닝하여 만든 Apache-2.0 라이선스의 270억 파라미터 기반 GUI 에이전트입니다. 이 에이전트는 실시간 데스크톱 스크린샷을 관찰하고 이를 추론하여 pyautogui 호환 마우스 및 키보드 동작을 출력합니다. 이 모델은 2026년 8월 14일 Hugging Face에 9B 자매 모델 및 데모 기반 UI-Mate-democua-27B와 함께 아무런 발표 없이 조용히 공개되었으며, 현재까지 벤치마크는 전적으로 공급업체가 보고한 결과입니다.

시연 안내 실행은 스크립트 재생과 어떻게 다른가요?

녹화된 매크로를 실행하는 대신, UI-Mate는 데모를 캡션이 포함되고 하위 작업으로 구조화된 워크플로로 간주하여 안내 지침으로 주입합니다. 실시간 스크린샷이 항상 기준이 되므로, 앱 레이아웃, 콘텐츠 또는 상태가 시연 당시와 다르면 모델은 이전 좌표를 재생하는 대신 재계획을 수립합니다. 이것이 셀프 데모 하위 집합에서 엄격 성공률이 17.2에서 35.4로 향상되었다는 주장의 배경 메커니즘입니다. 그리고 이는 누군가 재현할 때까지 여전히 공급업체의 주장에 불과합니다.

UI-Mate-27B가 오픈 가중치 GUI 에이전트 분야에서 정말 최첨단인가요?

그것은 전적으로 평가 설정에 달려 있습니다. WindowsAgentArena 66.2는 2026년 초에 공개적으로 보고된 최고의 WAA 결과를 능가하겠지만, OSWorld-Verified 77.0은 공개 리더보드에서 82.6을 기록한 오픈 웨이트 모델 Holo3-35B-A3B보다 낮습니다. 논문은 이를 새로운 오픈 웨이트 최고 수준이라고 부르지만, 일관된 하네스에서의 독립적 재실행만이 이를 확인할 수 있는 유일한 방법입니다.

오늘 UI-Mate-27B를 실행할 수 있나요?

네, 직접 서빙한다면 가능합니다: Hugging Face에서 가중치를 다운로드하세요 — 27B 일반 체크포인트, 9B, 또는 데모 기반 UI-Mate-democua-27B — 모델 카드의 vLLM 명령을 실행하고(텐서 병렬 크기 2, 프롬프트당 이미지 6개), Python 에이전트나 macOS 앱으로 구동하세요. 호스팅된 API는 없으며, 어떤 체크포인트도 아직 OrcaRouter에 없습니다. 이렇게 새롭고 검증되지 않은 모델의 경우, 당분간 격리된 환경에 보관하는 것이 합리적인 이유입니다.

UI-Mate-27B에 대한 올바른 해석은 '승자'가 아니라 '지켜볼 가치가 있음'이다. WAA 선두를 차지했다고 주장하며 원샷 데모 워크플로우를 내놓은 27B 오픈 모델은, 오픈 가중치 컴퓨터 사용 에이전트가 농담거리에서 프런티어에 근접한 수준으로 발전한 한 해에서 의미 있는 데이터 포인트다. 데모 기반 체크포인트가 프로젝트 페이지의 자리표시자가 아닌 공개 가중치로 제공됨에 따라, '한 번 보여주기' 워크플로우는 실제로 실행할 수 있는 것이 되었다. 텐센트는 이전에도 출시에 신중했으며, 이번 것은 공개된 진행 중 작업의 형태를 띠고 있다. 샌드박스에서 실행하고, 벤치마크를 다시 돌리며, 발표 소식을 계속 주시하라. 이 이야기의 흥미로운 부분은 아직 앞에 있다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube