
PixelUMM vs UI-Mate-27B: 한 모델은 보는 것을 그려내고, 다른 모델은 그것을 클릭한다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Tencent UI-Mate-27B와 NVIDIA PixelUMM은 스펙 시트에서는 비슷해 보입니다 — 270억 개 파라미터 대 약 152억 개, 둘 다 공개 다운로드, 둘 다 Qwen 백본 기반 — 하지만 전혀 비슷하지 않습니다. UI-Mate-27B는 파운데이션 GUI 에이전트입니다. 실시간 스크린샷을 관찰하고, 현재 화면에 있는 내용을 바탕으로 계획을 세우며, 실제 데스크톱을 향해 구조화된 마우스 및 키보드 동작을 내보냅니다. PixelUMM은 이미지와 영상을 원시 픽셀 공간에서 읽고 텍스트로부터 이미지와 영상을 생성하는 인코더 없는 통합 멀티모달 모델입니다 — 지각하고 창조하지만, 행동 공간도, 커서도, 화면을 건드릴 방법도 없습니다. 하나는 세상에 작용합니다. 다른 하나는 세상을 묘사하고 그려냅니다. 아래의 모든 내용은 이 차이에서 비롯되며, 둘 사이의 라이선스 격차가 두 번째로 알아야 할 사항입니다.
두 연구소 모두 자체 수치를 발표했으며, 어느 쪽도 독립적인 평가를 받지 않았다. 둘 다 조용히 공개했다 — 실제로 두者的 유사점이 끝나는 지점은 바로 그 공개 방식이다.
행위자와 지각자
UI-Mate-27B는 자연어 지시와 실시간 스크린샷만으로 작업을 수행합니다. 보이는 상태를 추론하고, 인터페이스가 바뀌면 다시 계획하며, 마우스, 키보드, 스크롤, 대기, 사용자 상호작용, 작업 완료 전반에 걸쳐 추론, 간결한 동작 설명, 구조화된 컴퓨터 사용 도구 호출을 출력합니다. 이 모델의 두드러진 특징은 시연 기반 실행입니다. 워크플로를 한 번만 보여주면 현재 작업에 맞게 기록된 시연을 적응시키며, 인터페이스가 바뀐 경우 현재 스크린샷을 최우선 기준으로 삼습니다. Qwen3.6-27B를 기반으로 실행 가능한 GUI 환경에서 지도 미세 조정 후 온라인 강화 학습을 거쳐 파인튜닝되었으며, OpenAI 호환 인터페이스를 갖춘 vLLM을 통해 서빙됩니다.
• 보고된 벤치마크 — OSWorld-Verified 평균 77.0, WindowsAgentArena 평균 66.2, OSWorkerBench 엄격 성공률 41.00 및 진행률 76.86. 모두 Tencent가 보고한 수치이며 재현되지 않았습니다.
• 행동 공간 — 마우스, 키보드, 스크롤, 대기, 사용자 상호작용, 작업 완료를 pyautogui 호환 구조화된 호출과 함께 정규화된 좌표 공간에서 처리합니다.
• 하드웨어 현실 — 27B dense 모델로, 텐센트 자체 퀵스타트에서 두 개의 GPU에 걸쳐 텐서 병렬 처리로 서비스되며, Apache-2.0 라이선스입니다.
• 카드 자체에 관한 중요한 주의사항 — UI-Mate-27B는 독립형 시각 채팅 모델이 아니라 에이전트 체크포인트입니다. Tencent는 자사 리포지토리의 공식 프롬프트, 응답 파서, 상호작용 하네스를 사용할 것을 권장합니다. 여기에 "이 이미지를 설명해줘"라고 입력한다면 잘못된 도구를 쓰는 셈입니다.
PixelUMM은 반대 극에 자리한다. 그 전체 아키텍처는 표현에 관한 하나의 주장이다. VAE도, 비전 인코더도 없으며, 이미지는 16×16 픽셀 패치로, 비디오는 4프레임 시공간 튜블릿으로, 단일 계층 선형 투영을 통해 디코더 전용 트랜스포머에 곧바로 들어가고, Mixture-of-Transformers 설계가 공유 어텐션과 작업별 파라미터를 짝지운다. 이해는 자기회귀 텍스트이고, 생성은 픽셀 공간 플로 매칭이다. 네 개의 체크포인트가 제공되며, S8-F22-R05가 기본값으로 텍스트-이미지, 96프레임 및 24fps의 텍스트-비디오, 그리고 양방향 이해를 포괄한다.

두 릴리스 패턴은 극명한 대조를 이룬다
UI-Mate-27B는 2026년 8월 14일 모델 카드, 2608.15930이라는 번호가 붙은 arXiv 프리프린트, 프로젝트 페이지, GitHub 리포지토리, 문서화된 서빙 레시피와 함께 Hugging Face에 등장했다. 그때부터 10월 초까지 약 780회 다운로드와 93개의 좋아요를 얻었다 — 소박하지만, 서류가 제대로 갖춰진 평범한 연구 에이전트 릴리스였다.
PixelUMM의 흔적은 성격이 다르다. GitHub 저장소는 2026년 9월 4일에 생성되었고, arXiv 프리프린트는 9월 29일자이며, Hugging Face 저장소는 2026년 10월 1일 21:40 UTC에, 해당 저장소의 마지막 커밋이 이루어진 지 몇 분 후에 생성되었다. 이와 관련해 NVIDIA의 블로그 게시물이나 보도자료, 출시 스레드는 나타나지 않았다. 프로젝트 페이지 자체의 URL 경로는 여전히 pixelumm-project-page-preview라고 표시된다. 이 글을 작성할 당시 다운로드 수는 0이었다.
거기서 의도를 읽어내는 것은 실수다 — 연구소는 연구 결과물을 먼저 공개해 두고 출시는 나중으로 잡을 수도 있다. 알 수 있는 것은 그보다 좁고 더 유용하다. 한 모델은 공식 서빙 경로와 10주간의 다운로드 기록을 갖고 있고, 다른 모델은 논문과 저장소는 있지만 벤더의 언급이 전혀 없다.

겹치지 않는 스코어보드
두 모델이 공통으로 보고하는 벤치마크는 없는데, 그 자체가 핵심이다: 두 모델은 같은 문제를 풀고 있는 게 아니다.
• 에이전트 기반 컴퓨터 사용 — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: 액션 공간이 없으므로 점수를 산출할 수 없습니다.
• 이미지 이해 — UI-Mate-27B: 스크린샷을 에이전트 입력으로 사용하며, 범용 VLM으로는 평가되지 않습니다. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.
• 비디오 — UI-Mate-27B: 없음. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.
• 생성 — UI-Mate-27B: 없음. PixelUMM: GenEval 0.83(프롬프트 리라이터 사용 시), DPG-Bench 85.74, VBench Part 1 품질 84.10.
• 배포 비용 — UI-Mate-27B: vLLM을 통해 대략 두 개의 GPU에 걸쳐 27B dense, 그리고 공식 하네스. PixelUMM: 약 30GB의 분산 체크포인트 샤드, 소스에서 빌드한 FlashAttention과 함께 CUDA 13, 비디오 경로용 게이트된 가드레일 모델 및 이를 위한 별도의 두 번째 Python 환경.
• 라이선스 — UI-Mate-27B: Apache-2.0, 코드 및 가중치. PixelUMM: Apache-2.0 코드, 체크포인트에는 NVIDIA One-Way Noncommercial License 적용.
• 규모 — 27B dense 대 약 15.2B 총계, PixelUMM 자체 논문 표에서는 "8B MoT"로 표기됨.
진정으로 비교 가능한 유일한 진술은 출처에 관한 것이며, 이는 두 모델 모두에 적용된다: 위의 모든 수치는 벤더가 자체적으로 낸 것이고, 이를 산출한 실험실 밖에서 다시 실행된 수치는 하나도 없으며, 두 모델 중 하나는 자신의 결과를 명시적으로 잠정적이라고 표시한다.
그것들로 구축하기, 그리고 두 가지를 모두 사용할 수 있는 이유
이 둘은 경쟁하기보다 조합될 때 더 낫다. 데스크톱 자동화 스택은 행동 계층을 위해 UI-Mate-27B를, 그리고 자신이 본 것을 추론할 수 있는 무언가를 원한다. 콘텐츠 또는 검사 파이프라인은 PixelUMM의 읽기와 생성 기능을 원하며 커서는 전혀 필요로 하지 않는다. 겹치는 지점은 인식 경계인데, 여기서 UI-Mate-27B의 스크린샷 그라운딩은 작업 특화적이고 PixelUMM의 것은 범용적이다 — 동일한 픽셀, 완전히 다른 두 가지 작업.
실제로 여러 모델을 서로 비교해 볼 때 — 에이전트를 범용 VLM과 비교하거나, 새 연구 체크포인트를 이미 프로덕션에 있는 것과 비교할 때 — 그 비교 비용은 대개 추론이 아니라 통합에서 발생합니다. API 형태 두 가지, 인증 방식 두 가지, 계약 두 가지니까요. 이것이 바로 라우팅 계층이 제거하기 위해 존재하는 문제이며, OrcaRouter의 설계가 빛을 발하는 지점입니다. 200개 이상의 모델에 하나의 키, 제공업체 정가를 0% 마크업으로 그대로 전달, 제공업체 간 자동 페일오버, 그리고 여러 모델을 단일 호출로 구성하기 위한 라우팅 DSL과 모델 퓨전까지. PixelUMM도 UI-Mate-27B도 현재 어떤 호스팅 엔드포인트에도 없고, OrcaRouter는 둘 다 라우팅하지 않습니다 — 따라서 이것은 그것들이 등록된 이후의 워크플로에 관한 이야기이지, 현재의 가용성에 대한 주장이 아닙니다.
어느 것이 어떤 작업에 쓰이는가
작업이 클릭, 키 입력 또는 양식 작성으로 끝난다면, 여기에는 후보가 하나뿐이며 그것은 UI-Mate-27B입니다. Apache-2.0이고, arXiv 논문과 공식 하네스가 있으며, 보고된 OSWorld 및 WindowsAgentArena 점수는 GPU 두 개와 Windows 또는 Ubuntu 테스트 이미지만 있으면 누구나 확인할 수 있는 종류의 주장입니다 — 바로 그 점이 그것을 믿기보다 확인할 가치가 있게 만듭니다.
작업이 답변이나 이미지로 끝난다면, PixelUMM이 그것을 할 수 있는 모델이며, 무엇보다 연구용 산출물입니다. 이 논문은 자신의 한계를 이례적으로 솔직하게 인정하며, 학습 데이터가 다르기 때문에 벤치마크 비교가 "어느 아키텍처가 더 우수한지 입증할 수 없다"는 점을 인정합니다. 체크포인트는 비상업적입니다. 강점은 최첨단 수치가 아니라 아키텍처의 참신성과 폭넓음이며, 당장의 가치는 인코더 없는 통합 모델이 비디오 규모에서 작동하는지 연구하는 모든 사람에게 있습니다. 코드를 읽고 데모를 실행하려면 다운로드하세요; 기능을 출시하려고 다운로드하지는 마세요.
두 줄 요약은 증거가 제시하는 것과 같다: 한 모델은 행동할 수 있지만 창조할 수 없고, 다른 모델은 창조할 수 있지만 행동할 수 없으며, 둘 사이의 라이선싱과 성숙도 격차는 어떤 파라미터 수보다 더 중요하다.
