
InternLumina-U2 vs Tencent UI-Mate-27B: 지금 실행할 수 있는 데스크톱 에이전트 vs 읽기만 할 수 있는 통합 비전 모델
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
Tencent UI-Mate-27B와 InternLumina-U2는 중국 연구소들이 내놓은 두 개의 조용한 Apache-2.0 공개 모델로, 2주 간격으로 발표되었으며 서로 경쟁 관계가 아닙니다. 바로 그렇기에 비교할 가치가 있습니다. 2026년 8월 14일에 오픈 가중치로 공개된 Tencent UI-Mate-27B는 데스크톱 에이전트입니다. 화면을 주시하고 마우스와 키보드 동작을 출력합니다. 2026년 9월 1일 상하이 인공지능 연구소가 추론 코드 형태로 공개한 InternLumina-U2는 통합 비전 모델을 지향합니다. 이미지, 비디오, 3D를 읽고 이미지를 생성·편집할 수 있다고 주장합니다. 하나는 보는 것에 대해 행동하고, 다른 하나는 가중치가 마침내 공개되면 보는 것에 대해 말하고 그릴 것입니다. 데스크톱을 조작하는 일이 여러분의 업무라면, 오늘날 이 두 가지 중 하나만이 그 일을 해낼 수 있습니다. 그리고 그것은 더 화려한 아키텍처를 가진 쪽이 아닙니다.
행동하는 에이전트: Tencent UI-Mate-27B
{{1}}UI-Mate-27B는 Tencent의 HY Frontier 멀티모달 에이전트 팀이 Qwen3.6-27B를 파인튜닝하여 만든 270억 파라미터 규모의 오픈 가중치(open-weight) 파운데이션 GUI 에이전트입니다.{{/1}} {{2}}실시간 스크린샷을 관찰하고 현재 화면 상태를 추론한 다음, 정규화된 좌표 공간에서 구조화된 키보드·마우스 동작을 출력합니다.{{/2}} {{3}}— 데스크톱에 관해 대화하도록 훈련된 모델이 아니라 실제 데스크톱을 조작하도록 훈련된 모델의 산출물입니다.{{/3}} {{4}}이 모델의 차별점은 데모 기반 실행(demonstration-guided execution)입니다. 워크플로를 한 번만 보여 주면 녹화된 데모를 당면한 작업에 맞게 조정하며, 인터페이스가 녹화 당시와 다를 경우 실시간 스크린샷을 가장 신뢰할 수 있는 기준으로 삼습니다.{{/4}} {{5}}Tencent가 발표한 대표 점수는 OSWorld-Verified 77.0과 WindowsAgentArena 66.2로, 독립적으로 재현된다면 2026년 해당 리더보드에서 정상을 차지할 수치이며, 다양한 OSWorkerBench 수치도 함께 공개됐습니다.{{/5}} {{6}}가중치는 실제로 제공되며 다운로드할 수 있습니다. Hugging Face에 safetensors 샤드 12개가 있고, GPU 두어 대로 vLLM 또는 SGLang을 통해 자체 호스팅할 수 있습니다. 모델 카드에는 중요한 주의사항이 담겨 있는데, 이 모델은 독립형 비주얼 채팅 모델이 아니라 에이전트 체크포인트라는 점입니다.{{/6}} {{7}}— '이 이미지를 설명해 줘'라고 지시한다면 잘못 사용하는 것입니다.{{/7}}
약속된 눈: InternLumina-U2
{{1}}InternLumina-U2는 전혀 다른 종류의 존재다.{{/1}} {{2}}16B 파라미터의 희소 혼합 전문가(sparse mixture-of-experts) 확산 모델(1B 활성)이다.{{/2}} 연구소는 이 모델을 옴니 시각 이해, 이미지 생성, 이미지 편집을 위한 단일 모델로 구상했다. 완전히 이산적인 8-코드북 설계로, 하나의 백본이 이미지, 차트, 비디오 또는 3D 자산을 읽는 동시에 새 픽셀을 쓴다. {{3}}만약 머릿속에 그리는 모델이 GUI 에이전트라면, InternLumina-U2는 정반대편에 있다. 아무것도 클릭하려 하지 않고, 모든 것을 이해하여 요청에 따라 그린다.{{/3}} {{4}}2026년 9월 1일 현재 공개된 형태는 추론 코드와 아키텍처, 즉 GitHub 저장소의 여섯 개의 태스크 진입점, 예비 벤치마크 표가 있는 프로젝트 페이지, 빈 Hugging Face 스텁이다.{{/4}} 그리고 {{5}}가중치, 학습 코드, 기술 보고서는 모두 여전히 '곧 공개 예정'으로 표시되어 있다.{{/5}} {{6}}아무도 이 모델을 실행할 수 없다.{{/6}} 두 모델의 차이는 품질이 아니라 존재 여부다.
점수판
UI-Mate-27B의 수치는 Tencent가 보고한 것으로 재현 검증이 되지 않았고, InternLumina-U2의 수치는 실험실 보고 기반의 예비적·부분적 결과입니다. 모든 행에는 출처가 명시되어 있습니다.
• 직무 — Tencent UI-Mate-27B: 데스크톱 조작 — 실시간 스크린샷 판독, 마우스 및 키보드 동작 출력. InternLumina-U2: 인지 및 생성 — 이미지/비디오/3D 이해, 이미지 생성 및 편집.
• 가중치 — Tencent UI-Mate-27B: 2026년 8월 14일부터 공개, safetensors 샤드 12개, Apache-2.0. InternLumina-U2: 비공개 — 빈 Hugging Face 저장소, 가중치는 "곧 공개 예정".
• 규모 — Qwen3.6-27B에서 파인튜닝한 27B Dense 모델 vs 총 16B / 활성 1B 스파스 MoE 확산 모델
• 출력 — Tencent UI-Mate-27B: 정규화된 좌표 공간에서 pyautogui 호환 구조화된 동작. InternLumina-U2: 텍스트, 최대 1024×1024 텍스트-이미지 생성, 및 지시 기반 이미지 편집을 지원합니다.
• {{1}}주요 수치{{/1}} — {{2}}Tencent UI-Mate-27B{{/2}}: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 데모로 인한 성능 향상(모두 Tencent 보고 기준). {{3}}InternLumina-U2{{/3}}: ChartQA 86.52, GenEval 0.81, MathVision 33.22(연구소 보고, 잠정 수치).
• 출처 관련 주의 — Tencent UI-Mate-27B: 해당 카드 자체에서 에이전트 체크포인트일 뿐, 독립형 비주얼-챗 모델이 아님을 경고하고 있습니다. InternLumina-U2: 프로젝트 페이지에서 자체 결과물을 "예비적이며 부분적"이라고 표시하고 있습니다.
• 서빙 현실 — Tencent UI-Mate-27B: vLLM 또는 SGLang을 통해 약 2개의 GPU에서 자체 호스팅 가능; 현재 이를 배포하는 호스팅 추론 제공업체는 없음. InternLumina-U2: 누구도 서빙할 수 없음 — 공개된 드라이버는 저장소에 없는 체크포인트를 기대함.

검증되지 않은 것의 두 가지 다른 종류
두 모델 모두 미검증 상태이며, 그 단어는 두 번 쓰일 때 같은 뜻이 아니다. Tencent UI-Mate-27B는 새 모델이라는 통상적인 의미에서 미검증 상태다. 내세우는 점수는 벤더가 스스로 제시한 것이고, 누구도 독립적으로 재실행하지 않았으며, 다운로드 수는 그 주장에 비해 턱없이 적다. 이는 언뜻 보면 출시된 지 나흘 된 체크포인트처럼 보였으나 이후 작은 커뮤니티가 형성된 모델의 전형적인 양상이다. 다만 이쪽의 미검증 상태는 검증이 가능한 종류다. 가중치가 존재하기 때문에 66.2와 77.0은 GPU 두 대와 Windows 테스트 환경을 갖춘 사람이라면 누구나 이번 주 안에 확인할 수 있고, 데모 시연으로 제시된 주장들은 실제 워크플로우에서 재현되거나 반증될 수 있다. InternLumina-U2는 더 엄격한 의미에서 미검증 상태다. 즉, 테스트가 불가능하다. 아키텍처는 공개되어 읽을 수 있지만 수치는 그렇지 않다. 그 수치를 확인해 줄 아티팩트가 없으며, 연구소 자체가 일부만 공개한 표에는 이미 최소한 하나의 생성 벤치마크에서 이름이 명시된 경쟁사에 뒤처지는 것으로 나타난다. 다운로드 가능한 파일에 붙어 있는 벤더의 수치는 심판을 기다리는 주장이다. 로드맵에 붙어 있는 벤더의 수치는 희망이다.

2026년 8월 27일에 캡처된 tencent/UI-Mate-27B Hugging Face 카드 — Qwen3.6-27B 기반 모델, 공급업체가 보고한 OSWorld 및 WindowsAgentArena 점수, 그리고 현재 어떤 추론 제공업체도 이를 배포하지 않는다는 메모.
자연스러운 분업: 배우와 그의 눈
나란히 놓고 보면, 이 두 모델은 신뢰할 수 있는 자동화 파이프라인의 형태를 그려 낸다. GUI 에이전트의 진짜 어려운 문제는 평균적인 경우가 아니다. 문제는 예상치 못한 화면 상태에서 에이전트가 조용히 잘못된 행동을 하고 아무도 그것을 알아차리지 못하는 것이다. 바로 그런 일을 위해 저렴하고 신뢰할 수 있는 비전 모델이 존재한다. 모든 행동 전후에 화면 상태를 검증하고, 나타난 대화상자가 에이전트가 나타났다고 생각하는 바로 그 대화상자인지 확인하며, 현실과 에이전트의 현실 모델이 어긋날 때 루프를 중단하는 것이다. Tencent UI-Mate-27B는 행위자이고, InternLumina-U2가 표방하는 종류의 통합 비전 모델은 자연스러운 검증자로서 에이전트가 행동을 취하는 바로 그 스크린샷을 읽을 수 있다. InternLumina-U2의 가중치가 실제로 공개되고 그 이해력 주장이 독립적인 테스트를 통과할 때, 그리고 오직 그때에만, 이 모델은 에이전트에 대항하는 대신 에이전트 곁에서 그 역할을 채울 수 있다. 둘은 하나의 직무를 두고 경쟁하는 관계가 아니다. 그들은 하나의 직무를 이루는 두 절반이다.

InternLM/InternLumina-U2 GitHub 저장소(2026년 9월 2일 캡처) — 저장소 랜딩 페이지에는 작업별 추론 스크립트가 표시되며, 여기에는 화면 상태 검증기를 구축하는 기반이 되는 이미지 이해 진입점이 포함됩니다. 해당 저장소를 실행 가능하게 만드는 가중치는 트리에 포함되어 있지 않습니다.
에이전트+시각 스택에서 라우팅 계층이 수행하는 역할
두 모델 모두 OrcaRouter에서 호스팅되지 않으며, 저희는 그 반대를 암시하지 않습니다. Tencent UI-Mate-27B는 그 어디에도 호스팅 제공처가 없고, InternLumina-U2는 어떤 제공처도 호스팅할 수 있는 가중치가 없습니다. 여기에 적용되는 라우팅 패턴은 정확히 이 아키텍처를 위한 것입니다. 즉, 행동하는 에이전트와 검증하는 비전 모델로 구성되어, 비용이 많이 들거나 위험한 단계가 저렴하고 신뢰할 수 있는 단계를 통과해야만 실행되도록 게이트됩니다. 라우팅 DSL은 이를 두 모델 제공처 사이의 맞춤형 접착 코드 대신 단일 논리 호출(행동 → 검증 → 진행 또는 중단)로 표현하며, 자동 페일오버는 현실적인 실패 모드를 처리합니다. UI-Mate-27B와 같은 GUI 에이전트는 정확히 테스트 경로에서 먼저 검증받아야 할 미검증 체크포인트이며, 새 모델이 오작동하는 순간 호출은 검증된 모델로 페일오버됩니다. 200개 이상의 호스팅 모델을 아우르는 단일 API, 공급업체 정가를 0% 마크업으로 전달하며, 신뢰를 쌓는 동안 스택에서 검증되지 않은 부분은 안전장치 뒤에 보호됩니다.
요점
데스크톱을 조작하는 무언가를 만들고 있다면, Tencent UI-Mate-27B는 이 둘 중 유일하게 실용적인 의미에서 존재하는 모델입니다. 지금 당신의 GPU에서 직접 실행할 수 있고, 인상적이지만 아직 재현되지 않은 점수를 실제로 테스트해볼 수 있습니다. 모델이 보이는 것을 이해하고 그에 대해 그릴 수 있는 무언가를 만들고 있다면, InternLumina-U2는 가중치를 기다리는 유망한 아키텍처입니다. 지금 읽을 가치가 있지만, safetensors가 나타날 때까지는 의존성으로서 아무 가치가 없습니다. 두 모델을 주목하세요. 분업이 가능해지는 날이 오면, 데스크톱에서 행동하는 에이전트, 그 행동을 지켜보는 검증된 눈, 그리고 그들이 정직하게 행동하도록 만드는 라우팅 계층이 함께 작동하게 될 것입니다.
