
Tencent UI-Mate-27B: El agente GUI de peso abierto que reclama silenciosamente un lugar en lo más alto de WindowsAgentArena
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 366 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El 14 de agosto de 2026, el equipo de agentes multimodales HY Frontier de Tencent subió tres checkpoints a Hugging Face bajo la organización tencent/ — UI-Mate-27B, un UI-Mate-9B más pequeño, y el UI-Mate-democua-27B guiado por demostraciones. Cuatro días después aún no hay ningún anuncio en ninguna parte: ni publicación de lanzamiento, ni comunicado de prensa, ni tweet del producto. Lo que se lanzó en su lugar es inusualmente completo para una publicación silenciosa: una página de proyecto, un repositorio de GitHub con un harness funcional, y un artículo de arXiv enviado hace dos días que califica al modelo más grande como un nuevo estado del arte de pesos abiertos en el control de GUI de escritorio.
Todo en este artículo proviene de las fichas de los modelos, el repositorio de GitHub, la página del proyecto y ese artículo — nada de ello ha sido reproducido de forma independiente todavía. Los checkpoints tienen cero descargas en Hugging Face al momento de escribir esto, lo que significa que probablemente seamos de los primeros fuera de Tencent en tomarlos en serio sobre el papel. Esto es lo que realmente se puede saber a partir de los repositorios, y lo que sigue sin confirmarse hasta que otra persona lo ejecute.
Contenido
• Lo que se envió, y lo que no se ha anunciado
• Lo que UI-Mate-27B realmente es
La característica que marca la diferencia: ejecución guiada por demostración.
• Los números — todos ellos reportados por el proveedor
• Dónde se ubicarían esos números — si se mantienen
• Cómo ejecutarlo
• El stack alrededor de un nuevo agente GUI
• Qué ver a continuación
• Preguntas frecuentes
Qué se ha lanzado, y qué no se ha anunciado
Tencent publicó UI-Mate-27B (27 mil millones de parámetros, Apache-2.0, safetensors en BF16) el 14 de agosto de 2026, junto con su versión hermana de 9B y el checkpoint guiado por demostraciones UI-Mate-democua-27B. Los dos checkpoints de 27B están construidos sobre Qwen3.6-27B — un modelo multimodal con licencia Apache-2.0 lanzado en abril de 2026 — lo que significa que toda la pila, tanto la base como el fine-tuning, es comercialmente utilizable. Los repositorios tienen marcas de tiempo de última modificación de esta semana — el checkpoint guiado por demostraciones fue modificado incluso hoy — así que Tencent ha estado trabajando activamente en ellos.

Qué es público hasta ahora:
• Los pesos de UI-Mate-27B, UI-Mate-9B y UI-Mate-democua-27B en Hugging Face, cada uno con una tarjeta de modelo, tablas de evaluación y una receta de servicio.
• Una página del proyecto en ui-mate.github.io con un video de demostración, una guía de uso y una aplicación de macOS Apple Silicon (DMG v0.2.4).
• El repositorio de GitHub (github.com/Tencent/UI-Mate) que contiene el prompt oficial, el analizador de respuestas y el entorno de interacción — la tarjeta indica explícitamente que esto es "un checkpoint de agente más que un modelo de chat visual independiente" y se recomienda el entorno para cualquier uso real.
• Un preprint de arXiv (2608.15930), presentado el 16 de agosto, titulado "UI-Mate: Avanzando en Agentes GUI Fundacionales de Peso Abierto con Demostraciones en Contexto."
Lo que aún no es público: la propia Tencent no ha dicho nada — esto es un lanzamiento primero en el repositorio, no un lanzamiento oficial. La variante guiada por demostración que la página del proyecto había listado como aún no pública ahora tiene pesos disponibles en Hugging Face: el repositorio tencent/UI-Mate-democua-27B, creado en el mismo push del 14 de agosto, está explícitamente etiquetado como el checkpoint guiado por demostración de la familia — un modelo distinto, no un cambio de marca del 27B. Todavía no hay API alojada en ningún lugar. Eso importa: la única forma de ejecutar UI-Mate hoy es descargar los pesos y servirlos tú mismo.
Lo que UI-Mate-27B realmente es
UI-Mate-27B es un agente GUI fundacional para «trabajo de horizonte largo a través de aplicaciones y sistemas operativos». Observa capturas de pantalla en vivo, razona sobre el estado visible y emite acciones estructuradas de teclado y ratón para la interacción nativa con el escritorio. El entrenamiento consiste en un ajuste fino supervisado seguido de aprendizaje por refuerzo en línea en entornos GUI ejecutables: el modelo aprendió conduciendo realmente escritorios, no solo a partir de capturas de pantalla estáticas.
El espacio de acciones es la parte que los desarrolladores tendrán en cuenta: mouse, teclado, desplazamiento, espera, interacción del usuario y finalización de tareas, con salidas compatibles con pyautogui. El modelo razona en un espacio de coordenadas normalizado de 1000×1000 y el agente de referencia reescala sus predicciones de vuelta a la resolución real de la captura de pantalla, por lo que las acciones sobreviven a las diferencias de escala de visualización entre máquinas. El README del propio modelo recomienda servirlo con vLLM detrás de un endpoint compatible con OpenAI.
La característica distintiva: ejecución guiada por demostración
La mayoría de los agentes GUI aceptan una sola entrada: una instrucción. UI-Mate acepta una segunda que es realmente rara en un checkpoint abierto: una demostración. "Muestra el flujo de trabajo una vez. Deja que el agente lo adapte a la tarea en cuestión", como dice la página del proyecto.
El mecanismo no es vídeo en contexto ni un guion de acción fija. Una demostración registra capturas de pantalla inmediatamente antes y después de cada acción de teclado o puntero, y la canalización luego normaliza el rastro en una representación coherente de acción y fotograma, lo anota con observaciones, intención, acciones y evidencia de verificación, y lo segmenta en subtareas con nombre y criterios de finalización. En el momento de la inferencia, eso se convierte en un flujo de trabajo compacto inyectado para la subtarea activa, pero la captura de pantalla en vivo sigue siendo la fuente autoritativa durante todo el proceso, de modo que cuando el estado de la aplicación difiere de la demostración, el modelo replanifica en lugar de reproducir.
Tencent ha convertido el punto de control detrás de este flujo de trabajo en su propio modelo público: la ficha de UI-Mate-democua-27B empareja los resultados de solo instrucción y de una demostración en las mismas evaluaciones, y su esquema de herramientas añade una acción subtask_complete: el mecanismo detrás de esas subtareas nombradas. En el subconjunto self-demo de OSWorkerBench, una demostración eleva el éxito estricto del 17.17 al 35.35 y el progreso del 67.85 al 81.14; en el subconjunto de OSWorld, el progreso pasa del 40.27 al 65.75; en el conjunto de evaluación GameDev, la puntuación media pasa de 76.76 a 81.15 mientras que la longitud media de la trayectoria baja de 303.6 a 253.1 pasos: la demostración acorta la tarea además de mejorarla. La ficha informa de que la demostración mejoró 28 de las 33 tareas self-demo y resolvió cuatro tareas que obtienen cero sin guía. La advertencia es la misma que recorre todo este artículo: son evaluaciones emparejadas propias del equipo, promediadas entre tres y cinco ejecuciones, y nadie las ha reproducido.
Los números — todos ellos reportados por el proveedor
Ejecución exclusiva por instrucciones, directamente desde la tarjeta del modelo:
• Puntuación media de OSWorld-Verified — 77.0
• Puntuación promedio de WindowsAgentArena — 66.2
• OSWorkerBench éxito estricto — 41.00
• Progreso de OSWorkerBench — 76.86

OSWorkerBench es en sí mismo una de las tres contribuciones del artículo: un nuevo benchmark de 100 tareas de oficina de horizonte largo en 41 aplicaciones, con 33 subconjuntos de autodemostración y 45 de demostración variante. Es una evaluación nueva, por lo que no hay trabajos previos con los que comparar esas dos puntuaciones. Frente a su propio modelo base, se afirma que UI-Mate-27B supera a Qwen3.6-27B por 17,7 puntos de éxito estricto y 24,5 puntos de progreso en OSWorkerBench, que es la cifra más comparable de todo el lanzamiento, ya que ambos modelos se ejecutarían con el mismo sistema de evaluación.
Cada cifra anterior es la evaluación del propio equipo. Aún no hay puntuaciones independientes, ni reejecuciones de terceros, y con cero descargas, tampoco reproducciones de la comunidad. Trata cada número aquí como una afirmación, no como un hecho.
Dónde se ubicarían esos números — si se mantienen
WindowsAgentArena es el que sería un titular genuino. Los mejores resultados públicos de WAA reportados a principios de 2026 se agruparon alrededor de 61.0 (un sistema modular llamado VLAA-GUI, abril de 2026); el EvoCUA-32B de pesos abiertos de Meituan se situó en 56.5, y el UI-TARS-2 cerrado de ByteDance estaba en los 50 bajos a medios en la misma tabla. Un 66.2 en la evaluación propia de UI-Mate-27B lo pondría por encima de todo lo que se había reportado en este benchmark este año — abierto o cerrado. Esa es una afirmación fuerte, y necesita una repetición independiente.
OSWorld-Verified con 77.0 es un resultado sólido, pero no constituye un nuevo récord de pesos abiertos en la tabla pública. En la instantánea del ranking de OSWorld-Verified de principios de agosto de 2026, el modelo de pesos abiertos Holo3-35B-A3B aparece con 82.6, con varios modelos cerrados de frontera por encima (Qwen3.8 Max con 86.1, Claude Mythos 5 y Claude Fable 5 con 85.0, Claude Opus 4.8 con 83.4). Por lo tanto, la palabra «state of the art» del artículo es una afirmación sobre su propio entorno de evaluación, no un hecho establecido — los distintos harnesses, los analizadores de acciones y la deriva en los autoinformes hacen que el 77.0 frente al 82.6 sea una cuestión que solo una reevaluación independiente puede resolver. Para contextualizar lo que significa un modelo abierto de 27B que logra 77.0: se situaría por encima de la línea base de experto humano de ~72.4 y por encima de varios sistemas de frontera más grandes en esa misma tabla, incluidos Claude Opus 4.6 con 72.7 y Kimi K2.6 con 73.1.
Tencent no es nuevo en este terreno — en febrero de 2026 lanzó POINTS-GUI-G, un modelo de anclaje de GUI de 8B, en mayo presentó el asistente Marvis OS, y en junio contribuyó al proyecto de uso informático GUICrafter. UI-Mate es una línea distinta orientada específicamente al control total del escritorio, y es el primer agente de GUI de Tencent que se publica como modelo fundacional abierto, en lugar de un componente de anclaje o un producto.
Cómo ejecutarlo
El modelo está diseñado para vLLM, y la ficha del modelo da el comando exacto: vllm serve tencent/UI-Mate-27B con tensor-parallel de tamaño 2 y la plantilla de chat compatible con OpenAI. Un detalle práctico destaca: el agente conserva cinco capturas de pantalla en el contexto por defecto, por lo que el servidor debe admitir al menos seis imágenes por solicitud, ya que la captura más nueva llega antes de que se elimine la más antigua. La opción recomendada es --limit-mm-per-prompt con seis imágenes y cero vídeos. El punto de control guiado por demostraciones se sirve de la misma manera: su ficha menciona vLLM y SGLang detrás de un endpoint compatible con OpenAI.

Una vez servido, una clase de agente de Python (UIMateAgent) toma una captura de pantalla y una instrucción, y devuelve la respuesta junto con acciones estructuradas, reescalando las coordenadas de 1000×1000 de vuelta a tu resolución. La página del proyecto también ofrece una app para macOS Apple Silicon para el modo guiado por demostración, que es la forma más fácil de probar el flujo de trabajo "show it once" sin tener que construir el andamiaje tú mismo. La licencia es Apache-2.0 en todo, por lo que se permiten el uso local, el ajuste fino y la integración comercial.
Dos advertencias deben acompañar a cualquier instrucción de "cómo ejecutarlo" para un agente de uso de computadora, y ambas provienen de la propia ficha del modelo. Utilice entornos aislados o desechables. Exija confirmación humana antes de cualquier acción sensible, supervise la trayectoria y no trate un éxito reportado por el modelo como prueba de que el resultado previsto realmente ocurrió. Los agentes de interfaz gráfica pueden hacer clics equivocados, y la inyección de instrucciones a través del contenido en pantalla es un modelo de amenaza real, no una hipótesis.
El stack alrededor de un nuevo agente de GUI
Ninguno de los checkpoints de UI-Mate está en OrcaRouter todavía — la familia tiene apenas días de antigüedad con cero descargas, y su modelo base Qwen3.6-27B tampoco. No hay una API alojada, así que si quieres ejecutar uno esta semana, tendrás que servir vLLM tú mismo. Eso está bien para un laboratorio, pero no es la forma adecuada para producción.
Un pipeline de uso de computadora en producción rara vez es un solo checkpoint. Está compuesto por un modelo planificador que decide la siguiente intención, un modelo de grounding o visión que lee la pantalla, el propio agente GUI y un respaldo económico cuando un subpaso falla — y todas esas piezas son modelos servidos, incluso cuando el agente GUI es local. Esa mezcla es exactamente para lo que sirve una capa de enrutamiento: una API para más de 200 modelos alojados, precio de lista del proveedor transmitido sin margen, y failover automático para que una interrupción transitoria en un proveedor no detenga una ejecución larga del agente. El DSL de enrutamiento también permite componer varios modelos en una sola llamada — un planificador al inicio, un verificador económico al final — sin tener que integrar proveedores en tu propio código. El resumen honesto es simple: el agente que controla el escritorio es local, pero los modelos que deciden qué hacer a su alrededor son enrutables, y probar de forma segura checkpoints completamente nuevos y no probados es exactamente para lo que sirve el failover.
Qué ver a continuación
Cuatro cosas cambiarían el panorama para UI-Mate-27B, en orden aproximado de importancia:
• Una repetición independiente de OSWorld-Verified y WindowsAgentArena. La cifra de WAA en particular es o un gran avance o un artefacto del entorno de pruebas, y solo una evaluación externa determina cuál de los dos.
• El informe técnico formal. La cita actual es un marcador de posición, y el artículo completo presumiblemente revelará los detalles del motor de datos que el resumen solo esboza.
• Anuncio propio de Tencent. Una publicación que prioriza el repositorio como esta suele preceder a algo: una integración con Marvis, una oferta alojada o un impulso más amplio hacia los modelos abiertos.
• Una API alojada. Los pesos de los tres checkpoints ya son públicos, pero no se sirve nada en ningún lugar — ni endpoint de Tencent, ni proveedor de inferencia de terceros — por lo que el autoalojamiento sigue siendo la única ruta, y solo un anuncio de Tencent o la adopción por parte de un proveedor cambiaría eso.
Preguntas frecuentes
¿Qué es Tencent UI-Mate-27B?
UI-Mate-27B es un agente GUI fundacional de 27 mil millones de parámetros con licencia Apache-2.0, creado por el equipo de agentes multimodales HY Frontier de Tencent, y ajustado a partir de Qwen3.6-27B. Observa capturas de pantalla del escritorio en tiempo real, razona sobre ellas y genera acciones de ratón y teclado compatibles con pyautogui. Se lanzó discretamente en Hugging Face el 14 de agosto de 2026, junto con su versión hermana de 9B y el UI-Mate-democua-27B guiado por demostraciones, sin ningún anuncio, y sus puntos de referencia son reportados íntegramente por el proveedor hasta ahora.
¿En qué se diferencia la ejecución guiada por demostración de reproducir un script?
En lugar de ejecutar una macro grabada, UI-Mate trata una demostración como un flujo de trabajo subtitulado y estructurado en subtareas que se inyecta como guía. La captura de pantalla en vivo sigue siendo la fuente autoritativa, por lo que cuando el diseño, el contenido o el estado de la aplicación difieren de lo mostrado, el modelo replanifica en lugar de reproducir coordenadas obsoletas. Ese es el mecanismo detrás del supuesto salto del 17.2 al 35.4 de éxito estricto en el subconjunto de autodemostración, y sigue siendo una afirmación del proveedor hasta que alguien la reproduzca.
¿Es UI-Mate-27B realmente el estado del arte para agentes GUI de peso abierto?
Eso depende por completo de la configuración de evaluación. Su WindowsAgentArena 66.2 superaría los mejores resultados WAA reportados públicamente a principios de 2026, pero su OSWorld-Verified 77.0 se sitúa por debajo del Holo3-35B-A3B de peso abierto, con 82.6 en la tabla pública. El artículo lo califica como un nuevo estado del arte de peso abierto; una repetición independiente en un entorno de pruebas consistente es la única forma de saberlo.
¿Puedo ejecutar UI-Mate-27B hoy?
Sí, si lo sirves tú mismo: descarga los pesos de Hugging Face — el checkpoint general de 27B, el de 9B, o el UI-Mate-democua-27B guiado por demostraciones — ejecuta el comando de vLLM de la tarjeta del modelo (tamaño de paralelismo tensorial 2, seis imágenes por prompt), y manéjalo con el agente de Python o la aplicación de macOS. No hay API alojada, y ninguno de los checkpoints está en OrcaRouter todavía — lo cual, para modelos tan nuevos y tan poco verificados, es una razón razonable para mantenerlos en un entorno aislado por ahora.
La lectura correcta de UI-Mate-27B no es «el ganador», sino «digno de seguir de cerca». Un modelo abierto de 27B que afirma liderar en WAA y que incluye un flujo de trabajo de demostración de una sola vez es un dato significativo en un año en el que los agentes de uso de computadora de peso abierto han pasado de ser una broma a estar al alcance de la frontera. Ahora que el checkpoint guiado por demostración ya son pesos públicos en lugar de un marcador de posición en la página del proyecto, el flujo de trabajo de «muéstralo una vez» es algo que realmente puedes ejecutar. Tencent ha sido cuidadoso con sus lanzamientos antes, y este tiene la forma de un trabajo en progreso hecho público. Ejecútalo en un entorno aislado, vuelve a ejecutar los benchmarks y mantén el seguimiento de anuncios: la parte interesante de esta historia aún está por venir.
