
InternLumina-U2 vs Tencent UI-Mate-27B: el agente de escritorio que puedes ejecutar ahora vs el modelo de visión unificado que solo puedes leer
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Tencent UI-Mate-27B e InternLumina-U2 son dos lanzamientos discretos con licencia Apache-2.0 de laboratorios chinos, publicados con dos semanas de diferencia, y no son competidores — que es precisamente por lo que merece la pena compararlos. Tencent UI-Mate-27B, liberado con pesos abiertos el 14 de agosto de 2026, es un agente de escritorio: observa la pantalla y emite acciones de ratón y teclado. InternLumina-U2, publicado como código de inferencia el 1 de septiembre de 2026 por Shanghai AI Laboratory, es un aspirante a modelo de visión unificada: afirma leer imágenes, vídeo y 3D, y generar y editar imágenes. Uno actúa sobre lo que ve; el otro, cuando sus pesos finalmente existan, hablará y dibujará sobre lo que ve. Si tu trabajo es operar un escritorio, solo uno de estos dos puede hacerlo hoy — y no es el que tiene la arquitectura más sofisticada.
El agente que actúa: Tencent UI-Mate-27B
UI-Mate-27B es un agente GUI fundacional de pesos abiertos de 27 mil millones de parámetros del equipo de agentes multimodales HY Frontier de Tencent, con ajuste fino a partir de Qwen3.6-27B. Observa capturas de pantalla en vivo, razona sobre el estado actual de la pantalla y emite acciones estructuradas de teclado y ratón en un espacio de coordenadas normalizado: el resultado de un modelo entrenado para operar un escritorio real, no para conversar sobre uno. Su característica distintiva es la ejecución guiada por demostraciones: muéstrale un flujo de trabajo una vez y adapta la demostración grabada a la tarea en cuestión, tratando la captura en vivo como fuente autoritativa cuando la interfaz difiere de lo grabado. Las cifras principales que reporta Tencent son OSWorld-Verified 77.0 y WindowsAgentArena 66.2 — puntuaciones que encabezarían esas tablas de clasificación de 2026 si se reprodujeran de forma independiente —, junto con un abanico de resultados de OSWorkerBench. Los pesos son reales y descargables: doce fragmentos safetensors en Hugging Face, autoalojables mediante vLLM o SGLang en un par de GPUs, y la ficha del modelo incluye una advertencia importante: se trata de un checkpoint de agente, no de un modelo independiente de chat visual — pedirle que «describa esta imagen» es usarlo mal.
Los ojos prometidos: InternLumina-U2
InternLumina-U2 es una especie completamente diferente. Es un modelo de difusión de mezcla dispersa de expertos (sparse mixture-of-experts) de 16B parámetros (1B activos) que el laboratorio concibe como un modelo único para comprensión omni-visual, generación de imágenes y edición de imágenes: un diseño totalmente discreto de ocho codebooks donde un único backbone tanto lee una imagen, gráfico, video o activo 3D como escribe nuevos píxeles. Si tu modelo mental es un agente GUI, InternLumina-U2 es el polo opuesto: no quiere hacer clic en nada, quiere entenderlo todo y dibujar a petición. Su forma publicada el 1 de septiembre de 2026 es código de inferencia y una arquitectura: seis puntos de entrada de tareas en un repositorio de GitHub, una página de proyecto con una tabla de benchmarks preliminar, un stub vacío de Hugging Face; y sus pesos, código de entrenamiento e informe técnico aún están marcados como «próximamente». Nadie puede ejecutarlo. La brecha entre los dos modelos no es de calidad; es de existencia.
El marcador
Las cifras de UI-Mate-27B fueron reportadas por Tencent y no se han reproducido; las de InternLumina-U2 fueron reportadas por el laboratorio, son preliminares y parciales. Cada fila lleva su procedencia.
• Trabajo — Tencent UI-Mate-27B: operar un escritorio — leer capturas de pantalla en vivo, emitir acciones de mouse y teclado. InternLumina-U2: percibir y crear — comprender imágenes/vídeo/3D, generar y editar imágenes.
• Pesos — Tencent UI-Mate-27B: públicos desde el 14 de agosto de 2026, doce shards de safetensors, Apache-2.0. InternLumina-U2: no públicos — repositorio de Hugging Face vacío, pesos «próximamente».
• Escala — 27B denso, ajustado finamente a partir de Qwen3.6-27B frente a un modelo de difusión MoE disperso de 16B totales / 1B activos.
• Salida — Tencent UI-Mate-27B: acciones estructuradas compatibles con pyautogui en un espacio de coordenadas normalizado. InternLumina-U2: admite texto, generación de imágenes de hasta 1024×1024 a partir de texto, y edición de imágenes basada en instrucciones.
• Cifras destacadas — {{1}}Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench se beneficia de las demostraciones (todas reportadas por Tencent).{{/1}} {{2}}InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (reportado por el laboratorio, preliminar).{{/2}}
• Advertencia de procedencia — Tencent UI-Mate-27B: la propia ficha advierte que es un checkpoint de agente, no un modelo independiente de chat visual. InternLumina-U2: la página del proyecto etiqueta sus propios resultados como "preliminares, parciales".
• Realidad del servicio — Tencent UI-Mate-27B: autoalojamiento mediante vLLM o SGLang en ~2 GPU; actualmente ningún proveedor de inferencia alojada lo despliega. InternLumina-U2: nadie puede servirlo — el controlador publicado espera checkpoints que no están en el repositorio.

Dos sabores diferentes de lo no probado.
Ambos modelos no están probados, y la palabra no significa lo mismo en los dos casos. Tencent UI-Mate-27B no está probado en el sentido ordinario de un modelo nuevo: sus puntuaciones más destacadas son las del propio proveedor, nadie las ha vuelto a ejecutar de forma independiente, y su número de descargas es ínfimo en comparación con las afirmaciones: lo habitual en un checkpoint que, a primera vista, tiene cuatro días y que desde entonces ha desarrollado una comunidad modesta. Pero se trata de una falta de pruebas comprobable. Como los pesos existen, el 66.2 y el 77.0 pueden verificarse esta misma semana por cualquiera que tenga dos GPU y un entorno de pruebas Windows, y las afirmaciones basadas en demostraciones pueden reproducirse o refutarse en flujos de trabajo reales. InternLumina-U2 no está probado en un sentido más estricto: es incomprobable. Su arquitectura es pública y legible; sus cifras no lo son: no existe ningún artefacto que pueda confirmarlas, y la propia tabla parcial del laboratorio ya lo muestra a la zaga de un rival con nombre en al menos un benchmark de generación. Una cifra del proveedor adjunta a un archivo descargable es una afirmación a la espera de un árbitro. Una cifra del proveedor adjunta a una hoja de ruta es una esperanza.

La tarjeta de Hugging Face de tencent/UI-Mate-27B, capturada el 27 de agosto de 2026: la base Qwen3.6-27B, las puntuaciones de OSWorld y WindowsAgentArena reportadas por el proveedor, y la nota de que ningún proveedor de inferencia lo despliega actualmente.
La división natural del trabajo: un actor y sus ojos
Puestos uno al lado del otro, los dos modelos esbozan la forma de un pipeline de automatización fiable. El problema difícil con los agentes de GUI no es el caso promedio; es el agente haciendo silenciosamente lo incorrecto ante un estado de pantalla inesperado y que nadie lo note. Eso es exactamente para lo que existe un modelo de visión barato y confiable: verificar el estado de la pantalla antes y después de cada acción, confirmar que el diálogo que apareció es el diálogo que el agente cree que apareció, y detener el bucle cuando la realidad y el modelo de realidad del agente divergen. Tencent UI-Mate-27B es el actor; un modelo de visión unificado del tipo que InternLumina-U2 afirma ser es el verificador natural, capaz de leer las mismas capturas de pantalla sobre las que actúa el agente. Cuando — y solo cuando — los pesos de InternLumina-U2 realmente lleguen y sus afirmaciones de comprensión superen pruebas independientes, ese es el papel que podría desempeñar junto a un agente en lugar de contra él. Los dos no son rivales por un trabajo; son las dos mitades de un trabajo.

El repositorio de GitHub InternLM/InternLumina-U2, capturado el 2 de septiembre de 2026 — la página de inicio del repositorio muestra los scripts de inferencia por tarea, incluido el punto de entrada de comprensión de imágenes a partir del cual se construiría un verificador de estado de pantalla; los pesos que lo harían ejecutable no están en el árbol.
Qué hace una capa de enrutamiento para una arquitectura de agente con ojos
Ninguno de los dos modelos está alojado en OrcaRouter, y no daremos a entender lo contrario: Tencent UI-Mate-27B no tiene ningún proveedor de alojamiento en ninguna parte, e InternLumina-U2 no tiene pesos que ningún proveedor pueda alojar. El patrón de enrutamiento que se aplica es el de exactamente esta arquitectura: un agente que actúa y un modelo de visión que verifica, compuestos de forma que el paso caro o arriesgado quede condicionado al barato y fiable. El DSL de enrutamiento expresa eso como una única llamada lógica —actuar, luego verificar, luego proceder o detenerse— en lugar de un pegamento a medida entre dos proveedores de modelos, y la conmutación automática por error cubre el modo de fallo realista: un agente GUI como UI-Mate-27B es exactamente el tipo de punto de control no probado que se ensaya primero en una ruta de prueba, de modo que la llamada recae en un modelo probado en cuanto el nuevo se comporta mal. Una única API en más de 200 modelos alojados, el precio de lista del proveedor trasladado con un 0 % de recargo, y las piezas no probadas de la pila permanecen tras las barreras de seguridad mientras se ganan tu confianza.
El resultado final
Si estás construyendo algo que opera un escritorio, Tencent UI-Mate-27B es el único de los dos que existe de forma realmente utilizable: se puede ejecutar hoy en tus propias GPU, con resultados impresionantes pero no reproducidos que puedes ir a probar tú mismo. Si estás construyendo algo que necesita un modelo que entienda y dibuje sobre lo que ve, InternLumina-U2 es una arquitectura prometedora que aún espera sus pesos: vale la pena leerla ahora, pero no vale nada como dependencia hasta que aparezcan los safetensors. Sigue de cerca a los dos para el día en que la división del trabajo sea posible: un actor en tu escritorio, un conjunto de ojos verificados observándolo y una capa de enrutamiento que los mantenga honestos.
