
Tencent HY4 Preview vs Qwen3.8-Max: El Duelo de Pesos Abiertos de Agosto
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Tencent HY4 Preview vs Qwen3.8-Max es la colisión hacia la que este mes venía construyéndose. El Qwen3.8-Max de Alibaba pasó a disponibilidad general el 3 de agosto y se convirtió en el primer Qwen de clase Max con pesos abiertos el 12 de agosto; Tencent HY4 Preview aterrizó esta mañana, 25 días después, con una tarjeta de lanzamiento que nombra directamente a Qwen3.8-Max — Tencent reporta HY4 Preview con 74.1 en Toolathlon-Verified, por delante de Qwen3.8-Max en ese benchmark. Ambos son buques insignia chinos de pesos abiertos, ambos tienen precios agresivos, y solo uno de ellos tiene puntuaciones independientes.
Los dos modelos están separados por algo más que la escala: Qwen3.8-Max tiene 2,4 billones de parámetros frente a los 770 mil millones de HY4 Preview, pero en los benchmarks agénticos que le importan a un comprador apuntan al mismo objetivo: trabajo de horizonte largo donde un modelo lee, llama a herramientas e itera sin un humano en el bucle. Ese es exactamente el territorio donde la generación de pesos abiertos de agosto intenta demostrar que puede reemplazar a los modelos frontera cerrados, y el primer movimiento de Tencent fue apuntar al mayor lanzamiento abierto del mes.
El marcador

• Escala — HY4 Preview 770B total / 49B activos vs Qwen3.8-Max 2.4T total / ~95B activos
• Contexto — HY4 Preview >1M tokens vs Qwen3.8-Max 1M tokens en la API (262K nativos en pesos abiertos, ampliable a ~1.01M)
• Precio por 1M — HY4 Preview ¥6 entrada / ¥18 salida (≈$0.85 / $2.50) vs Qwen3.8-Max $2.00 entrada / $6.00 salida, lecturas de caché $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (reportado por el proveedor) vs Qwen3.8-Max 86.6
• Modalidad — ambas son solo texto en sus versiones de peso abierto; la API de Qwen3.8-Max añade entrada de imágenes y vídeo, la vista previa de HY4 Preview no.
• Puntuación independiente — HY4 Preview ninguna vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58
Las dos tarjetas cuentan la misma historia desde lados opuestos. En Terminal-Bench 2.1, el 86.6 de Qwen3.8-Max y el 85.4 de HY4 Preview están separados por un punto y medio — un punto a favor de Qwen, y la cifra de HY4 no está auditada. En precio, HY4 Preview es más barato tanto en entrada como en salida por token. En verificación, Qwen3.8-Max tiene un Índice de Inteligencia independiente de 58 y un Índice Agéntico de 58; HY4 Preview no tiene nada más que su propia publicidad. La diferencia es el patrón clásico de un desafiante que llega con mejores precios y afirmaciones no probadas contra un titular verificado.
Leyendo la reclamación de Toolathlon
Toolathlon-Verified mide la fiabilidad del uso agéntico de herramientas: con qué consistencia un modelo lleva una herramienta a través de una tarea completa con errores, recuperación y llamadas de múltiples pasos. El 74.1 de Tencent apunta directamente a la parte más fuerte del perfil de Qwen3.8-Max, porque el Índice Agéntico de 58 de Qwen y su 86.1 en OSWorld-Verified son las cifras que hicieron creíble la propuesta agéntica de Alibaba. Qwen3.8-Max también obtiene 82.8 en IFBench (seguimiento de instrucciones) y 93.0 en PaperBench (trabajo agéntico de grado de investigación), superando en ambos casos a modelos como GPT-5.6 Sol en las propias tablas del proveedor. Así que Tencent eligió el único benchmark en el que afirma una victoria directa sobre el modelo abierto más grande del mes, y la afirmación es actualmente tan verificable como cualquier otra fila de un único proveedor: en absoluto.
Verificado vs reportado por el proveedor
Este es el eje donde el enfrentamiento es menos justo, y la asimetría merece ser explícita. El índice de inteligencia de 58 de Qwen3.8-Max proviene de Artificial Analysis, su índice agéntico de 58 proviene de Artificial Analysis, y los mismos bancos de pruebas independientes que le otorgaron esas puntuaciones también midieron sus debilidades: una tasa de alucinación del 40% en AA-Omniscience, frente al 23% de la generación anterior, y una enorme cantidad de 64 turnos agénticos por tarea: el modelo trabaja duro, y pagas por cada turno. Tencent HY4 Preview no tiene nada de esa instrumentación. Sus fortalezas son afirmaciones, y sus modos de fallo —el propio Tencent señala el pensamiento prolongado y el exceso de autoverificación— son admisiones, no mediciones.
Para un equipo que elige entre los dos, la brecha de verificación no es abstracta. El comportamiento de 64 turnos por tarea de Qwen3.8-Max es un factor de costo real y medido: a $2/$6 sigue siendo el agente más caro por tarea completada en algunas comparaciones de terceros, y los equipos han informado que el recuento de turnos está erosionando su ventaja de precio. El comportamiento equivalente de HY4 Preview es desconocido: podría ser más barato por tarea de lo que sugiere su ya bajo precio por token, o su hábito de autoverificación podría comerse la diferencia. Nadie puede decirte cuál es todavía, porque nadie fuera de Tencent lo ha ejecutado.
El precio y los aspectos prácticos de los pesos abiertos.
Por token, HY4 Preview es más barato en ambos lados del balance: ¥6/¥18 frente a los $2.00/$6.00 de Qwen3.8-Max, y los aciertos de caché a ¥0.3 frente a $0.25. Eso convierte a HY4 Preview en el modelo insignia de pesos abiertos más barato tanto en entrada como en salida, y punto. Pero "pesos abiertos" viene con dos conjuntos diferentes de letra pequeña. El lanzamiento de pesos abiertos de Qwen3.8-Max — el Qwen3.8-2.4T-A95B — es de solo texto con el razonamiento forzado activado, un contexto nativo de 262K en lugar de los 1M de la API, y una licencia personalizada con condiciones por niveles de escala: requisitos de mostrar el nombre del modelo por encima de 100 millones de usuarios mensuales, y una licencia separada para grandes negocios de Modelo como Servicio. Los pesos de Tencent HY4 Preview están en HuggingFace, ModelScope y GitHub desde esta mañana, pero sus términos de licencia exactos y si los pesos coinciden con la API servida no se han declarado con ese tipo de claridad. Ambos modelos se pueden descargar; ninguno es de integración trivial.
El resultado final
Qwen3.8-Max es la opción más segura en todos los aspectos en que la verificación aporta seguridad: puntuado de forma independiente en inteligencia y trabajo agéntico, modos de fallo conocidos, una licencia establecida y tres semanas de retroalimentación de producción. También es la opción más cara por token, y su comportamiento de uso intensivo de turnos es un riesgo de coste conocido. Tencent HY4 Preview es la apuesta de valor: más barato tanto en entrada como en salida, una afirmación comparable en Terminal-Bench y una afirmación directa de Toolathlon-Verified contra Qwen — todo ello sin verificar desde el primer día. Si vas a poner un modelo de peso abierto en producción esta semana, Qwen3.8-Max es la opción defendible y está disponible en OrcaRouter al precio de lista de Alibaba — $2.00/$6.00, trasladado sin recargo. HY4 Preview es el proyecto de evaluación: ejecútalo a través de la propia API de Tencent con tus propias tareas de estilo Toolathlon, mantén la ruta de producción en el modelo verificado y, cuando lleguen las puntuaciones independientes — o cuando HY4 Preview llegue a un router y su tarifa de ¥6/¥18 se convierta en un precio de paso el mismo día — el cambio es una regla de enrutamiento, no una reescritura.


Qué ver
La primera ejecución independiente de HY4 Preview en un banco de pruebas agéntico. El 74.1 verificado por Toolathlon es el número que Tencent quiere alcanzar; un Índice Agéntico de terceros sería la confirmación.
• El recuento de turnos medido de HY4 Preview. Los 64 turnos por tarea de Qwen3.8-Max son la advertencia; si HY4 Preview es más barato por tarea completada es todo el argumento económico.
• Los términos de licencia sobre los pesos. Determinarán si "abierto" significa "utilizable a tu escala" para HY4 Preview, como las condiciones de la licencia Qwen3.8-Max lo hicieron para el modelo de Alibaba.
• Si alguno de los dos proveedores vuelve a recortar precios. En un mes en el que dos modelos insignia de pesos abiertos se lanzaron con precios agresivos, el traspaso en un router hace que cualquier recorte adicional sea visible ese mismo día.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
