Una tarjeta de título principal para la comparación 'Tencent HY4 Preview vs Qwen3.8-Max'. Un banner central dice 'El duelo de pesos abiertos de agosto', anotado 'Dos buques insignia de peso abierto, con 25 días de diferencia'. La tarjeta izquierda 'Tencent HY4 Preview' enumera '770B / 49B activos, lanzado el 28 de agosto', '¥6 / ¥18 por 1M', 'Sin puntuaciones independientes'. La tarjeta derecha 'Qwen3.8-Max' enumera '2.4T / ~95B activos, lanzado el 3 de agosto', '$2.00 / $6.00 por 1M', 'Índice AA 58'. Un pie de página dice 'Cifras de HY4 Preview reportadas por el proveedor; puntuaciones de Qwen3.8-Max según Artificial Analysis.' El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Tencent HY4 Preview vs Qwen3.8-Max: El Duelo de Pesos Abiertos de Agosto

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tencent HY4 Preview vs Qwen3.8-Max es la colisión hacia la que este mes venía construyéndose. El Qwen3.8-Max de Ali​baba pasó a disponibilidad general el 3 de agosto y se convirtió en el primer Qw​en de clase Max con pesos abiertos el 12 de agosto; Tencent HY4 Preview aterrizó esta mañana, 25 días después, con una tarjeta de lanzamiento que nombra directamente a Qwen3.8-Max — Tencent reporta HY4 Preview con 74.1 en Toolathlon-Verified, por delante de Qwen3.8-Max en ese benchmark. Ambos son buques insignia chinos de pesos abiertos, ambos tienen precios agresivos, y solo uno de ellos tiene puntuaciones independientes.

Los dos modelos están separados por algo más que la escala: Qwen3.8-Max tiene 2,4 billones de parámetros frente a los 770 mil millones de HY4 Preview, pero en los benchmarks agénticos que le importan a un comprador apuntan al mismo objetivo: trabajo de horizonte largo donde un modelo lee, llama a herramientas e itera sin un humano en el bucle. Ese es exactamente el territorio donde la generación de pesos abiertos de agosto intenta demostrar que puede reemplazar a los modelos frontera cerrados, y el primer movimiento de Tencent fue apuntar al mayor lanzamiento abierto del mes.

El marcador

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Escala — HY4 Preview 770B total / 49B activos vs Qwen3.8-Max 2.4T total / ~95B activos

• Contexto — HY4 Preview >1M tokens vs Qwen3.8-Max 1M tokens en la API (262K nativos en pesos abiertos, ampliable a ~1.01M)

• Precio por 1M — HY4 Preview ¥6 entrada / ¥18 salida (≈$0.85 / $2.50) vs Qwen3.8-Max $2.00 entrada / $6.00 salida, lecturas de caché $0.25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (reportado por el proveedor) vs Qwen3.8-Max 86.6

• Modalidad — ambas son solo texto en sus versiones de peso abierto; la API de Qwen3.8-Max añade entrada de imágenes y vídeo, la vista previa de HY4 Preview no.

• Puntuación independiente — HY4 Preview ninguna vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58

Las dos tarjetas cuentan la misma historia desde lados opuestos. En Terminal-Bench 2.1, el 86.6 de Qwen3.8-Max y el 85.4 de HY4 Preview están separados por un punto y medio — un punto a favor de Qwen, y la cifra de HY4 no está auditada. En precio, HY4 Preview es más barato tanto en entrada como en salida por token. En verificación, Qwen3.8-Max tiene un Índice de Inteligencia independiente de 58 y un Índice Agéntico de 58; HY4 Preview no tiene nada más que su propia publicidad. La diferencia es el patrón clásico de un desafiante que llega con mejores precios y afirmaciones no probadas contra un titular verificado.

Leyendo la reclamación de Toolathlon

Toolathlon-Verified mide la fiabilidad del uso agéntico de herramientas: con qué consistencia un modelo lleva una herramienta a través de una tarea completa con errores, recuperación y llamadas de múltiples pasos. El 74.1 de Tencent apunta directamente a la parte más fuerte del perfil de Qwen3.8-Max, porque el Índice Agéntico de 58 de Qwen y su 86.1 en OSWorld-Verified son las cifras que hicieron creíble la propuesta agéntica de Alibaba. Qwen3.8-Max también obtiene 82.8 en IFBench (seguimiento de instrucciones) y 93.0 en PaperBench (trabajo agéntico de grado de investigación), superando en ambos casos a modelos como GPT-5.6 Sol en las propias tablas del proveedor. Así que Tencent eligió el único benchmark en el que afirma una victoria directa sobre el modelo abierto más grande del mes, y la afirmación es actualmente tan verificable como cualquier otra fila de un único proveedor: en absoluto.

Verificado vs reportado por el proveedor

Este es el eje donde el enfrentamiento es menos justo, y la asimetría merece ser explícita. El índice de inteligencia de 58 de Qwen3.8-Max proviene de Artificial Analysis, su índice agéntico de 58 proviene de Artificial Analysis, y los mismos bancos de pruebas independientes que le otorgaron esas puntuaciones también midieron sus debilidades: una tasa de alucinación del 40% en AA-Omniscience, frente al 23% de la generación anterior, y una enorme cantidad de 64 turnos agénticos por tarea: el modelo trabaja duro, y pagas por cada turno. Tencent HY4 Preview no tiene nada de esa instrumentación. Sus fortalezas son afirmaciones, y sus modos de fallo —el propio Tencent señala el pensamiento prolongado y el exceso de autoverificación— son admisiones, no mediciones.

Para un equipo que elige entre los dos, la brecha de verificación no es abstracta. El comportamiento de 64 turnos por tarea de Qwen3.8-Max es un factor de costo real y medido: a $2/$6 sigue siendo el agente más caro por tarea completada en algunas comparaciones de terceros, y los equipos han informado que el recuento de turnos está erosionando su ventaja de precio. El comportamiento equivalente de HY4 Preview es desconocido: podría ser más barato por tarea de lo que sugiere su ya bajo precio por token, o su hábito de autoverificación podría comerse la diferencia. Nadie puede decirte cuál es todavía, porque nadie fuera de Tencent lo ha ejecutado.

El precio y los aspectos prácticos de los pesos abiertos.

Por token, HY4 Preview es más barato en ambos lados del balance: ¥6/¥18 frente a los $2.00/$6.00 de Qwen3.8-Max, y los aciertos de caché a ¥0.3 frente a $0.25. Eso convierte a HY4 Preview en el modelo insignia de pesos abiertos más barato tanto en entrada como en salida, y punto. Pero "pesos abiertos" viene con dos conjuntos diferentes de letra pequeña. El lanzamiento de pesos abiertos de Qwen3.8-Max — el Qwen3.8-2.4T-A95B — es de solo texto con el razonamiento forzado activado, un contexto nativo de 262K en lugar de los 1M de la API, y una licencia personalizada con condiciones por niveles de escala: requisitos de mostrar el nombre del modelo por encima de 100 millones de usuarios mensuales, y una licencia separada para grandes negocios de Modelo como Servicio. Los pesos de Tencent HY4 Preview están en HuggingFace, ModelScope y GitHub desde esta mañana, pero sus términos de licencia exactos y si los pesos coinciden con la API servida no se han declarado con ese tipo de claridad. Ambos modelos se pueden descargar; ninguno es de integración trivial.

El resultado final

Qwen3.8-Max es la opción más segura en todos los aspectos en que la verificación aporta seguridad: puntuado de forma independiente en inteligencia y trabajo agéntico, modos de fallo conocidos, una licencia establecida y tres semanas de retroalimentación de producción. También es la opción más cara por token, y su comportamiento de uso intensivo de turnos es un riesgo de coste conocido. Tencent HY4 Preview es la apuesta de valor: más barato tanto en entrada como en salida, una afirmación comparable en Terminal-Bench y una afirmación directa de Toolathlon-Verified contra Qw​en — todo ello sin verificar desde el primer día. Si vas a poner un modelo de peso abierto en producción esta semana, Qwen3.8-Max es la opción defendible y está disponible en OrcaRouter al precio de lista de Ali​baba — $2.00/$6.00, trasladado sin recargo. HY4 Preview es el proyecto de evaluación: ejecútalo a través de la propia API de Tencent con tus propias tareas de estilo Toolathlon, mantén la ruta de producción en el modelo verificado y, cuando lleguen las puntuaciones independientes — o cuando HY4 Preview llegue a un router y su tarifa de ¥6/¥18 se convierta en un precio de paso el mismo día — el cambio es una regla de enrutamiento, no una reescritura.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

Qué ver

La primera ejecución independiente de HY4 Preview en un banco de pruebas agéntico. El 74.1 verificado por Toolathlon es el número que Tencent quiere alcanzar; un Índice Agéntico de terceros sería la confirmación.

• El recuento de turnos medido de HY4 Preview. Los 64 turnos por tarea de Qwen3.8-Max son la advertencia; si HY4 Preview es más barato por tarea completada es todo el argumento económico.

• Los términos de licencia sobre los pesos. Determinarán si "abierto" significa "utilizable a tu escala" para HY4 Preview, como las condiciones de la licencia Qwen3.8-Max lo hicieron para el modelo de Ali​baba.

• Si alguno de los dos proveedores vuelve a recortar precios. En un mes en el que dos modelos insignia de pesos abiertos se lanzaron con precios agresivos, el traspaso en un router hace que cualquier recorte adicional sea visible ese mismo día.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube