
Tencent HY4 Preview vs GPT-5.6 Sol: La afirmación sobre la invocación de herramientas que pone a los pesos abiertos contra la frontera
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Tencent HY4 Preview es el primer modelo de pesos abiertos en meses cuya ficha de lanzamiento afirma explícitamente una victoria sobre GPT-5.6 Sol. La cifra en cuestión es la de Toolathlon-Verified, un benchmark para la llamada agéntica a herramientas, donde Tencent reporta un 74,1 para HY4 Preview — por delante de Qwen3.8-Max y, según la propia comparación de Tencent, por delante de GPT-5.6 Sol. En cualquier otra dimensión, los dos modelos no son realmente comparables: GPT-5.6 Sol es el modelo de frontera insignia de OpenAI, cerrado y medido de forma independiente, mientras que Tencent HY4 Preview es una vista previa de pesos abiertos de 770 mil millones de parámetros que se publicó esta mañana con una ficha de resultados reportada por el proveedor y sin verificación de terceros.
Así que la pregunta interesante no es "qué modelo es más inteligente" — sino si un aspirante de pesos abiertos, a aproximadamente una sexta parte del precio de entrada de Sol, puede reclamar de manera creíble una parte de la frontera, y qué debería hacer un equipo con una afirmación que actualmente no se puede verificar.
La afirmación que convierte esto en un verdadero enfrentamiento
Toolathlon-Verified mide con qué fiabilidad un modelo maneja una herramienta a lo largo de una tarea agéntica completa — leyendo resultados, decidiendo la siguiente llamada, recuperándose de errores — en lugar de lo bien que escribe una sola función. Es importante porque la mayor parte del gasto real en API de los modelos frontier se destina a bucles de agente, no a completaciones one-shot. El 74.1 de Tencent en ese benchmark es la afirmación concreta que puso a HY4 Preview en la conversación de GPT-5.6 Sol, y merece la pena detenerse un momento: es el tipo de cifra que, si se sostiene ante una replicación independiente, hace real la conversación sobre el coste entre pesos abiertos y modelos frontier cerrados. Si no se sostiene, se convierte en otro marcador de proveedor que se desvanece bajo un banco de pruebas de terceros.
Dos maneras de comprar inteligencia

• Parámetros — HY4 Preview 770B total / 49B activos, pesos abiertos vs GPT-5.6 Sol, número de parámetros no revelado, API cerrada
• Contexto — HY4 Preview >1M tokens vs GPT-5.6 Sol 1.05M tokens, salida máxima de 128K
• Precio por 1M — HY4 Preview ¥6 entrada / ¥18 salida (≈$0.85 / $2.50) frente a GPT-5.6 Sol $4.00 / $20.00 en el nivel base, que sube a $8.00 / $30.00 para solicitudes de contexto grande, lecturas de caché $0.40
• Modalidades de entrada — HY4 Preview solo texto en esta vista previa vs GPT-5.6 Sol entrada de texto e imagen
• Modos de razonamiento: HY4 Preview sin equivalente publicado vs el modo Ultra de GPT-5.6 Sol (hasta 16 subagentes paralelos) y el esfuerzo de razonamiento Max.
• Verificación independiente — HY4 Preview ninguna aún vs GPT-5.6 Sol presente en todos los principales leaderboards, con una clasificación de contexto de 1.05M en el nivel superior de las pruebas compuestas de contexto largo
La columna de precios es donde vive todo el enfrentamiento. En el nivel base, GPT-5.6 Sol cuesta $4.00 por millón de tokens de entrada y $20.00 por millón de tokens de salida. Tencent HY4 Preview cuesta alrededor de $0.85 y $2.50 al tipo de cambio actual. Para una carga de trabajo que mueve muchos tokens de salida — como lo hace la codificación agéntica — el modelo de pesos abiertos tiene un precio de aproximadamente una octava parte del modelo cerrado, y esa brecha se mantiene incluso teniendo en cuenta que las cifras de Sol vienen respaldadas por mucha más verificación.
Donde GPT-5.6 Sol todavía mantiene la ventaja.
La verificación es la primera ventaja. GPT-5.6 Sol ha estado en disponibilidad general desde el 9 de julio y se ha medido de forma independiente desde entonces: 88.8 en Terminal-Bench 2.1 con razonamiento base, 91.9 en modo Ultra, 53.6 en Agents' Last Exam (un récord en el momento del lanzamiento), 94.6 en GPQA Diamond y un 64.6 en SWE-bench Pro. OpenAI también informa de una mejora del 54% en la eficiencia de tokens en tareas de programación agéntica en comparación con su propio buque insignia anterior. Esos son números que se pueden encontrar reproducidos fuera de la propia documentación de OpenAI, que es exactamente la propiedad de la que carece Tencent HY4 Preview hoy en día.
La capacidad es la segunda ventaja, y es estructural más que marginal. GPT-5.6 Sol acepta entrada de imágenes; HY4 Preview es solo texto en esta vista previa, y Tencent reconoce que la visión tendrá que esperar a la versión completa. GPT-5.6 Sol incluye el modo Ultra — una configuración multiagente que coordina subagentes paralelos a un costo de tokens tres o cuatro veces mayor, útil precisamente para las tareas de ingeniería de largo horizonte donde los dos modelos realmente competirían. Y las rutas de uso de computadora y de llamada programática de herramientas de Sol están documentadas, ejercitadas a escala de producción y sometidas a pruebas de carga. La afirmación Toolathlon-Verified de Tencent, si se replica, reduce la brecha en el uso de herramientas; no cierra las brechas multimodales ni multiagente, que HY4 Preview no intenta abordar.
Donde HY4 Preview es genuinamente interesante
Dejando de lado el teatro de los benchmarks, quedan tres cosas reales. Primero, el precio: a ¥6/¥18 — aproximadamente $0.85/$2.50 — Tencent está subcotizando a todos los modelos frontera occidentales en tokens de salida por un factor de cuatro a ocho, y subcotizando a sus propios pares chinos de pesos abiertos en la entrada. Segundo, los pesos abiertos: un MoE activo de 49B se puede implementar en un solo nodo de una manera que la arquitectura no revelada de Sol nunca podrá, y los pesos ya están en HuggingFace, ModelScope y GitHub. Tercero, el contexto y la trayectoria de ingeniería: DeepSWE 64.3 y una ventana de contexto de más de 1M apuntan a las mismas cargas de trabajo agénticas de horizonte largo que el modo Ultra de Sol, a una fracción del costo.
La advertencia honesta es que nada de esto ha sobrevivido al contacto con un punto de referencia independiente. La historia de auto-optimización que cuenta Tencent — una ganancia de rendimiento de extremo a extremo del 31,8% gracias a que el modelo itera sobre su propia pila de inferencia — se mide internamente. La victoria en prueba a ciegas sobre GLM 5.3 y Kimi K3 se realiza internamente. Todo lo interesante sobre HY4 Preview es, hoy, una afirmación.
La decisión.
Si hoy en día estás construyendo un sistema de producción, GPT-5.6 Sol es la opción defendible, y es accesible a través de OrcaRouter al precio de lista por niveles de OpenAI — $4.00/$20.00 en el nivel base, $8.00/$30.00 por encima de este, trasladado sin margen alguno, por lo que cualquier cambio de precio del proveedor se refleja en nuestro lado el mismo día. Si tu flujo de trabajo es agéntico y con gran uso de herramientas, la estructura por niveles implica que deberías verificar tus tamaños de entrada reales contra el umbral de $272K tokens en lugar de asumir una tarifa plana.
Si estás dispuesto a ejecutar una evaluación en la sombra, HY4 Preview es lo bastante barato como para que valga la pena hacer una real: enruta tu carga de trabajo de llamada de herramientas a través de Sol hoy, ejecuta las mismas instrucciones contra HY4 Preview mediante la API propia de Tencent y compara con tus propias tareas estilo Toolathlon. Y si las puntuaciones independientes aterrizan donde Tencent dice que lo harán, el camino de migración es corto: el modelo de pesos abiertos se inserta en un router y tu regla de conmutación por error intercambia los endpoints, con la tarifa de ¥6/¥18 del proveedor pasando intacta. Esa es la estructura honesta de este enfrentamiento: un modelo frontera verificado sobre el que puedes construir hoy, frente a un desafiante abierto no verificado que es bastante barato como para probarlo y está posicionado para convertir la conversación sobre precios en algo que involucre a toda la clase de pesos abiertos.


Qué ver
• La primera replicación independiente de Toolathlon-Verified. Si un harness de terceros confirma HY4 Preview en los 70, el argumento de que "los pesos abiertos no pueden hacer uso agéntico de herramientas" se derrumba.
Si Tencent lanza la versión de visión antes del lanzamiento completo de Hy4. El modo de solo texto limita HY4 Preview a un subconjunto estricto de las cargas de trabajo que GPT-5.6 Sol maneja.
• Las facturas de tokens reales de la tendencia de pensamiento prolongado de HY4 Preview. A ¥18 por millón de tokens de salida, la autoverificación verbosa consume la ventaja de precio más rápido que en un modelo de $20.
• Si la fijación de precios escalonada de Sol sufre otro recorte antes del lanzamiento completo de Hy4. El traspaso en un router significa que una caída es visible el mismo día.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
