Una tarjeta de título principal para la comparación 'Tencent HY4 Preview vs Kimi K3'. Una tarjeta central estilo marcador dice 'Prueba interna a ciegas, escala de 4 puntos' con 'Tencent HY4 Preview 2.99' a la izquierda y 'Kimi K3 2.94' a la derecha. La tarjeta izquierda 'Tencent HY4 Preview' enumera '770B / 49B activos, pesos abiertos', '¥6 / ¥18 por 1M', 'Vista previa solo texto'. La tarjeta derecha 'Kimi K3' enumera '2.8T / 104B activos, pesos abiertos', '$3.00 / $15.00 por 1M', 'Visión nativa, AA Index 57'. Un pie de página dice 'Prueba a ciegas realizada por Tencent con 163 ingenieros en 203 tareas; resultados informados por el proveedor.' El logotipo de OrcaRouter está superpuesto en la esquina inferior derecha.
Guides & Insights

Tencent HY4 Preview vs Kimi K3: La prueba a ciegas que Tencent decidió publicar

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tencent HY4 Preview vs Kimi K3 es el único enfrentamiento en el lanzamiento de este modelo que la propia Tencent eligió realizar. En su prueba interna a ciegas — 163 ingenieros, 203 tareas de ingeniería, puntuadas en una escala de cuatro puntos — HY4 Preview obtuvo 2.99/4.00 frente a los 2.94 de Kimi K3, y el titular de Tencent lo llamó una victoria. La letra pequeña de esa victoria merece leerse con calma: HY4 Preview superó a Kimi K3 en el 51.2% de las tareas, empató en el 7.9% y perdió en el 40.9%. Una tasa de victoria neta de 10 puntos es real, pero es una ventaja estrecha frente a un modelo con un tercio del total de parámetros y menos de la mitad de los parámetros activos — y toda la prueba fue realizada por Tencent.

{{1}}Kimi K3 es el buque insignia de peso abierto de Moonshot con 2,8 billones de parámetros{{/1}}, {{2}}el modelo abierto más grande jamás lanzado{{/2}}, y {{3}}el punto de referencia contra el que todos los laboratorios chinos se han estado midiendo desde el 16 de julio{{/3}}. {{4}}Tencent lo eligió como oponente porque es el estándar de peso abierto{{/4}} — lo que hace que el trabajo de este artículo sea inusualmente concreto: leer el único cara a cara que el retador ofreció y decidir cuánto vale.

El benchmark que Tencent eligió publicar

La prueba a ciegas fue puntuada por los propios ingenieros de Tencent en tareas de ingeniería de la propia Tencent, que es lo primero que hay que descontar. Un conjunto de tareas seleccionado por la empresa es exactamente el entorno donde un modelo nuevo consigue su mejor rendimiento posible. Aun concediendo eso, la forma del resultado es informativa: un 51.2% de victorias frente a un 40.9% de derrotas es un margen modesto, y la tasa de empates del 7.9% significa que los modelos están muy igualados en la mayoría de las tareas. En las tareas difíciles, aquellas donde un modelo de frontera se distingue, la brecha está donde siempre está — y el titular de Tencent, "ligeramente por delante de Kimi K3", está redactado con honestidad, algo que no todos los laboratorios publican.

La escala no es el destino.

La comparación de parámetros hace que el resultado sea impresionante o sospechoso, dependiendo de tus supuestos previos. Kimi K3 tiene 2,8 billones de parámetros totales con 104 mil millones activos — 896 expertos, 16 activos por token — y se entrenó para razonar siempre activo con la cadena de pensamiento expuesta. HY4 Preview tiene 770 mil millones en total con 49 mil millones activos, un tercio de la escala total y menos de la mitad del cómputo activo. Que un modelo más pequeño obtenga una victoria ajustada sobre uno más grande en una prueba a ciegas es la dirección en la que viene moviéndose todo el campo de pesos abiertos — Qwen3.8-Max, con 2.4T, y GLM-5.2, con 753B, han estado intercambiando golpes en benchmarks de agentes durante meses —, por lo que el resultado es plausible, no descabellado. Además, y esto es crucial, nadie fuera de Tencent lo ha verificado.

El marcador

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Escala — HY4 Preview 770B total / 49B activos vs Kimi K3 2.8T total / 104B activos

• Contexto — HY4 Preview >1M tokens vs Kimi K3 1M tokens

• Precio por 1M — HY4 Preview ¥6 entrada / ¥18 salida (≈$0.85 / $2.50) vs Kimi K3 $3.00 entrada / $15.00 salida, aciertos de caché $0.30

• Modalidad — HY4 Preview solo texto vs entrada nativa de imagen y video de Kimi K3

• Razonamiento — HY4 Preview sin modo publicado vs Kimi K3 con razonamiento siempre activo y cadena de pensamiento en streaming

• Puntuación independiente — HY4 Preview ninguno frente a Kimi K3 AA Intelligence Index 57, entre los tres primeros a nivel mundial en su lanzamiento

En las filas donde ambos lados reportan un número, los modelos se agrupan. Tencent reporta HY4 Preview con 37.1 en APEX-Agents, prácticamente a la par con el 37.2 de Kimi K3: un empate técnico que el marcador de la prueba a ciegas predeciría. El Toolathlon-Verified 74.1 y el DeepSWE 64.3 de HY4 Preview no tienen equivalente con Kimi K3 en mis manos, y el FrontierSWE 81.2, el ProgramBench 77.8 y el BrowseComp 91.2 de Kimi K3 no tienen equivalente con HY4 Preview. El marcador es honesto al señalar que las dos fichas apenas se solapan, lo cual es en sí mismo una advertencia sobre tratar las filas de cualquiera de los dos proveedores como una descripción completa del modelo.

La visión es la mayor diferencia real.

Para un desarrollador que elige entre los dos hoy, la brecha estructural no es la inteligencia — es la modalidad de entrada. Kimi K3 es nativamente multimodal: acepta entrada de imagen y video a través de su codificador MoonViT-V2 y está entre los mejores modelos abiertos en tareas de visión, ocupando el segundo lugar a nivel mundial en el vision arena. Tencent HY4 Preview es solo texto en esta vista previa, y Tencent ha dicho que la visión debe esperar hasta el lanzamiento completo. Cualquier carga de trabajo que necesite capturas de pantalla, comprensión de interfaz de usuario o anclaje visual es de Kimi K3 por defecto, sin importar lo que diga la prueba ciega sobre el texto de ingeniería. Si tu trabajo es puramente código, documentos y salida de terminal, la brecha no importa; en el momento en que una tarea implica mirar algo, decide el enfrentamiento.

La cuestión del costo

Por token, HY4 Preview es drásticamente más barato: aproximadamente $0,85/$2,50 frente a los $3,00/$15,00 de Kimi K3, con aciertos de caché a ¥0,3 (unos cuatro centavos) frente a $0,30. Pero los dos modelos tienen comportamientos de token opuestos que reducen la brecha. Kimi K3 razona de forma continua y transmite su cadena de pensamiento, lo que infla los tokens de salida en cada solicitud; los evaluadores han señalado que el modelo es más lento —alrededor de 62 tokens por segundo— y con un uso intensivo de tokens en los bucles de agente. HY4 Preview, según la propia nota de lanzamiento de Tencent, “tiende a razonamientos demasiado largos y a una autoverificación excesiva” en tareas complejas. Ambos queman tokens de salida adicionales; HY4 Preview solo cobra menos por ellos. Una comparación justa es el costo por tarea completada, y nadie fuera de Tencent ha medido todavía el de HY4 Preview.

El veredicto

Tencent HY4 Preview es el desafiante más barato, más pequeño y no verificado que afirma tener una ligera ventaja en pruebas a ciegas sobre el estándar de peso abierto; Kimi K3 es el titular más grande, verificado y con capacidad de visión, que cuesta de cuatro a cinco veces más por token y tiene un Índice de Inteligencia independiente de 57. La ficha de rendimiento de ninguno de los dos modelos es totalmente independiente — las puntuaciones principales de Kimi K3 también las reporta Moonshot, aunque su Índice 57 no lo es. Si tu carga de trabajo es multimodal, Kimi K3 es la única opción en este enfrentamiento. Si es texto e ingeniería, HY4 Preview es la apuesta de valor con un enfrentamiento real, aunque gestionado por el proveedor, en su haber, y el camino económico es enrutar Kimi K3 en la clave de producción — está activo en OrcaRouter al precio de lista de Moonshot de $3.00/$15.00, transferido sin margen — mientras ejecutas HY4 Preview a través de la propia API de Tencent en cargas de trabajo en sombra. Cuando HY4 Preview llegue a un enrutador, la misma clave y las mismas reglas de conmutación por error transportarán ambos, y la tarifa de ¥6/¥18 de Tencent se transferirá sin cambios.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Qué ver

• Una repetición independiente de las tareas de prueba a ciegas. La tasa de victorias del 51.2% es la afirmación más comprobable de este lanzamiento, y una herramienta de pruebas de terceros la resolvería en una semana.

• Si HY4 Preview incluye visión antes del lanzamiento completo de Hy4. Eso es lo que convertiría esto de una comparación de valor solo textual en una auténtica batalla de buques insignia.

• Coste por tarea completada en harnesses agénticos estándar. Ambos modelos consumen muchos tokens; quien sea más barato por tarea terminada gana el argumento de producción.

• La respuesta de Kimi K3 a la presión de precios. Si Moonshot recorta la tarifa de salida de $15, el marco de "retador barato vs estándar caro" se invierte.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube