
Claude Sonnet 5.5 vs Tencent HY4 Preview: ambos laboratorios venden la factura de los tokens
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 931 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 192 tok/s
- OrcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Dos lanzamientos, con seis semanas de diferencia, que hacen la misma promesa con distintas palabras. La afirmación del proveedor es que Claude Sonnet 5.5, lanzado el 28 de septiembre de 2026, cuesta «hasta un 30 % menos por tarea» que Claude Sonnet 5, con tarifas por token sin cambios. La segunda afirmación es que la optimización del 7 de septiembre de la versión alojada de Tencent HY4 Preview, publicado por primera vez y con código abierto el 28 de agosto de 2026, reduce los turnos de razonamiento y el consumo de tokens por tarea manteniendo la misma calidad de tarea. Ningún proveedor subió ni bajó ningún precio para hacer esa afirmación. Ambos te están diciendo que los tokens son ahora el producto, y la parte interesante de este enfrentamiento es que solo una de las dos afirmaciones puede contrastarse con una cifra publicada por tarea, porque solo uno de estos dos modelos cuenta con una medición independiente con la que contrastarla.
Esa asimetría no es una crítica a Tencent. HY4 Preview no tiene página de modelo en Artificial Analysis, ni una puntuación independiente del Intelligence Index, ni una cifra de coste por tarea de ningún tercero. Lo que sí tiene es una tabla de referencia del proveedor —Terminal-Bench 2.1 con 85.4, DeepSWE 64.3, una evaluación ciega interna de 203 tareas de ingeniería en la que promedió 2.99 frente a GLM-5.3 con 2.92 y Kimi K3 con 2.94— y un debut público votado por la multitud en la clasificación de WebDev Arena, donde Tencent informa que quedó alrededor del quinto puesto general y tercero entre los modelos de pesos abiertos. Todas esas son señales reales. Ninguna de ellas es un coste por tarea, lo que significa que la cifra exacta en la que ambos proveedores compiten no está disponible para HY4 Preview.
Lo que cada lado realmente entregó
Tencent HY4 Preview es una mezcla de expertos de 770 mil millones de parámetros con 49 mil millones activos por token, 78 capas, 256 expertos enrutados más un experto compartido, una capa MTP nativa para decodificación especulativa y una ventana de contexto que supera el millón de tokens. Es solo texto por diseño —Tencent lo creó para agentes de programación, uso complejo de herramientas y trabajo de productividad, no para imágenes— y utiliza razonamiento intenso de forma predeterminada, con tres niveles configurables (alto, bajo, ninguno) y una configuración de muestreo recomendada por el proveedor de temperatura 0.9 y top_p 1.0. Los pesos son Apache 2.0 y se pueden descargar desde Hugging Face, GitHub, ModelScope y GitCode. Tencent señaló originalmente dos asperezas en la vista previa, dedicar más tiempo del necesario a pensar y verificar en exceso su propio trabajo, y la actualización del 7 de septiembre apunta exactamente a esas.
Claude Sonnet 5.5 es el segundo modelo de la generación 5.5 de Anthropic y el que posiciona como la mejor combinación de velocidad e inteligencia de la línea. Un millón de tokens de contexto, 128.000 tokens de salida de forma síncrona y 300.000 en la API de Message Batches, entrada de texto, imágenes y archivos, razonamiento adaptativo con esfuerzo seleccionable, una fecha de corte de conocimiento de junio de 2026, retención de datos cero disponible desde el lanzamiento y una fecha mínima de retirada del 28 de septiembre de 2027. La tabla de precios no cambió respecto a Claude Sonnet 5: 2,00 $ por millón de tokens de entrada, 10,00 $ por millón de salida, 0,20 $ por lecturas de caché y 2,50 $ por escrituras de caché. Pesos cerrados, API de Anthropic más Bedrock, Google Cloud y Microsoft Foundry.
Pon a los dos uno enfrente del otro y las posiciones son casi simétricas:
• Precio — Claude Sonnet 5.5 $2.00 de entrada / $10.00 de salida por millón frente a Tencent HY4 Preview $0.83 de entrada / $2.50 de salida en nuestro catálogo, según una lista de proveedores de ¥6 / ¥18
• Lecturas de caché — Claude Sonnet 5.5 $0.20 por millón vs Tencent HY4 Preview $0.042 por millón en nuestro catálogo
• Pesos — Claude Sonnet 5.5 cerrado vs Tencent HY4 Preview Apache 2.0, descargable
• Contexto — 1.000.000 tokens de Claude Sonnet 5.5 frente a 1.048.576 tokens de Tencent HY4 Preview, prácticamente idénticos
• Salida máxima — Claude Sonnet 5.5 128.000 en modo síncrono, 300.000 en Batches frente a Tencent HY4 Preview 64.000 en nuestro catálogo
• Modalidad de entrada — Claude Sonnet 5.5 texto, imagen y archivo frente a Tencent HY4 Preview solo texto
• Puntuaciones independientes — Claude Sonnet 5.5 Índice de Inteligencia 56 a $7.60 por tarea, revisión v4.3.2 vs. Tencent HY4 Preview, ninguna publicada
• Velocidad de salida medida — Claude Sonnet 5.5 138,7 tokens/seg frente a Tencent HY4 Preview 22,3 tokens/seg en nuestro propio tráfico

La afirmación que ambos laboratorios están haciendo, y por qué uno de ellos es comprobable.
El «30 % menos por tarea» de Anthropic y el «menos turnos de razonamiento, menor consumo de tokens» de Tencent son el mismo proyecto de ingeniería descrito desde dos direcciones: hacer que el modelo gaste menos tokens para llegar a la misma respuesta. Anthropic dice explícitamente que las tarifas no cambiaron, lo que significa que cualquier ahorro por tarea tiene que venir del conteo de tokens — y el ranking independiente te permite ver la forma del problema en lugar del tamaño de la solución. Claude Sonnet 5.5 genera 540 millones de tokens de salida en la evaluación del Intelligence Index, frente a 117 millones de MiniMax M2.5 y 77 millones de Grok 4.5. Es un modelo verboso, medido, en un ranking que publica el número. Sin importar en qué se traduzca la mejora del 30 % sobre Claude Sonnet 5, se está aplicando a una base muy grande.
Para HY4 Preview, la cifra equivalente no existe públicamente. La propia nota de optimización de Tencent es el único registro al respecto, y enuncia el resultado sin una cifra: menos turnos, menos tokens de entrada y salida, la misma calidad, validado mediante métricas de benchmark y evaluación humana en una doble pasada. Esa es una afirmación de proveedor en sentido estricto —enunciada, plausible, no reproducida— y aquí se etiqueta como tal. Adoptar un modelo de preview basándose en la afirmación de un proveedor sobre la economía de tokens, cuando la economía de tokens es justamente lo que no se puede medir desde fuera, es precisamente la apuesta que una versión preview te pide que hagas.
Hay una complicación adicional que conviene conocer antes de que alguien planifique un despliegue autoalojado en torno a esa optimización. El cambio de Tencent del 7 de septiembre se aplica a la compilación que Tencent sirve en sus propios puntos de conexión alojados. La instantánea de pesos abiertos no se actualizó —la fecha de última modificación del repositorio de Hugging Face sigue siendo el 28 de agosto—, así que una copia autoalojada de los pesos ejecuta el comportamiento original de razonamiento más prolongado que las notas de la vista previa señalaron. La versión optimizada y la versión descargable no son el mismo artefacto.
Donde los pesos abiertos sí compensan es en el mismo lugar de siempre: un despliegue que no puede llamar a una API. Un modelo de 770B de parámetros con 49B activos es una decisión de centro de datos más que de estación de trabajo, así que no es la historia de clase portátil que cuenta un modelo de 30B, pero para un comprador que necesita el modelo dentro de su propio perímetro, Apache 2.0 a esa escala es una opción que Claude Sonnet 5.5 no ofrece a ningún precio.
Probar una vista previa sin jugarse con ello una ruta de producción
Los modelos de vista previa son el caso en el que el enrutamiento deja de ser una optimización de costes y se convierte en un control de riesgos. La razón para poner una compilación de vista previa detrás de un enrutador en lugar de llamarla directamente es que una vista previa se define por la posibilidad de cambiar bajo tus pies, y las dos cosas que quieres de la capa que tiene delante son un reparto porcentual y algo que atrape los fallos.
Esa es la forma que ofrece OrcaRouter: un único endpoint compatible con OpenAI que cubre más de 200 modelos, con el precio de lista del proveedor pasado tal cual, sin ningún margen añadido, conmutación automática en caso de fallo entre proveedores upstream, y un DSL de enrutamiento para componer llamadas a partir de varios modelos. Tencent HY4 Preview se puede enrutar aquí hoy como tencent/hy4-preview a $0,83 por entrada y $2,50 por salida por millón de tokens, con lecturas de caché a $0,042 en su ventana de 1.048.576 tokens — la misma versión, a la tarifa del proveedor, accesible desde la clave que ya usas para todo lo demás del catálogo. Claude Sonnet 5 también se puede enrutar aquí, a los $2,00 y $10,00 de Anthropic, y lo está desde el 30 de junio; es un compañero de conmutación por fallo evidente mientras un modelo que apenas tiene un día acumula evidencia de producción.

Claude Sonnet 5.5 en sí no está en nuestro catálogo. Se lanzó ayer, la ruta hacia él es la propia API de Anthropic, y esta página no va a sugerir lo contrario: el punto del consejo de enrutamiento es que la forma segura de ejecutar en producción un nivel totalmente nuevo es darle una porción de tráfico con algo probado detrás, y eso solo funciona cuando ambos extremos del acuerdo están en algún lugar al que se pueda llegar desde un único punto. HY4 Preview está moviendo aquí 372 mil tokens de tráfico a la semana, que es el aspecto que tiene una preview de dos días antes de que nadie se comprometa con ella; Claude Sonnet 5 lleva moviendo 7,9 millones a la semana desde el 30 de junio, y esa es la diferencia entre un candidato y una base.

A dónde va realmente el dinero
Solo por tarifas, HY4 Preview es cuatro veces más barato en salida que Claude Sonnet 5.5 y casi cinco veces más barato en lecturas de caché, y ofrece la misma ventana. Del lado medido, Claude Sonnet 5.5 genera salida seis veces más rápido en nuestro propio tráfico —138,7 tokens por segundo frente a 22,3—, que es el tipo de diferencia que convierte una ventaja de tarifa de cuatro veces en una ventaja de tiempo real mucho menor, y ocasionalmente en una pérdida, una vez que se tiene en cuenta el encolamiento.
Entre esos dos hechos, la decisión se apoya en cuatro preguntas que solo el lector puede responder. ¿El trabajo necesita una imagen o un archivo en el prompt? HY4 Preview es solo texto y eso zanja la discusión. ¿Necesita completar una tarea de software de varios pasos, en la que la puntuación de 85,4 de HY4 Preview en Terminal-Bench 2.1 es el propio número de Tencent y no ha sido reproducido? Entonces el estatus de preview es el riesgo que aceptas, y la optimización del 7 de septiembre merece que se vuelva a probar en lugar de confiar en ella. ¿La carga de trabajo tiene que ejecutarse dentro de tu propio perímetro? Entonces los pesos de Apache 2.0 son el hecho decisivo. ¿Y el nivel de capacidad compuesta importa más que la tarifa? Entonces el 56 de Claude Sonnet 5.5, medido de forma independiente, es el número que hay que sopesar, a 7,60 $ por tarea de Index, con la advertencia de que no existe una cifra equivalente del lado de Tencent con la que compararlo.
Lo que ambos lanzamientos demuestran en realidad es que la frontera ha dejado atrás las tablas de tarifas. Dos laboratorios, con seis semanas de diferencia, lanzaron modelos y pusieron por delante el consumo de tokens por tarea en lugar del precio por millón, y la consecuencia práctica para un comprador es que el número útil ya no está en la página de precios de ninguno de los dos proveedores. Es el recuento de tokens que produce tu propia carga de trabajo, medido en ambos modelos, y es la única cifra de este artículo que ninguno de los dos proveedores puede darte.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
