Tarjeta de título principal titulada 'Claude Opus 5.5 y la prueba de la sandía', con el subtítulo 'El Claude más legible hasta ahora — y aún entierra el punto', con tres insignias que dicen Flesch-Kincaid 6.95, Reading Ease 68.4 y 22 de septiembre de 2026, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Claude Opus 5.5 y la prueba de la sandía: Anthropic arregló la prosa, pero el punto sigue enterrado

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Una de las muestras que más trascendió la semana de lanzamiento fue un cuento corto sobre una sandía. Unos cientos de palabras, sin benchmark adjunto, sin gráfico — solo un modelo al que se le pidió escribir algo breve y que acertó en su mayor parte. Es un artefacto extraño que se sitúe cerca del centro de un lanzamiento estrella, pero apunta a lo que el proveedor eligió destacar cuando lanzó Claude Opus 5.5 el 22 de septiembre de 2026: no otro punto en Terminal-Bench, sino prosa. El planteamiento de la empresa es que este modelo escribe menos «Claudish» — su término para el registro formulista, repleto de atenuantes y preámbulos, por el que Claude Opus 5 recibió quejas, y con el que se ha medido a cada uno de Claude Fable 5.1, GPT-6 Astra y GPT-5.6 Sol desde entonces. Así que la pregunta que vale la pena responder no es si la demo fue encantadora. Es si la prosa mejoró de forma medible, cuánto, y dónde sigue fallando.

Lo que Anthropic dice haber corregido

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

La afirmación de Anthropic es lo bastante específica como para ponerla a prueba. Opus 5.5, según dice, pone primero la información más importante, usa menos jerga y sigue las reglas de escritura indicadas por el usuario más de cerca que los modelos Opus anteriores. El material de respaldo está reportado por el proveedor y no ha sido reproducido: pruebas internas de verificación de datos que, según Anthropic, superaron 16 de 18 intentos, frente a cero de 18 tanto para Claude Fable 5.1 como para Claude Opus 5. Las citas de clientes en el material de lanzamiento apuntan en la misma dirección —John Ruelas, de Ramp, describe una salida que «escribe como un buen colega»; Box informa de aproximadamente un 40 % menos de verbosidad en sus propias cargas de trabajo.

Hay dos cosas que conviene separar aquí. La primera es que «menos Claudish» es un modo de fallo real y nombrable, no una invención de marketing. Los profesionales llevan quejándose de la prosa condensada y mal estructurada de Claude desde las generaciones de Opus posteriores a la 4.6, y la queja es concreta: demasiado preámbulo, demasiadas reformulaciones del prompt, la costumbre de llegar al punto dos párrafos después de que el lector lo necesitaba. La segunda es que las cifras de la propia Anthropic sobre haberlo corregido son exactamente eso: cifras de la propia Anthropic. La cifra de 16 de 18 no tiene replicación independiente, y «40 % menos de verbosidad» es una medición interna de un cliente, no una metodología publicada.

El lanzamiento también incluye un cambio no relacionado con la escritura que merece la pena conocer: Opus 5.5 es el primer modelo Opus que se distribuye con salvaguardas de ciberseguridad, biología y desarrollo de LLM de frontera equivalentes a las de Claude Fable 5.1. Cuando una solicitud activa una de ellas, Anthropic afirma que redirige la solicitud de forma transparente a otro modelo en lugar de rechazarla de plano.

Los números que no son de Anthropic

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

La lectura independiente más útil sobre la afirmación relativa a la escritura proviene de Vibe Check, de Every, que ejecutó los mismos prompts en cinco modelos de frontera y puntuó los resultados con dos instrumentos estándar de legibilidad. En ese conjunto de prompts, Claude Opus 5.5 resultó ser el más legible del grupo, y la diferencia con el modelo al que reemplazó es lo revelador:

• Nivel de grado Flesch-Kincaid — Claude Opus 5.5 con 6.95, frente a Claude Opus 5 con 7.97

• Legibilidad Flesch — 68,4 para Opus 5.5, frente a 61,35 para Opus 5

• Claude Fable 5.1 — nivel de grado 7,43, Facilidad de lectura 66,09

• GPT-6 Astra — nivel de grado 7,52, facilidad de lectura 64,55

• GPT-5.6 Sol — 8,74 de nivel de grado, 56,62 de facilidad de lectura

Lee los dos instrumentos juntos, porque se mueven en direcciones opuestas y eso es lo importante: un nivel de grado más bajo y una puntuación de facilidad más alta significan ambos una prosa más sencilla. Opus 5.5 se sitúa alrededor de un grado completo por debajo de Opus 5, más o menos medio grado por debajo tanto de Claude Fable 5.1 como de GPT-6 Astra, y casi dos grados por debajo de GPT-5.6 Sol. En términos sencillos, un nivel de lectura de séptimo grado en lugar de uno de octavo grado.

Eso es una mejora real y también es una mejora limitada. Este es el conjunto de prompts de un solo medio, no un benchmark con una lista fija de tareas y una tabla de clasificación detrás. Te dice la dirección en la que se avanza y, aproximadamente, el tamaño del paso. No te dice que Opus 5.5 escriba bien en tu trabajo, y las propias notas cualitativas de Every dejan claro que el evaluador tampoco lo pensaba.

Donde todavía entierra el punto

La misma reseña que produjo las cifras de legibilidad es contundente respecto al fallo que sobrevivió a la corrección. Cuando se le pidió abrir un ensayo, Opus 5.5 tardó de 37 a 39 oraciones en cubrir lo que el reseñador cubrió en 21, y dedicó un párrafo entero a un punto que el reseñador expresó en ocho palabras. El resumen del reseñador es que el modelo «todavía entierra el punto», y la versión más mordaz de la queja es que puede diagnosticar correctamente lo que un párrafo necesita y luego producir una revisión que ignora su propio diagnóstico.

Como editor rindió peor que como escritor. En comparación con los otros modelos en tareas de edición, Opus 5.5 quedó por detrás de Claude Opus 5, GPT-5.6 Sol y GPT-6 Astra — el modelo es mejor produciendo frases legibles que reconociendo qué frase debería haber ido primero. El veredicto del reseñador cabe en una frase digna de citarse porque es lo más útil de toda la reseña: «Estoy más contento con él como colaborador que con la prosa que produce».

La lectura práctica se desprende directamente de eso. Redacta con él y hazlo con un esfuerzo alto o superior: los ajustes de esfuerzo más bajos son donde el relleno empeora más. Aporta tus propios ejemplos en lugar de pedirle que los invente. Luego, mueve tú mismo el punto al principio, o pásale el borrador a algo que lo haga. Lo que Opus 5.5 te da es una vía más rápida hacia un primer borrador limpio y un colaborador genuinamente mejor para las pasadas posteriores. No te da un editor.

Lo que cuestan las palabras extra

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

Hay una dimensión de costo en el problema de la verbosidad que las reseñas de escritura en su mayoría omiten, y va en contra de la narrativa del lanzamiento. Artificial Analysis, que realiza su propia evaluación en lugar de depender de las cifras del proveedor, sitúa a Claude Opus 5.5 en el primer puesto de 212 modelos en su Índice de Inteligencia con una puntuación de 58 — pero en el puesto 95 de 212 en verbosidad, tras haber generado 260 millones de tokens de salida en esa ejecución del Índice, frente a una mediana de 88 millones. Evaluar cada tarea del Índice de Inteligencia costó $5.98, y $8,708.20 en total.

Si se pone eso junto a la propia afirmación de eficiencia de Anthropic, ambas no coinciden de forma evidente. La postura que reporta el proveedor es que Opus 5.5 usa menos tokens y genera resultados más de un 30 % más rápido que Opus 5. La ejecución independiente de Artificial Analysis encontró que el modelo es muy verboso en comparación con sus pares. Ambas cosas pueden ser ciertas a la vez —distintas combinaciones de tareas, distintos ajustes de esfuerzo, distintas definiciones de "menos tokens"—, pero nadie debería interpretar el encuadre del lanzamiento como un hecho establecido sobre la economía de tokens. En cuanto al precio, el panorama es más claro: 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida, frente a los 5/25 dólares anteriores, con un descuento de caché del 95 % en las cifras de Artificial Analysis.

Si pagas por token de salida, la prosa verbosa no es una preferencia de estilo. Es la partida.

Ejecutándolo contra lo que ya tienes

Una nota de honestidad antes de la parte práctica: Claude Opus 5.5 no es una de nuestras rutas. No lo alojamos, y nada de lo que sigue debe interpretarse como una afirmación de que sí lo hacemos. Tú lo obtienes a través de la propia API de Anthropic y de varias plataformas de terceros.

Lo que hay hoy en OrcaRouter es el modelo al que reemplazó y el nivel superior a él. Claude Opus 5 está hoy en OrcaRouter, y Claude Fable 5.1 también, ambos al precio de lista del proveedor con un 0% de margen traspasado — lo que significa que un cambio de precio del proveedor nos llega el mismo día en lugar de cuando un revendedor se digne a hacerlo. Si estás intentando decidir si la prosa de Opus 5.5 vale el cambio, esa es una pareja útil: puedes hacer la comparación con una sola clave sin un segundo contrato ni un cambio de código, porque ambos modelos están una API para más de 200 modelos de distancia en el mismo endpoint.

La otra razón para mantener un segundo modelo en el bucle es el modo de fallo del que trata este artículo. Un modelo que entierra el punto es un modelo que quieres poder esquivar a mitad de tarea, y la conmutación automática por error existe precisamente para que una generación defectuosa no se convierta en un pipeline atascado. Si prefieres no elegir un único modelo en absoluto, el DSL de enrutamiento compone varios en una sola llamada y la fusión de modelos ejecuta un panel de modelos que responden juntos —lo cual es una forma razonable para el trabajo de edición, donde el fallo es de criterio más que de capacidad.

Quién debería actuar, y quién debería esperar

Si tu queja sobre Claude Opus 5 era que tenías que reescribir sus introducciones, Opus 5.5 es una solución real para aproximadamente un nivel de grado de ese problema, y los datos de legibilidad indican que la mejora es medible y no una mera cuestión de impresiones. Si tu queja era que tarda tres párrafos en ir al grano, nada en la evidencia independiente indica que eso haya cambiado. Son quejas diferentes, y la cobertura del lanzamiento las ha estado tratando como una sola.

Para el trabajo creativo en concreto, la historia de la sandía no es evidencia de nada, salvo de que la gente recurre a prompts pequeños, cálidos y de bajo riesgo cuando quiere tantear un modelo nuevo. Eso es algo razonable. También es exactamente el contexto en el que una tendencia a enterrar el punto es menos visible, porque nadie lee una historia de sandía en busca de la tesis. Pon el modelo frente a un documento en el que el lector necesite la conclusión en las dos primeras frases y descubrirás cuál de los dos problemas tenías en realidad.

Lo que hay que observar a continuación es si el siguiente modelo de la familia —tanto Sonnet 5.5 como Haiku 5.5 se esperan en las próximas semanas— hereda la mejora de legibilidad, y si alguien publica un número de legibilidad para edición en lugar de redacción. El número de redacción es el fácil. El número de edición es donde Opus 5.5 todavía se clasifica por detrás de tres de sus competidores.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario