
Claude Opus 5.5 e o Teste da Melancia: a Anthropic Consertou a Prosa, mas o Ponto Continua Soterrado
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Uma das amostras que mais circulou para além da semana de lançamento foi um conto sobre uma melancia. Algumas centenas de palavras, sem nenhum benchmark anexado, sem gráfico — apenas um modelo ao qual se pediu que escrevesse algo pequeno e que acertou na maior parte. É um artefato estranho para figurar perto do centro de um lançamento de ponta, mas aponta para aquilo com que o fornecedor escolheu abrir quando lançou Claude Opus 5.5 em 22 de setembro de 2026: não mais um ponto no Terminal-Bench, mas prosa. O enquadramento da empresa é que este modelo escreve menos "Claudish" — seu termo para o registro formulaico, excessivamente cheio de ressalvas e de rodeios pelo qual Claude Opus 5 foi criticado, e em relação ao qual Claude Fable 5.1, GPT-6 Astra e GPT-5.6 Sol vêm sendo medidos desde então. Portanto, a pergunta que vale a pena responder não é se a demo era encantadora. É se a prosa melhorou de forma mensurável, em quanto, e onde ainda falha.
O que a Anthropic afirma ter corrigido

A alegação da Anthropic é específica o suficiente para ser testada. O Opus 5.5, segundo ela, coloca as informações mais importantes em primeiro lugar, usa menos jargão e segue as regras de escrita declaradas pelo usuário mais de perto do que os modelos Opus anteriores. O material de apoio é relatado pelo fornecedor e não foi reproduzido: testes internos de verificação de fatos que a Anthropic diz terem sido aprovados em 16 de 18 tentativas, contra zero de 18 para ambos Claude Fable 5.1 e Claude Opus 5. Os depoimentos de clientes no material de lançamento apontam na mesma direção — John Ruelas, da Ramp, descrevendo resultados que "escrevem como um bom colega", e a Box relatando cerca de 40% menos verbosidade em suas próprias cargas de trabalho.
Duas coisas merecem ser separadas aqui. A primeira é que "menos Claudish" é um modo de falha real e nomeável, não uma invenção de marketing. Profissionais da área vêm reclamando da prosa condensada e mal estruturada do Claude desde as gerações do Opus posteriores ao 4.6, e a reclamação é específica: preâmbulo demais, reformulações demais do prompt, o hábito de chegar ao ponto dois parágrafos depois de o leitor precisar dele. A segunda é que os próprios números da Anthropic por ter corrigido isso são exatamente isso — os próprios números da Anthropic. A cifra de 16 em 18 não tem replicação independente, e "40% menos verbosidade" é uma medição interna de um cliente, não uma metodologia publicada.
O lançamento também traz uma mudança não relacionada à escrita que vale a pena conhecer: o Opus 5.5 é o primeiro modelo Opus lançado com salvaguardas de cibersegurança, biologia e desenvolvimento de LLMs de fronteira equivalentes às do Claude Fable 5.1. Quando uma solicitação aciona uma delas, a Anthropic diz que a encaminha de forma transparente para outro modelo, em vez de recusá-la de imediato.
Os números que não são da Anthropic

A leitura independente mais útil sobre a alegação de escrita vem do Vibe Check da Every, que executou os mesmos prompts em cinco modelos de fronteira e avaliou o resultado com dois instrumentos padrão de legibilidade. Nesse conjunto de prompts, Claude Opus 5.5 saiu como o mais legível do grupo — e a diferença em relação ao modelo que ele substituiu é o que importa:
• Nível de escolaridade Flesch-Kincaid — Claude Opus 5.5 com 6,95, contra Claude Opus 5 com 7,97
• Flesch Reading Ease — 68,4 para o Opus 5.5, em comparação com 61,35 para o Opus 5
• Claude Fable 5.1 — nível de escolaridade 7,43, facilidade de leitura 66,09
• GPT-6 Astra — nível de escolaridade 7,52, facilidade de leitura 64,55
• GPT-5.6 Sol — nível de escolaridade 8,74, Facilidade de Leitura 56,62
Leia os dois instrumentos em conjunto, porque eles se movem em direções opostas e é exatamente essa a questão: um nível de escolaridade mais baixo e uma pontuação de facilidade mais alta significam ambos uma prosa mais simples. O Opus 5.5 fica cerca de um ano escolar inteiro abaixo do Opus 5, aproximadamente meio ano abaixo tanto do Claude Fable 5.1 quanto do GPT-6 Astra, e quase dois anos abaixo do GPT-5.6 Sol. Em termos simples, um nível de leitura do sétimo ano em vez de um do oitavo ano.
Isso é uma melhoria real e também é uma melhoria limitada. Este é o conjunto de prompts de um único veículo, não um benchmark com uma lista fixa de tarefas e um ranking por trás. Ele indica a direção do movimento e, aproximadamente, o tamanho do passo. Não diz que o Opus 5.5 se sai bem no seu trabalho, e as próprias notas qualitativas da Every deixam claro que o avaliador também não achou isso.
Onde ainda enterra o ponto
A mesma revisão que produziu os números de legibilidade é direta sobre a falha que sobreviveu à correção. Quando solicitado a abrir um ensaio, o Opus 5.5 levou de 37 a 39 frases para cobrir o que o revisor cobriu em 21, e gastou um parágrafo inteiro em um ponto que o revisor fez em oito palavras. O resumo do revisor é que o modelo "ainda enterra o ponto" — e a versão mais contundente da reclamação é que ele consegue diagnosticar corretamente o que um parágrafo precisa e, então, produzir uma revisão que ignora seu próprio diagnóstico.
Como editor, saiu-se pior do que como escritor. Comparado com os outros modelos em tarefas de edição, o Opus 5.5 ficou atrás de Claude Opus 5, GPT-5.6 Sol e GPT-6 Astra — o modelo é melhor a produzir frases legíveis do que a reconhecer qual frase deveria ter vindo primeiro. O veredicto do revisor cabe numa frase digna de citação, porque é a coisa mais útil de toda a análise: "Estou mais satisfeito com ele como colaborador do que com a prosa que produz."
A leitura prática decorre diretamente disso. Faça o rascunho com ele, e faça o rascunho no nível de esforço alto ou acima — é nas configurações de esforço mais baixo que o enchimento fica pior. Forneça seus próprios exemplos em vez de pedir que ele os invente. Depois, mova você mesmo o ponto para o topo, ou entregue o rascunho a algo que faça isso. O que o Opus 5.5 oferece é um caminho mais rápido para um primeiro rascunho limpo e um colaborador genuinamente melhor para as passagens seguintes. Ele não lhe dá um editor.
O que custam as palavras extras

Há uma dimensão de custo no problema de verbosidade que as análises de escrita em geral ignoram, e ela vai contra a narrativa de lançamento. A Artificial Analysis, que realiza sua própria avaliação em vez de se basear em números dos fornecedores, coloca Claude Opus 5.5 em primeiro lugar entre 212 modelos em seu Intelligence Index, com uma pontuação de 58 — mas em 95º lugar entre 212 em verbosidade, tendo gerado 260 milhões de tokens de saída naquela execução do Index, em comparação com uma mediana de 88 milhões. Custou US$ 5,98 para avaliar cada tarefa do Intelligence Index, e US$ 8.708,20 no total.
Coloque isso ao lado da própria alegação de eficiência da Anthropic e as duas não concordam de forma evidente. A posição relatada pelo fornecedor é que o Opus 5.5 usa menos tokens e gera saída mais de 30% mais rápida que o Opus 5. A execução independente da Artificial Analysis constatou que o modelo é muito verboso em relação aos seus pares. Ambas podem ser verdadeiras ao mesmo tempo — combinações de tarefas diferentes, configurações de esforço diferentes, definições diferentes de "menos tokens" — mas ninguém deveria interpretar o enquadramento do lançamento como um fato estabelecido sobre economia de tokens. Em relação ao preço, o quadro é mais claro: US$ 4 por milhão de entrada e US$ 20 por milhão de saída, uma redução em relação a US$ 5/US$ 25, com um desconto de cache de 95% nos números da Artificial Analysis.
Se você está pagando por token de saída, prosa prolixa não é uma preferência de estilo. É o item da fatura.
Executando-o em relação ao que você já tem
Nota de honestidade antes da parte prática: Claude Opus 5.5 não é uma das nossas rotas. Nós não o hospedamos, e nada abaixo deve ser interpretado como uma alegação de que o fazemos. Você o obtém pela própria API da Anthropic e por várias plataformas de terceiros.
O que está no OrcaRouter hoje é o modelo que ele substituiu e o nível acima dele. O Claude Opus 5 está no OrcaRouter hoje, e o Claude Fable 5.1 também, ambos pelo preço de tabela do provedor com 0% de markup repassado — o que significa que uma mudança de preço do fornecedor chega ao nosso lado no mesmo dia, em vez de quando um revendedor resolver fazê-lo. Se você está tentando decidir se a prosa do Opus 5.5 vale a mudança, essa é uma combinação útil: você pode fazer a comparação com uma única chave, sem um segundo contrato ou alteração de código, porque ambos os modelos estão a uma API para mais de 200 modelos de distância no mesmo endpoint.
A outra razão para manter um segundo modelo no circuito é o modo de falha sobre o qual este artigo trata. Um modelo que enterra o ponto principal é um modelo que você quer poder contornar no meio da tarefa, e failover automáticoexiste exatamente para que uma geração ruim não se torne um pipeline travado. Se você preferir não escolher nenhum modelo, o DSL de roteamento compõe vários em uma única chamada, e a fusão de modelos executa um painel de modelos respondendo em conjunto — o que é um formato razoável para trabalho de edição, em que a falha é de julgamento, e não de capacidade.
Quem deve agir, e quem deve esperar
Se a sua reclamação sobre o Claude Opus 5 era que você precisava reescrever as aberturas dele, o Opus 5.5 é uma correção real para cerca de um nível escolar desse problema, e os dados de legibilidade mostram que a melhoria é mensurável, não apenas uma questão de sensação. Se a sua reclamação era que ele leva três parágrafos para chegar ao ponto, nada nas evidências independentes indica que isso mudou. Essas são reclamações diferentes, e a cobertura do lançamento vem tratando-as como uma só.
Para trabalhos criativos especificamente, a história da melancia não é evidência de nada, exceto que as pessoas recorrem a prompts pequenos, acolhedores e de baixo risco quando querem sondar um novo modelo. Isso é uma coisa razoável de se fazer. É também exatamente o cenário onde uma tendência a enterrar o ponto é menos visível, porque ninguém está lendo uma história de melancia para extrair a tese. Coloque o modelo diante de um documento em que o leitor precisa da conclusão nas duas primeiras frases e você descobrirá qual dos dois problemas você realmente tinha.
O próximo ponto a observar é se o próximo modelo da família — Sonnet 5.5 e Haiku 5.5 devem chegar nas próximas semanas — herda o ganho de legibilidade, e se alguém publica um número de legibilidade para edição em vez de redação. O número de redação é o fácil. O número de edição é onde o Opus 5.5 ainda fica atrás de três de seus concorrentes.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
