Титульная карточка hero с заголовком «Claude Opus 5.5 и арбузный тест», подзаголовком «Самый читаемый Claude на сегодня — и он всё ещё прячет главное», с тремя бейджами с надписями: Flesch-Kincaid 6.95, Reading Ease 68.4 и 22 сентября 2026 г., и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Claude Opus 5.5 и Арбузный тест: Anthropic исправила прозу, но суть по-прежнему закопана

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Один из образцов, который после недели запуска разошёлся дальше всех, — короткий рассказ про арбуз. Несколько сотен слов, без привязанного бенчмарка, без графика — просто модель, которую попросили написать что-то небольшое, и она в основном справилась. Это странный артефакт, чтобы оказаться рядом с центром флагманского релиза, но он указывает на то, что вендор решил вынести на первый план, когда он выпустил Claude Opus 5.5 22 сентября 2026 года: не очередную точку на Terminal-Bench, а прозу. Компания преподносит это так: эта модель пишет меньше «Claudish» — её обозначение для шаблонного, перегруженного оговорками, пустопорожнего регистра, из-за которого Claude Opus 5 вызывал жалобы, и с которым Claude Fable 5.1, GPT-6 Astra и GPT-5.6 Sol с тех пор сравнивали. Так что вопрос, на который стоит ответить, не в том, был ли этот образец обаятельным. А в том, стала ли проза измеримо лучше, насколько и где она всё ещё не справляется.

Что, по словам Anthropic, было исправлено

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

Заявление Anthropic достаточно конкретно, чтобы его можно было проверить. Opus 5.5, как утверждается, выносит самую важную информацию на первое место, использует меньше жаргона и точнее следует заданным пользователем правилам письма, чем предыдущие модели Opus. Подкрепляющие материалы исходят от производителя и не воспроизведены: это внутренние тесты на проверку фактов, которые, по словам Anthropic, прошли 16 из 18 попыток, тогда как у обеих Claude Fable 5.1 и Claude Opus 5 — ноль из 18. Отзывы клиентов в материалах запуска указывают в том же направлении — Джон Руэлас из Ramp описывает результат, который «пишет как хороший коллега», а Box сообщает, что многословность на его собственных рабочих нагрузках снизилась примерно на 40%.

Здесь стоит разделить две вещи. Во-первых, «менее Claude-подобный» — это реальный режим отказа, имеющий название, а не маркетинговая выдумка. Практики жалуются на сжатую, плохо структурированную прозу Claude ещё со времён поколений Opus после 4.6, и жалоба вполне конкретна: слишком много вступлений, слишком много повторов запроса, привычка переходить к сути двумя абзацами позже, чем это было нужно читателю. Во-вторых, собственные цифры Anthropic о том, что это исправлено, — это ровно то и есть: собственные цифры Anthropic. Показатель 16 из 18 не имеет независимого воспроизведения, а «на 40% меньше многословия» — это внутреннее измерение заказчика, а не опубликованная методология.

В релизе также есть не связанное с написанием изменение, о котором стоит знать: Opus 5.5 — первая модель Opus, поставляемая с мерами защиты в области кибербезопасности, биологии и разработки передовых LLM, соответствующими тем, что действуют в Claude Fable 5.1. Когда запрос активирует одну из них, Anthropic заявляет, что прозрачно перенаправляет запрос другой модели, а не отказывает сразу.

Цифры, которые не принадлежат Anthropic

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

Самая полезная независимая оценка утверждения о качестве письма — от Every's Vibe Check, который прогнал одни и те же промпты через пять передовых моделей и оценил результаты с помощью двух стандартных инструментов оценки читабельности. На этом наборе промптов, Claude Opus 5.5 оказался самым читабельным в группе — и разрыв с моделью, которую он заменил, — вот что главное:

• Уровень сложности по шкале Флеша — Кинкейда — 6,95 у Claude Opus 5.5 против 7,97 у Claude Opus 5

• Индекс удобочитаемости Флеша — 68,4 для Opus 5.5 против 61,35 для Opus 5

• Claude Fable 5.1 — уровень 7,43 класса, 66,09 лёгкость чтения

• GPT-6 Astra — уровень чтения 7,52 класса, лёгкость чтения 64,55

• GPT-5.6 Sol — 8,74 уровень сложности, 56,62 лёгкость чтения

Читайте эти два показателя вместе, потому что они движутся в противоположных направлениях, и в этом суть: более низкий уровень класса и более высокий балл лёгкости чтения оба означают более простой текст. Opus 5.5 оказывается примерно на целый класс ниже Opus 5, примерно на полкласса ниже и Claude Fable 5.1, и GPT-6 Astra, и почти на два класса ниже GPT-5.6 Sol. Проще говоря, уровень чтения седьмого класса вместо восьмого.

Это настоящее улучшение, и при этом узкое. Это набор промптов одного издания, а не бенчмарк с фиксированным списком задач и таблицей лидеров за ним. Он указывает направление движения и примерный размер шага. Но он не говорит о том, что Opus 5.5 хорошо справляется с вашей работой, и собственные качественные заметки Every ясно показывают, что рецензент тоже так не считал.

Где это всё ещё хоронит главную мысль

Тот же обзор, из которого взялись показатели удобочитаемости, прямо говорит о недостатке, сохранившемся после исправления. Когда Opus 5.5 попросили начать эссе, ему потребовалось от 37 до 39 предложений, чтобы охватить то, что рецензент уложил в 21, и он посвятил целый абзац мысли, которую рецензент выразил в восьми словах. Резюме рецензента таково: модель «всё ещё хоронит главную мысль», — а более резкая формулировка претензии состоит в том, что она может верно определить, что нужно абзацу, а затем выдать правку, которая игнорирует собственный диагноз.

В роли редактора она выступила хуже, чем в роли писателя. В рейтинге по задачам редактирования среди других моделей Opus 5.5 оказалась позади Claude Opus 5, GPT-5.6 Sol и GPT-6 Astra — эта модель лучше создаёт удобочитаемые предложения, чем распознаёт, какое предложение должно было стоять первым. Вердикт рецензента сводится к фразе, которую стоит процитировать, потому что это самое полезное во всём обзоре: «Мне больше нравится работать с ней как с соавтором, чем с прозой, которую она создаёт».

Практический вывод напрямую вытекает из этого. Создавайте с его помощью черновик и делайте это на высоком уровне усилий или выше — именно на более низких настройках усилий текст раздувается сильнее всего. Давайте свои примеры, а не просите его их придумывать. Затем сами перенесите главную мысль в начало — или передайте черновик тому, кто это сделает. Opus 5.5 даёт вам более быстрый путь к чистому первому черновику и по-настоящему лучшего соавтора для последующих проходов. Но редактора он вам не даёт.

Чего стоят лишние слова

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

У проблемы многословности есть стоимостное измерение, которое обзоры, посвящённые письму, в основном обходят стороной, и оно идёт вразрез с нарративом запуска. Claude Opus 5.5занимает первое место из 212 моделей в Intelligence Index с оценкой 58 по версии Artificial Analysis, которая проводит собственную оценку, а не полагается на данные вендора, — но лишь 95-е место из 212 по многословности, сгенерировав за этот прогон Index 260 миллионов выходных токенов против медианы в 88 миллионов. Оценка одной задачи Intelligence Index стоила $5.98, а всего — $8,708.20.

Сопоставьте это с собственным заявлением Anthropic об эффективности, и эти два утверждения не будут очевидно согласовываться. Производитель утверждает, что Opus 5.5 использует меньше токенов и генерирует вывод более чем на 30% быстрее, чем Opus 5. Независимое тестирование Artificial Analysis показало, что модель очень многословна по сравнению с аналогами. Оба утверждения могут быть верны одновременно — разные наборы задач, разные настройки усилий, разные определения «меньше токенов» — но никто не должен воспринимать подачу при запуске как установленный факт об экономии токенов. Что касается цены, картина яснее: $4 за миллион входных и $20 за миллион выходных, по сравнению с $5/$25, со скидкой 95% на кэш в данных Artificial Analysis.

Если вы платите за каждый выходной токен, многословность — не вопрос стиля. Это отдельная статья расходов.

Запустить его на том, что у вас уже есть

Одна честная оговорка перед практической частью: Claude Opus 5.5 не входит в число наших маршрутов. Мы не размещаем его у себя, и ничто ниже не следует воспринимать как утверждение, что мы это делаем. Вы получаете его через собственный API Anthropic и несколько сторонних платформ.

То, что сегодня представлено на OrcaRouter, — это модель, которую он заменил, и уровень выше неё. Claude Opus 5 сегодня доступен на OrcaRouter, и Claude Fable 5.1 тоже — оба по прайс-листовой цене провайдера с 0% наценки, передаваемой напрямую, — а значит, изменение цены поставщиком отражается на нашей стороне в тот же день, а не тогда, когда до этого дойдут руки у реселлера. Если вы решаете, стоит ли переход ради текстов Opus 5.5, это полезная пара: сравнение можно провести по одному ключу, без второго договора и без изменений в коде, потому что обе модели находятся в одном API для 200+ моделей на одном и том же эндпоинте.

Другая причина держать вторую модель в контуре — это режим отказа, которому посвящена эта статья. Модель, которая скрывает суть, — это модель, которую вы хотите иметь возможность обойти в середине задачи, и автоматическое переключение при сбое существует именно для того, чтобы плохая генерация не превратилась в застопорившийся пайплайн. Если вы предпочли бы вообще не выбирать одну модель, DSL маршрутизации объединяет несколько в один вызов, а объединение моделей запускает панель моделей, отвечающих вместе, — что является разумной схемой для редакторской работы, где неудача связана с суждением, а не со способностями.

Кто должен действовать, а кто должен ждать

Если ваша претензия к Claude Opus 5 заключалась в том, что его вступления приходилось переписывать, то Opus 5.5 — это реальное исправление примерно на один уровень читабельности в этой проблеме, и данные о читабельности говорят, что улучшение измеримо, а не просто ощущается. Если ваша претензия была в том, что до сути нужно добираться три абзаца, ничто в независимых данных не указывает на то, что это изменилось. Это разные претензии, а материалы о запуске трактовали их как одну.

Если говорить именно о творческой работе, история про арбуз ничего не доказывает — кроме того, что люди тянутся к маленьким, тёплым, ни к чему не обязывающим запросам, когда хотят прощупать новую модель. Это разумно. И это ещё и именно та ситуация, где склонность закапывать главную мысль заметна меньше всего, потому что никто не читает историю про арбуз ради тезиса. Поставьте модель перед документом, где читателю нужен вывод в первых двух предложениях, и вы узнаете, какая из двух проблем у вас на самом деле была.

Дальше стоит следить за тем, унаследует ли следующая модель в семействе — Sonnet 5.5 и Haiku 5.5 ожидаются в ближайшие недели — прирост читаемости, и опубликует ли кто-нибудь показатель читаемости для редактирования, а не для написания черновиков. Показатель для черновиков — лёгкий. Показатель для редактирования — вот где Opus 5.5 всё ещё уступает трём из своих конкурентов.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно