
Claude Sonnet 5.5: заявление о 30% экономии и шесть изменений, которые ломают код Sonnet 5
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 984 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 195 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Claude Sonnet 5.5 вышел 28 сентября 2026 года ровно по тем же тарифам, что и Claude Sonnet 5 — $2 за миллион входных токенов, $10 за миллион выходных токенов, $0.20 за миллион кэшированных чтений — тогда как анонс Anthropic начинается с «работает более чем на 30% быстрее и стоит до 30% меньше для большинства задач». Оба утверждения верны, и всё расстояние между ними — это и есть вся суть. Экономия не в тарифной сетке, потому что тарифная сетка не изменилась. Она возникает из запуска модели на более низком уровне усилий, чем требовался её предшественнице, а значит, цифра в 30% — это утверждение о рабочей точке, которую вам нужно выбрать, а не о цене, которую вы получаете по наследству. Независимые измерения делают развилку резкой: по данным Artificial Analysis, Claude Sonnet 5.5 на максимальном уровне усилий стоит $7.60 за задачу по Intelligence Index против $5.09 у Claude Sonnet 5 на максимуме — примерно на 49% больше, а не на 30% меньше. Это не противоречие цифре Anthropic. Это другой конец той же кривой, и именно там по умолчанию окажется большинство миграций, если никто не перезапустит свой перебор уровней усилий.
Два утверждения под одним номером
В публикации Anthropic это утверждение о затратах на задачу приводится в трёх местах, и каждое из них опирается на уровень усилий. Самая сильная формулировка: на Terminal-Bench 4.0 при среднем уровне усилий — значении по умолчанию в приложениях Claude — Sonnet 5.5 «намного превосходит лучший результат Sonnet 5 при менее чем одной десятой затрат на задачу». В AA-Briefcase v1.1 при среднем уровне усилий он превосходит лучший результат Sonnet 5 при затратах примерно в одну девятую. В CursorBench 4.0 при низком уровне усилий он превосходит лучший результат Sonnet 5 при затратах менее одной десятой.
Прочитайте их как набор — и механизм очевиден. У Sonnet 5.5 нижняя граница находится выше, чем верхняя граница у Sonnet 5 в нескольких оценках. Вы не получаете эти 30% за счёт меньшей цены за токен; вы получаете их потому, что больше не нуждаетесь в дорогой настройке. Anthropic говорит об этом же в документации по миграции, на странице рядом с маркетингом: "Уровни усилий перекалиброваны. Уровень усилия не даёт того же количества размышлений, что и на Claude Sonnet 5. Перезапустите ваш перебор уровней усилий, а не переносите настройку."
Эта фраза — самая операционно значимая строка, опубликованная Anthropic на этой неделе, и именно она не попала в большинство материалов о запуске.
Что опубликовала Anthropic — по данным вендора, не воспроизведено
Всё в этом разделе — это собственные измерения Anthropic из анонса Sonnet 5.5 и системной карты. Это утверждение вендора, а не независимый результат, и цепочка сносок имеет не меньшее значение, чем ключевые цифры.
• Terminal-Bench 4.0 (агентное программирование) — Sonnet 5.5 70,6% против Sonnet 5 10,3%. Это семикратный скачок в самой цитируемой строке, и именно это число чаще всего выносили в заголовки.
• FrontierCode 1.1 (Main) — Sonnet 5.5 — 52,1% при Xhigh и 46,2% при Max; Sonnet 5 — 42,4%; Claude Opus 5.5 — 54,4%; GPT-6 Sol — 49,3%. Обратите внимание на инверсию: Sonnet 5.5 набирает меньше при Max, чем при Xhigh.
• CursorBench 4.0 — 55,5 % для Sonnet 5.5 против 34,1 % для Sonnet 5 и 57,8 % для Opus 5.5. CursorBench 4.0 не публикует результаты GPT-6 Sol в открытом доступе.
• GDPval-AA v2.1 (интеллектуальная работа) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.
• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 на тех же четырёх моделях.
• Последний экзамен человечества (с инструментами) — 64,5% / 54,9% / 67,7%.
• OSWorld 2.1 (использование компьютера, частичный зачёт) — 80,1 % / 57,0 % / 81,8 %.
• Chartography (визуальное распознавание диаграмм, без инструментов) — 61.6% / 15.6% / 64.4% / 53.6%.
Три сноски заслуживают того, чтобы идти вместе с этими строками, а не под ними. Во-первых, показатель Opus 5.5 в Terminal-Bench 4.0 — 66,4% — указан при уровне усилий Xhigh, конфигурации Opus 5.5 с наивысшим результатом. Во-вторых, инверсия FrontierCode Max объясняется: при Max Sonnet 5.5 чаще запускал навык проверки кода Claude Code, который распределяет ревью между множеством субагентов, и в двух случаях это привело к тайм-ауту или правкам за пределами задачи — FrontierCode штрафует изменения вне области задачи, даже если они хороши. В-третьих, и это наименее удобно для вендора, Artificial Analysis запустила GDPval-AA и AA-Briefcase на предрелизной сборке Sonnet 5.5, которая, по словам Anthropic, содержала баг, ухудшающий ответы на запросы структурированного вывода. Anthropic ожидает, что эффект будет небольшим и занизит показатели Sonnet 5.5, и говорит, что баг исправлен. Компания также отмечает, что OpenAI недавно исправила баг понимания изображений в GPT-6 Sol, поэтому показатели GPT-6 Sol в этих строках могут ещё не отражать текущую модель.

Что независимый запуск говорит о той же модели
Artificial Analysis провела измерение Sonnet 5.5, и на её странице указана точная конфигурация: «Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)». На той же ревизии индекса — 216 моделей в классе:
• Claude Sonnet 5.5 — Индекс интеллекта 56, занимает #3 из 216. Стоимость — $7,60 за задачу индекса. Во время прогона индекса он сгенерировал 410 млн выходных токенов при медиане 88 млн.
• Claude Sonnet 5 — Индекс 38, занимает 58-е место из 216, на собственной странице с пометкой «(Adaptive Reasoning, Max Effort)». Стоимость одной задачи — $5.09. 370 млн выходных токенов.
• Claude Opus 5.5 — Индекс 58, место №1 из 216. $5,98 за задачу. 95,3 выходных токена в секунду.
• GPT-6 Sol — Индекс 48, 20-е место из 216, при прайс-листовой цене $2/$10. $1,06 за задачу, 89,8 выходных токенов в секунду.
Разрыв в Intelligence Index — 56 против 38, восемнадцать пунктов — это самое сильное независимое подтверждение в этой статье, и именно эту цифру читателю и стоит запомнить. Цифра затрат — та, что требует оговорки, и стоит сказать точно: обе точки — это конфигурации с максимальным усилием, а максимальное усилие на модели, которая рассуждает дольше, — намеренно дорогая позиция. Sonnet 5.5 потратила 410 млн токенов на прогоне индекса, тогда как Sonnet 5 потратила 370 млн, и обе значительно выше медианы в 88 млн. Модель, которая думает дольше при максимальной настройке, стоит дороже при максимальной настройке. Что эта цифра опровергает — не «дешевле за задачу», а любое её прочтение как свойства модели, а не настройки.
Artificial Analysis пока не опубликовала показатель скорости вывода для Sonnet 5.5 — на её странице для показателя «токенов вывода в секунду» указано N/A, тогда как для Sonnet 5 он составляет 78,7, а для Opus 5.5 — 95,3. Так что часть утверждения Anthropic о «30%+ быстрее» на данный момент заявлена только производителем. Относитесь к этому как к ориентировочной оценке, пока его не измерит третья сторона.

Откуда на самом деле берётся экономия и как её получить
Если вы принимаете этот механизм, инструкции по миграции пишутся сами собой, и Anthropic уже опубликовала их:
• По умолчанию начинайте с high, а не с того, что было указано в вашей конфигурации Sonnet 5. Рекомендация Anthropic — high, если только ваша рабочая нагрузка не является агентной или чувствительной к задержке.
• Агентное программирование и многошаговое использование инструментов — начинайте со среднегодля хорошо определённых задач и повышайте до высокого для более сложных или длительных.
• Чат и другая работа, чувствительная к задержкам, — начинайте со среднего или низкого. Именно в этом диапазоне и кроются утверждения о «десятой части стоимости».
Есть логичное объяснение тому, почему более низкая настройка работает, и это не маркетинг. Ранние тестировщики Anthropic сообщили, что Sonnet 5.5 объединяет вызовы инструментов в группы чаще, чем это делал Sonnet 5, что даёт меньше шагов на задачу. Замечание CodeRabbit в анонсе на удивление конкретно для цитаты с запуска: «склонность Sonnet 5 слишком часто прибегать к веб-поиску и его высокое потребление токенов исчезли в этой новой модели». Sonnet 5.5 также сохранил тот же токенизатор, что и Sonnet 5, поэтому одинаковый текст стоит одинаковое количество токенов — сокращение достигается за счёт меньшего числа ходов и меньшего числа избыточных вызовов, а не за счёт более дешёвого словаря. Это также означает, что количество токенов в ваших логах остаётся сопоставимым при обновлении, что делает измерение «до и после» простым.
Шесть изменений, которые ломают или изменяют код Sonnet 5
Это та часть релиза, которая отнимает время инженеров, и именно здесь руководство по миграции ценнее, чем график бенчмарков. Пять из шести возвращают жёсткие ошибки; шестой сбоит молча.
• thinking: {"type": "disabled"} теперь возвращает 400. Замена — thinking: {"type": "between_tools"}; она отключает предварительное мышление и является самой низкой настройкой thinking для этой модели. Она работает при низком, среднем и высоком уровне усилия, не требует бета-заголовка и доступна на всех платформах, обслуживающих Sonnet 5.5. При уровне усилия xhigh или max сам between_tools возвращает 400 — используйте adaptive thinking (не указывайте поле или отправьте {"type": "adaptive"}), если вам нужны эти уровни. Кроме того, с between_tools нельзя изменить уровень усилия в середине разговора.
• Принудительное использование инструментов не поддерживается. Если задать tool_choice как {"type": "any"} или {"type": "tool", "name": "..."}, возвращается ошибка 400 с сообщением "tool_choice: type 'tool' and 'any' are not supported for this model." Та же проверка применяется к эндпоинту подсчёта токенов. Задокументированная замена для ввода, валидного по схеме, — это tool_choice: {"type": "auto"} вместе с strict: true для инструмента либо перенос схемы в structured outputs.
• Блоки размышлений привязаны к модели и диалогу. Sonnet 5.5 читает блоки размышлений из Sonnet 5, Opus 4.8, Haiku 4.5 и более ранних моделей — но не из Opus 5, Opus 5.5 и не из каких-либо моделей Fable или Mythos. Ни одна другая модель не читает блоки Sonnet 5.5. Перенесите диалог с Sonnet 5 на 5.5 — и рассуждения сохранятся; перенесите его с Sonnet 5.5 на что-либо другое — и последующие ходы выполнятся без них. Кроме того, API теперь проверяет, не изменились ли системный промпт, список инструментов или более раннее сообщение с момента создания блока размышлений, и для аккаунтов, созданных 31 августа 2026 года или позже, возвращает 400, если это так. Ведите диалоги в режиме только добавления или отправляйте бета-заголовок thinking-binding-controls-2026-08-01 с prefix_mismatch_behavior: "drop_block".
• computer_20251124 отклоняется в Claude API и Google Cloud. Использование компьютера там требует набора инструментов computer_toolset_20260801. Amazon Bedrock по-прежнему принимает старый инструмент — расхождение между платформами, которое стоит отметить, если вы запускаете одного и того же агента на обеих.
• Некоторые пары советников больше не доступны. Исполнитель Sonnet 5.5 принимает в качестве советника Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 или сам Sonnet 5.5. Советники Opus 4.8, Opus 4.7 и Sonnet 5, которые работают с исполнителем Sonnet 5, возвращают 400 с исполнителем Sonnet 5.5. Каждый советник, которого принимает Sonnet 5.5, возвращает совет в зашифрованном виде, поэтому ваш клиент не может прочитать текст совета.
• Текст между вызовами инструментов теперь поступает внутри блоков размышлений — а при значении display по умолчанию: "omitted" он пуст. Это тот самый незаметный случай. Заметки длиннее одного-двух предложений между вызовами инструментов возвращаются как блоки размышлений с обновлениями о ходе выполнения, а не как текст. Приложение, которое передаёт этот текст своим пользователям в потоковом режиме, замолкает между вызовами инструментов — без ошибки и без записей в журналах. Исправление — либо настроить thinking.display так, чтобы текст возвращался, либо переключиться на between_tools; в этом случае текст возвращается как обычный текст.
Ещё две вещи, которых касается миграция, и ни одна из них не является ошибкой. Мониторинг отказов: Sonnet 5.5 возвращает stop_reason: "refusal" с объектом stop_details, указывающим одну из пяти областей политики — cyber, bio, frontier_llm, reasoning_extraction, general_harms, — а серверный fallback Anthropic будет повторять отказы cyber и frontier_llm на Sonnet 5, но не остальные три. И модель безопасности действительно изменилась: Sonnet 5.5 — первая модель Sonnet, поставляемая с мерами киберзащиты и fallback-ами, как у класса Opus, а это значит, что запросы по кибербезопасности с повышенным риском заметно переключаются на Sonnet 5; это также первый Sonnet с классификаторами против извлечения рассуждений. Если ценностное предложение вашего продукта — это инструмент безопасности, проверьте эту границу, прежде чем выпускать замену модели.
Цены и то, что сегодня действительно входит в наш маршрут
Тарифная карта не изменилась по сравнению с Sonnet 5, и её полная опубликованная структура достаточно коротка, чтобы изложить её прямо:
• Ввод — $2.00 за миллион токенов. Вывод — $10.00 за миллион токенов. Оба показателя идентичны Sonnet 5, что подтверждено на странице моделей Anthropic для Sonnet 5.5.
• Чтение из кэша — $0,20 за миллион, скидка 90% на входные данные; запись в кэш на 5 минут — $2,50 за миллион; запись в кэш на 1 час — $4,00 за миллион. Минимальный размер кэшируемого промпта составляет 512 токенов в Sonnet 5.5, тогда как в Sonnet 5 это было 1 024.
• Batch — скидка 50% в обоих направлениях, то есть $1.00 / $5.00 за миллион токенов. В Message Batches API объём вывода может достигать 300 тыс. токенов при использовании бета-заголовка output-300k-2026-03-24.
• В сравнении с Opus 5.5 — Sonnet 5.5 стоит ровно вдвое меньше: $2/$10 против $4/$20, при этом запись в кэш — вдвое дешевле, а чтение из кэша — столько же, $0.20. Именно эта миграция окупается, и Anthropic говорит об этом прямо: две модели лучше всего дополняют друг друга, когда Sonnet работает с меньшими усилиями, а Opus «остаётся явно сильнее в сложной, открытой работе, требующей устойчивого суждения».
• Контекст и вывод — контекст на 1M токенов, максимальный вывод 128K, адаптивное мышление включено по умолчанию, уровень усилий по умолчанию — высокий, надёжная дата отсечения знаний — июнь 2026, доступно нулевое хранение данных, вывод из эксплуатации не ранее 28 сентября 2027 г.
Одно замечание о доступности, которое мы предпочли бы заявить прямо, а не подразумевать: по состоянию на 29 сентября 2026 года Claude Sonnet 5.5 в нашем каталоге моделей отсутствует.Его предшественник anthropic/claude-sonnet-5и его более крупный собрат anthropic/claude-opus-5.5там присутствуют, и тарифы на нашей стороне — это тарифы самого провайдера: $2.00 на вход, $10.00 на выход, $0.20 за чтение кэша, $2.50 за запись в кэш для Sonnet 5, без какой-либо наценки, так что изменение цены поставщиком отражается здесь в тот же день, когда оно вступает в силу, а не в следующем расчётном периоде. Именно это последнее свойство и делает чтение тарифной карты полезным, а не декоративным.

Что вы можете сделать с этим сегодня
Честная последовательность действий для команды, которая уже использует Claude Sonnet 5 в продакшене, состоит из трёх шагов, и ни один из них — не «заменить строку модели и смотреть на граф».
Во-первых, заново запустите прогон по уровням усилий. Если вы перенесли высокую или максимальную настройку из Sonnet 5, потому что именно этого требовала ваша планка качества, теперь вы платите за рассуждения, которые вам больше не нужно покупать. Независимые показатели стоимости на задачу говорят, что верхняя ступень стала дороже, а не дешевле, и все собственные заявления поставщика о стоимости описывают середину этой лестницы. Во-вторых, исправьте два пути ошибок до развёртывания — отключённое мышление и принудительное использование инструментов — потому что оба дают сбой громко и сразу, и это хорошая новость. В-третьих, следите за путём повествования, потому что он даёт сбой молча.
Если модели ещё нет на используемом вами маршруте, способ оценить её с низким риском — запустить её параллельно, а не вместо: оставьте Sonnet 5 закреплённым в качестве резервного варианта на том же ключе, чтобы отказ, тайм-аут или неудачная оценка отправляли запрос к модели, которой вы уже доверяете, а автоматическое переключение при сбое замыкало цикл без второй интеграции. В этом и состоит весь аргумент в пользу оценки непроверенной модели за одним эндпоинтом, а не перед вашими пользователями, — и здесь он применим вдвойне, потому что категории отказов Sonnet 5.5 новы, а калибровка усилий явно не такая, как у её предшественника. Когда вы будете готовы сменить модель по умолчанию, список на одном ключе насчитывает более 200 моделей, что превращает сравнение в изменение конфигурации, а не во второй контракт.
Что посмотреть
Три вещи разрешат открытые вопросы в этом материале, и ни одна из них ещё не произошла.
Первым идёт независимое измерение скорости вывода. Anthropic заявляет о более чем 30% преимуществе в скорости над Sonnet 5; Artificial Analysis не опубликовала показатель для Sonnet 5.5, и это утверждение играет реальную роль в аргументе о стоимости, поскольку более быстрая модель выполняет ту же задачу за меньшее реальное время и часто меньшим числом токенов. Второй — Claude Haiku 5.5: Anthropic говорит, что он появится «в ближайшие недели», и он будет располагаться ниже Sonnet 5.5, что меняет расклад для сегмента высоконагруженных чатов, где средний и низкий уровень усилий уже делают Sonnet 5.5 конкурентоспособным. Третий — этап исправления: Artificial Analysis запустила GDPval-AA и AA-Briefcase на предрелизной сборке с ошибкой структурированного вывода, Anthropic ожидает, что эти оценки занижают показатели модели, и ни один из показателей не был пересчитан. Если они вырастут, разрыв с Opus 5.5 в интеллектуальной работе ещё больше сократится, а аргумент о «вдвое меньшей цене» станет сильнее.
До тех пор защитимая формулировка остаётся уже, чем анонс, и полезнее, чем график бенчмарков. Claude Sonnet 5.5 даёт прирост интеллекта на восемнадцать пунктов по сравнению с Sonnet 5 в независимом индексе, при тех же опубликованных тарифах, с реальной и измеримой экономией для любого, кто опускается на более низкую ступень усилий, — и реальным и измеримым штрафом для любого, кто этого не делает.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
