
Настоящая история Claude Haiku 5.5 — это обрыв на 100K: сколько новый Haiku взимает за токены свыше 100 000
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Claude Haiku 5.5 вышел 7 октября 2026 года с заявленной ценой $0,10 за миллион входных токенов и $0,50 за миллион выходных токенов, и цифра, которую повторяли повсюду, была той, что сама Anthropic указала в анонсе: снижение на 90 процентов по сравнению со ставкой Haiku 4.5 по тем же двум позициям. Эти 90 процентов — реальны. Но они также относятся лишь к половине одного измерения счёта, и как только запрос превышает 100 000 токенов, каждая ставка в нём делает то, что освещение запуска по большей части обошло стороной. Этот материал — о той пограничной черте: во что она обходится, какие рабочие нагрузки действительно её достигают, и почему «на 90 процентов дешевле» — это утверждение о части счёта, а не о вашем счёте.
Две цены и то, где они переключаются
Anthropic публикует для модели две колонки, и переключение между ними — это единый порог по размеру запроса, а не по какой-либо настройке модели, которую вы выбираете:
• Короткий тариф, не более 100 000 токенов — $0,10 за миллион входных токенов, $0,50 за миллион выходных токенов (прайс-лист Anthropic) • Длинный тариф, свыше 100 000 токенов — $0,50 за миллион входных токенов, $2,50 за миллион выходных токенов (прайс-лист Anthropic) • Чтение из кэша — $0,01 за миллион (короткий тариф) и $0,05 за миллион (длинный тариф) • Batch API — скидка 50 процентов для каждого из столбцов и максимальная длина вывода 300 000 токенов • Стандартная максимальная длина вывода — 128 000 токенов, при этом контекстное окно составляет 1 миллион токенов в обоих тарифах

Это собственные опубликованные тарифы Anthropic, а не измеренные, и это текущий список: цены на настолько новую модель ещё не успели измениться, хотя Anthropic не связана никакими обязательствами удерживать их.
Прочитайте эти четыре числа по порядку — и форма всей конструкции становится очевидной. Каждая цена на уровне длинного контекста ровно в пять раз выше цены для короткого контекста, а порог — одни и те же 100 000 токенов для всех них сразу. Здесь нет плавной кривой, нет интерполяции, нет промежуточного диапазона — запрос на 99 000 токенов и запрос на 101 000 токенов различаются в пять раз по каждому токену в счёте, а не только по тем 2 000 токенов, что пересекли черту. Именно это и делает ситуацию обрывом, а не склоном, и именно этого не видит формулировка «на 90 процентов дешевле».

Почему порез выглядит больше, чем есть
Если сравнивать с Haiku 4.5 — а именно такое сравнение провела Anthropic, — короткий тариф представляет собой настоящее снижение на 90 % как для входных, так и для выходных данных: Haiku 4.5 стоил $1,00 и $5,00 за миллион для тех же двух столбцов. Длинный тариф — совсем другая история: $0,50 и $2,50 против тех же $1,00 и $5,00 — это сокращение на 50 %, а не на 90 %. Так что честная версия заявления о запуске такова: Claude Haiku 5.5 на 90 % дешевле Haiku 4.5 до 100 000 токенов и на 50 % дешевле свыше этого, что в точности соответствует разделению, которое даёт собственная документация Anthropic, если прочитать оба столбца, а не один. Эта единственная цифра не ошибочна; это процент для короткого тарифа, представленный без своего условия.
Есть и второй фактор, тянущий в противоположную сторону, и он интереснее, потому что его легко упустить и трудно обойти. Claude Haiku 5.5 поставляется с новым токенизатором, и собственные рекомендации Anthropic оценивают количество токенов для данного фрагмента текста примерно на 30 процентов выше, чем Haiku 4.5 выдавал для того же содержимого. То, что вы платили за токен, снизилось, а то, что вы платите за токен *вашего* текста, выросло примерно на треть относительно расчётов старой модели. Заявленный Anthropic итоговый показатель — что модель в среднем примерно на 75 процентов дешевле в эксплуатации — уже учитывает это: снижение цены по прайс-листу на 90 процентов минус примерно 30-процентная инфляция токенов даёт близкую величину на трафике с коротким контекстом; но эти два эффекта можно разделить, и их стоит разделять. Изменение цены — это изменение цены по прайс-листу, которое можно прочитать на странице; изменение токенизатора меняет, сколько единиц этой цены потребляют ваши существующие промпты, и оно проявляется в ваших собственных подсчётах токенов раньше, чем где-либо ещё.
Для рабочей нагрузки, которая уже спокойно укладывалась в менее чем 100 000 токенов на вызов, практический эффект — прямое снижение стоимости за вызов, частично компенсируемое токенизатором. А для той, которая не укладывалась, арифметика дважды работает в обратную сторону на длинной половине.
Что на самом деле находится выше 100 000 токенов
Рефлекс — отнести ценообразование для длинного контекста к категории «агентное программирование и RAG, а не мы». Это слишком поспешно, потому что порог в 100 000 токенов — это порог на один запрос, а размер одного запроса — не то же самое, что размер задачи. Несколько паттернов регулярно переходят эту черту:
• Агент, читающий кодовую базу, который удерживает большой рабочий набор в контексте на протяжении всей сессии, а не извлекает его заново на каждом шаге
• Анализ документов и договоров, где на входе — длинный PDF-файл плюс собственные инструкции и few-shot примеры, — тот тип промпта, который составлял 60 000 токенов ещё до того, как кто-либо добавил примеры
• Конвейеры приёма данных, которые объединяют множество мелких элементов в один вызов, чтобы амортизировать накладные расходы на каждый вызов, и тем самым переводят весь пакет через порог
• Чат-продукты, которые хранят полную историю переписки прямо в контексте, а не суммируют её, из-за чего запрос монотонно растёт, пока что-то не усечёт его
• Аудиовходы и входные данные в стиле транскрипции длинных видео — то есть именно тот трафик, ради которого рекламируется окно в 1 миллион токенов
Контекстное окно на 1 миллион токенов — это та часть спецификации, из-за которой об этом ценовом обрыве стоит говорить. Anthropic продаёт возможность передать модели очень большой запрос, а ценообразование устроено так, что последние 900 000 токенов такого запроса стоят в пять раз дороже, чем первые 100 000. Оба факта не случайны; просто о них объявляют в разных местах. Если длинное контекстное окно — вообще причина, по которой вы смотрите на эту модель, то колонка длинного контекста — ваша колонка, а процент запуска — чей-то ещё.
Давление, которое цена оказывает на уровень Flash
Заявленное намерение Anthropic, стоящее за моделью, — удерживать дешёвый сегмент стека с высокой пропускной способностью, и прайс-лист прямо отражает это намерение. Репортаж Bloomberg о запуске представлял это как защиту Anthropic своей позиции в нижнем ценовом сегменте от более дешёвых конкурентов с открытыми весами, а трактовка со стороны вендора шла дальше — что цена нового Haiku установлена так, чтобы со значительным отрывом обходить по цене своих прямых конкурентов.
Сравнение корректно только на коротком тарифе, где $0,10 и $0,50 агрессивно низки. Выше 100 000 токенов ставки $0,50 и $2,50 уже не подрезают ничей короткий тариф; это обычные цифры среднего уровня. Заявление вендора о «большом отрыве» относится к первому столбцу тарифной сетки, и Anthropic вправе утверждать это именно там — это точное прочтение публикуемых ею чисел. Это не утверждение о том, сколько платит рабочая нагрузка с длинным контекстом, и его не следует цитировать как таковое.
Остальная часть модели, кратко
Claude Haiku 5.5 сохраняет функции, которые были в линейках Sonnet и Opus, а не урезает их под размерный класс. Есть адаптивное мышление с уровнем усилия по умолчанию medium, и это первая модель в классе Haiku с настраиваемой шкалой усилия от Low до Max. Порог отсечения знаний — июнь 2026 года, а идентификатор модели — claude-haiku-5-5. Anthropic заявляет дату вывода из эксплуатации не ранее 7 октября 2027 года — ту же дату, что и релиз, год спустя, — а модель представлена в Amazon Bedrock, Google Cloud и Microsoft Azure наряду с собственным API Anthropic.

Что касается бенчмарков, всё в посте о запуске несёт одну и ту же метку о происхождении данных — и заслуженно: это цифры, заявленные вендором, измеренные компанией, которая продаёт модель, а независимого воспроизведения на момент написания опубликовано не было.
• GDPval-AA v2.1 — заявленный производителем результат: 1 620 у Claude Haiku 5.5 против 735 у Haiku 4.5 на том же тестовом стенде
• AA-Briefcase v1.1 — по данным производителя, 1 578 против 614 у предыдущего поколения
• OSWorld 2.1 — 72,4 процента по данным производителя против 15,7 процента
• Terminal-Bench 4.0 — по данным вендора 39.2 против 0.0
• Humanity's Last Exam — по данным разработчика 45,9 процента, или 57,4 при использовании инструментов
Именно из-за величины этих дельт их следует помечать как сомнительные, а не цитировать. Скачок с 15,7 до 72,4 в бенчмарке для OS-агентов, измеренном самим вендором модели, — это число, к которому стоит относиться осторожно, пока третья сторона не прогонит тот же тестовый стенд. Artificial Analysis опубликовала собственный индекс для модели по состоянию на начало октября 2026 года — независимый показатель 43,395, при этом 0,329 на Terminal-Bench Hard и 0,444 на HLE — и именно этот набор стоит цитировать, когда утверждение должно выдержать проверку. Цифры вендора и независимые цифры не противоречат друг другу; это просто разные тестовые стенды, а их смешение в одном предложении — так пост в блоге в конечном счёте начинает утверждать, что оценка вендора — это факт.
Примечание об инфраструктуре, поскольку у нас она есть
Anthropic продаёт Claude Haiku 5.5 через собственный API, а также через Bedrock, Google Cloud и Azure. Если вы решаете, к какому из них обратиться, или добавляете его рядом с другими моделями, которые уже есть в вашем стеке, учтите: каталожная цена вендора одинакова везде, где он продаётся, а OrcaRouter создан, чтобы передавать эту каталожную цену без наценки — поэтому изменение цены Anthropic на эту модель вступает в силу на нашей стороне в тот же день, а не с задержкой. В нашем каталоге также есть qwen/qwen3.8-flash по $0.15 и $0.47 за миллион и z-ai/glm-5.3-flash по $0.15 и $0.50 — та самая пара, которая чаще всего оказывается в слоте рядом с моделью класса Haiku, на том же ключе и в том же счёте — то, что превращает смешанный стек в один договор вместо трёх. Сам Claude Haiku 5.5 мы не обслуживаем; для этого обращайтесь напрямую к Anthropic.
Одно практическое следствие этого обрыва, если вы маршрутизируете более одной модели: граница в 100 000 токенов — это место, где запрос, который раньше был дешёвым, становится дорогим, хотя в самом запросе ничего существенно не меняется. Если ваш слой маршрутизации умеет переключаться при сбое, разумная схема — направлять трафик с длинным контекстом к той модели, которая действительно дешева выше порога, а трафик с коротким контекстом — к той, что дешева ниже него, вместо того чтобы предполагать, что заявленный тариф одной модели применим к обоим случаям.
Что вынести из запуска
Снижение цены реально и значительно — ниже 100 000 токенов. Эта модель — первый Haiku с доведённым до релиза набором функций и регулятором усилий, что для агентного использования важнее, чем цена. Изменения в бенчмарках заявлены производителем, и при каждом повторении их следует помечать именно так. А в прайс-листе есть ступенька на 100 000 токенов, которая разом умножает каждый тариф в пять раз, — и это то, что читателю вашего стека, а не читателю пресс-релиза, важнее всего узнать до того, как будет установлен бюджет токенов на следующий спринт.
Если вы хотите проверить расчёты на собственном трафике, нужно взять два числа: 95-й процентиль размера ваших запросов и вашу долю расходов на запросы свыше 100 000 токенов. Если первое ниже этой черты, к вам применяется вариант с 90 процентами, и материалы о запуске верно описывали вашу ситуацию. Если второе составляет заметную часть счёта, важное число — 50, и стоит пересчитать оценку затрат для той модели в стеке, которую вы выбрали исходя из предположения о 90.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
