Сгенерированная титульная карточка с надписью «Claude Haiku 5.5: ценовая ступень на 100K», на которой показаны две карточки с ценами — «До 100K токенов: $0.10 за вход / $0.50 за выход» и «Свыше 100K токенов: $0.50 за вход / $2.50 за выход» — с восходящей ступенчатой графикой между ними и строкой внизу «Цены по прайс-листу Anthropic, октябрь 2026 г.» Настоящий логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Настоящая история Claude Haiku 5.5 — это обрыв на 100K: сколько новый Haiku взимает за токены свыше 100 000

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Claude Haiku 5.5 вышел 7 октября 2026 года с заявленной ценой $0,10 за миллион входных токенов и $0,50 за миллион выходных токенов, и цифра, которую повторяли повсюду, была той, что сама Anthropic указала в анонсе: снижение на 90 процентов по сравнению со ставкой Haiku 4.5 по тем же двум позициям. Эти 90 процентов — реальны. Но они также относятся лишь к половине одного измерения счёта, и как только запрос превышает 100 000 токенов, каждая ставка в нём делает то, что освещение запуска по большей части обошло стороной. Этот материал — о той пограничной черте: во что она обходится, какие рабочие нагрузки действительно её достигают, и почему «на 90 процентов дешевле» — это утверждение о части счёта, а не о вашем счёте.

Две цены и то, где они переключаются

Anthropic публикует для модели две колонки, и переключение между ними — это единый порог по размеру запроса, а не по какой-либо настройке модели, которую вы выбираете:

• Короткий тариф, не более 100 000 токенов — $0,10 за миллион входных токенов, $0,50 за миллион выходных токенов (прайс-лист A​nthropic) • Длинный тариф, свыше 100 000 токенов — $0,50 за миллион входных токенов, $2,50 за миллион выходных токенов (прайс-лист A​nthropic) • Чтение из кэша — $0,01 за миллион (короткий тариф) и $0,05 за миллион (длинный тариф) • Batch API — скидка 50 процентов для каждого из столбцов и максимальная длина вывода 300 000 токенов • Стандартная максимальная длина вывода — 128 000 токенов, при этом контекстное окно составляет 1 миллион токенов в обоих тарифах

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing Input price (under 100K): $0.10 per million, Output price (under 100K): $0.50 per million, Input price (over 100K): $0.50 per million, Output price (over 100K): $2.50 per million, Context window: 1,000,000 tokens, AA Index: 43.4, with the footer 'Anthropic list prices; AA Index per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.

Это собственные опубликованные тарифы A​nthropic, а не измеренные, и это текущий список: цены на настолько новую модель ещё не успели измениться, хотя A​nthropic не связана никакими обязательствами удерживать их.

Прочитайте эти четыре числа по порядку — и форма всей конструкции становится очевидной. Каждая цена на уровне длинного контекста ровно в пять раз выше цены для короткого контекста, а порог — одни и те же 100 000 токенов для всех них сразу. Здесь нет плавной кривой, нет интерполяции, нет промежуточного диапазона — запрос на 99 000 токенов и запрос на 101 000 токенов различаются в пять раз по каждому токену в счёте, а не только по тем 2 000 токенов, что пересекли черту. Именно это и делает ситуацию обрывом, а не склоном, и именно этого не видит формулировка «на 90 процентов дешевле».

A screenshot of Anthropic's Claude Platform Docs pricing page, showing the model pricing table and the per-model rate columns for the Claude line, captured in English.

Почему порез выглядит больше, чем есть

Если сравнивать с Haiku 4.5 — а именно такое сравнение провела Anthropic, — короткий тариф представляет собой настоящее снижение на 90 % как для входных, так и для выходных данных: Haiku 4.5 стоил $1,00 и $5,00 за миллион для тех же двух столбцов. Длинный тариф — совсем другая история: $0,50 и $2,50 против тех же $1,00 и $5,00 — это сокращение на 50 %, а не на 90 %. Так что честная версия заявления о запуске такова: Claude Haiku 5.5 на 90 % дешевле Haiku 4.5 до 100 000 токенов и на 50 % дешевле свыше этого, что в точности соответствует разделению, которое даёт собственная документация Anthropic, если прочитать оба столбца, а не один. Эта единственная цифра не ошибочна; это процент для короткого тарифа, представленный без своего условия.

Есть и второй фактор, тянущий в противоположную сторону, и он интереснее, потому что его легко упустить и трудно обойти. Claude Haiku 5.5 поставляется с новым токенизатором, и собственные рекомендации Anthropic оценивают количество токенов для данного фрагмента текста примерно на 30 процентов выше, чем Haiku 4.5 выдавал для того же содержимого. То, что вы платили за токен, снизилось, а то, что вы платите за токен *вашего* текста, выросло примерно на треть относительно расчётов старой модели. Заявленный Anthropic итоговый показатель — что модель в среднем примерно на 75 процентов дешевле в эксплуатации — уже учитывает это: снижение цены по прайс-листу на 90 процентов минус примерно 30-процентная инфляция токенов даёт близкую величину на трафике с коротким контекстом; но эти два эффекта можно разделить, и их стоит разделять. Изменение цены — это изменение цены по прайс-листу, которое можно прочитать на странице; изменение токенизатора меняет, сколько единиц этой цены потребляют ваши существующие промпты, и оно проявляется в ваших собственных подсчётах токенов раньше, чем где-либо ещё.

Для рабочей нагрузки, которая уже спокойно укладывалась в менее чем 100 000 токенов на вызов, практический эффект — прямое снижение стоимости за вызов, частично компенсируемое токенизатором. А для той, которая не укладывалась, арифметика дважды работает в обратную сторону на длинной половине.

Что на самом деле находится выше 100 000 токенов

Рефлекс — отнести ценообразование для длинного контекста к категории «агентное программирование и RAG, а не мы». Это слишком поспешно, потому что порог в 100 000 токенов — это порог на один запрос, а размер одного запроса — не то же самое, что размер задачи. Несколько паттернов регулярно переходят эту черту:

• Агент, читающий кодовую базу, который удерживает большой рабочий набор в контексте на протяжении всей сессии, а не извлекает его заново на каждом шаге

• Анализ документов и договоров, где на входе — длинный PDF-файл плюс собственные инструкции и few-shot примеры, — тот тип промпта, который составлял 60 000 токенов ещё до того, как кто-либо добавил примеры

• Конвейеры приёма данных, которые объединяют множество мелких элементов в один вызов, чтобы амортизировать накладные расходы на каждый вызов, и тем самым переводят весь пакет через порог

• Чат-продукты, которые хранят полную историю переписки прямо в контексте, а не суммируют её, из-за чего запрос монотонно растёт, пока что-то не усечёт его

• Аудиовходы и входные данные в стиле транскрипции длинных видео — то есть именно тот трафик, ради которого рекламируется окно в 1 миллион токенов

Контекстное окно на 1 миллион токенов — это та часть спецификации, из-за которой об этом ценовом обрыве стоит говорить. Anthropic продаёт возможность передать модели очень большой запрос, а ценообразование устроено так, что последние 900 000 токенов такого запроса стоят в пять раз дороже, чем первые 100 000. Оба факта не случайны; просто о них объявляют в разных местах. Если длинное контекстное окно — вообще причина, по которой вы смотрите на эту модель, то колонка длинного контекста — ваша колонка, а процент запуска — чей-то ещё.

Давление, которое цена оказывает на уровень Flash

Заявленное намерение A​nthropic, стоящее за моделью, — удерживать дешёвый сегмент стека с высокой пропускной способностью, и прайс-лист прямо отражает это намерение. Репортаж Bloomberg о запуске представлял это как защиту A​nthropic своей позиции в нижнем ценовом сегменте от более дешёвых конкурентов с открытыми весами, а трактовка со стороны вендора шла дальше — что цена нового Haiku установлена так, чтобы со значительным отрывом обходить по цене своих прямых конкурентов.

Сравнение корректно только на коротком тарифе, где $0,10 и $0,50 агрессивно низки. Выше 100 000 токенов ставки $0,50 и $2,50 уже не подрезают ничей короткий тариф; это обычные цифры среднего уровня. Заявление вендора о «большом отрыве» относится к первому столбцу тарифной сетки, и Anthropic вправе утверждать это именно там — это точное прочтение публикуемых ею чисел. Это не утверждение о том, сколько платит рабочая нагрузка с длинным контекстом, и его не следует цитировать как таковое.

Остальная часть модели, кратко

Claude Haiku 5.5 сохраняет функции, которые были в линейках Sonnet и Opus, а не урезает их под размерный класс. Есть адаптивное мышление с уровнем усилия по умолчанию medium, и это первая модель в классе Haiku с настраиваемой шкалой усилия от Low до Max. Порог отсечения знаний — июнь 2026 года, а идентификатор модели — claude-haiku-5-5. A​nthropic заявляет дату вывода из эксплуатации не ранее 7 октября 2027 года — ту же дату, что и релиз, год спустя, — а модель представлена в Amazon Bedrock, G​oogle Cloud и Microsoft Azure наряду с собственным API A​nthropic.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', with an Intelligence Index of 43.395, speed #10 of 182, and a cost comparison block showing $0.10 input.

Что касается бенчмарков, всё в посте о запуске несёт одну и ту же метку о происхождении данных — и заслуженно: это цифры, заявленные вендором, измеренные компанией, которая продаёт модель, а независимого воспроизведения на момент написания опубликовано не было.

• GDPval-AA v2.1 — заявленный производителем результат: 1 620 у Claude Haiku 5.5 против 735 у Haiku 4.5 на том же тестовом стенде

• AA-Briefcase v1.1 — по данным производителя, 1 578 против 614 у предыдущего поколения

• OSWorld 2.1 — 72,4 процента по данным производителя против 15,7 процента

• Terminal-Bench 4.0 — по данным вендора 39.2 против 0.0

• Humanity's Last Exam — по данным разработчика 45,9 процента, или 57,4 при использовании инструментов

Именно из-за величины этих дельт их следует помечать как сомнительные, а не цитировать. Скачок с 15,7 до 72,4 в бенчмарке для OS-агентов, измеренном самим вендором модели, — это число, к которому стоит относиться осторожно, пока третья сторона не прогонит тот же тестовый стенд. Artificial Analysis опубликовала собственный индекс для модели по состоянию на начало октября 2026 года — независимый показатель 43,395, при этом 0,329 на Terminal-Bench Hard и 0,444 на HLE — и именно этот набор стоит цитировать, когда утверждение должно выдержать проверку. Цифры вендора и независимые цифры не противоречат друг другу; это просто разные тестовые стенды, а их смешение в одном предложении — так пост в блоге в конечном счёте начинает утверждать, что оценка вендора — это факт.

Примечание об инфраструктуре, поскольку у нас она есть

Anthropic продаёт Claude Haiku 5.5 через собственный API, а также через Bedrock, Google Cloud и Azure. Если вы решаете, к какому из них обратиться, или добавляете его рядом с другими моделями, которые уже есть в вашем стеке, учтите: каталожная цена вендора одинакова везде, где он продаётся, а OrcaRouter создан, чтобы передавать эту каталожную цену без наценки — поэтому изменение цены Anthropic на эту модель вступает в силу на нашей стороне в тот же день, а не с задержкой. В нашем каталоге также есть qwen/qwen3.8-flash по $0.15 и $0.47 за миллион и z-ai/glm-5.3-flash по $0.15 и $0.50 — та самая пара, которая чаще всего оказывается в слоте рядом с моделью класса Haiku, на том же ключе и в том же счёте — то, что превращает смешанный стек в один договор вместо трёх. Сам Claude Haiku 5.5 мы не обслуживаем; для этого обращайтесь напрямую к Anthropic.

Одно практическое следствие этого обрыва, если вы маршрутизируете более одной модели: граница в 100 000 токенов — это место, где запрос, который раньше был дешёвым, становится дорогим, хотя в самом запросе ничего существенно не меняется. Если ваш слой маршрутизации умеет переключаться при сбое, разумная схема — направлять трафик с длинным контекстом к той модели, которая действительно дешева выше порога, а трафик с коротким контекстом — к той, что дешева ниже него, вместо того чтобы предполагать, что заявленный тариф одной модели применим к обоим случаям.

Что вынести из запуска

Снижение цены реально и значительно — ниже 100 000 токенов. Эта модель — первый Haiku с доведённым до релиза набором функций и регулятором усилий, что для агентного использования важнее, чем цена. Изменения в бенчмарках заявлены производителем, и при каждом повторении их следует помечать именно так. А в прайс-листе есть ступенька на 100 000 токенов, которая разом умножает каждый тариф в пять раз, — и это то, что читателю вашего стека, а не читателю пресс-релиза, важнее всего узнать до того, как будет установлен бюджет токенов на следующий спринт.

Если вы хотите проверить расчёты на собственном трафике, нужно взять два числа: 95-й процентиль размера ваших запросов и вашу долю расходов на запросы свыше 100 000 токенов. Если первое ниже этой черты, к вам применяется вариант с 90 процентами, и материалы о запуске верно описывали вашу ситуацию. Если второе составляет заметную часть счёта, важное число — 50, и стоит пересчитать оценку затрат для той модели в стеке, которую вы выбрали исходя из предположения о 90.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно