
Claude Haiku 5.5 против Gemini 3.5 Flash-Lite: дешевле за токен, дороже за ответ
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Claude Haiku 5.5 стоит $0.10 за миллион входных токенов и $0.50 за миллион выходных токенов. Gemini 3.5 Flash-Lite стоит $0.30 и $2.50 по тем же двум тарифам. Модель Anthropic стоит втрое дешевле на входе и в пять раз дешевле на выходе, и она набирает 43.40 против 22.2 в Artificial Analysis Intelligence Index v4.3.2 — разрыв более чем в двадцать пунктов в области, где десять — это скачок на поколение. По тарифной сетке это не близкое сравнение, и по возможностям это тоже не близкое сравнение.
Если смотреть на счет, сравнение получается близким, и перевес оказывается на другой стороне. Поместите обе модели в один и тот же независимый рейтинг и выставляйте счет каждой за выполненную задачу, а не за токен, и Gemini 3.5 Flash-Lite выходит дешевле в расчете на ответ. Artificial Analysis оценивает Claude Haiku 5.5 в $0,21 за задачу Intelligence Index, а Gemini 3.5 Flash-Lite — в $0,1235 — преимущество 1,7 к одному для модели, которая платит в пять раз больше за каждый токен, который генерирует.
Эта инверсия — вся суть этого сравнения. Claude Haiku 5.5 заменяет самый дешёвый уровень, который Anthropic когда-либо выпускала, и обходит всё рядом с ним в общей таблице. Gemini 3.5 Flash-Lite был выпущен 21 июля 2026 года и с лета остаётся выгодным выбором в этом сегменте. Вопрос, который на самом деле стоит перед покупателем, не в том, какая из них лучше, потому что ответ на это уже решён. А в том, какую поставить перед запросом, который должен обойтись дёшево.
Всё ниже указано за миллион токенов в долларах США. Прейскурантные цены — это опубликованные самими поставщиками тарифы. Независимые оценки, показатели стоимости за задачу и измерения скорости, приписываемые Artificial Analysis, принадлежат этому оценщику. Показатели задержки для Gemini 3.5 Flash-Lite взяты из нашего собственного измеренного трафика. Там, где число берётся из имеющейся у нас записи о модели, а не считывается со страницы оценщика в тот день, мы рассматривали источником этого оценщика, а не себя.
Наклейка и счёт не совпадают.
Разрыв в стоимости за задачу не объясняется тарифной сеткой, и причину его существования стоит знать, прежде чем хоть одна из моделей приблизится к продакшену.
Claude Haiku 5.5 многословна, и оценщик прямо так и говорит. Запустив Intelligence Index, Artificial Analysis зафиксировала 440 миллионов выходных токенов от модели при медиане в 100 миллионов по всем моделям и отметила её как очень многословную. Размышления тарифицируются как выходные токены, режим размышлений включён по умолчанию с регулятором усилий, который стартует со среднего уровня, а низкая цена входных токенов не помогает рабочей нагрузке, счёт за которую в основном формируется выходными токенами.
Gemini 3.5 Flash-Lite тоже не отличается лаконичностью, но он измеримо дешевле в расчёте на задание. Та же таблица фиксирует для него 17 507 выходных токенов на завершённую задачу индексации — 10 405 из них рассуждения и 7 102 ответ. Сопоставьте это с объёмом токенов модели Anthropic, и арифметика разрешается: пятикратное преимущество в стоимости выходных токенов частично нивелируется моделью, которая выдаёт более объёмный ответ, а на уровне задачи сохраняется небольшое отставание, а не большое преимущество.
Есть и второй, более тихий эффект, действующий так же. В документации Anthropic сказано, что Claude Haiku 5.5 использует токенизатор, общий с Claude 4.7 и более поздними версиями, поэтому один и тот же текст насчитывает примерно на 30% больше токенов, чем на модели, которую он заменяет. Ставка снизилась в три раза по сравнению с тарифным уровнем Google. Число токенов не уменьшилось, а на том же тексте выросло.
Обе модели — по значимым показателям
Кэшированные тарифы и прейскурантные цены из собственной документации Anthropic и Google; независимые показатели, приписываемые Artificial Analysis; актуальная задержка из нашего собственного семидневного окна трафика. Кэшировано 2026-10-08.

• Ввод — Claude Haiku 5.5: $0.10 до 100 000 токенов и $0.50 свыше; Gemini 3.5 Flash-Lite: $0.30 фиксированно в окне 1 048 576 токенов.
• Вывод — Claude Haiku 5.5: $0.50 до 100 000 токенов и $2.50 свыше; Gemini 3.5 Flash-Lite: $2.50 фиксированно.
• Кэшированный ввод — Claude Haiku 5.5: $0,01 до 100 000 токенов и $0,05 свыше; Gemini 3.5 Flash-Lite: $0,03. Запись в кэш — $0,125 и $0,625 за миллион токенов для Claude Haiku 5.5.
• Контекст и вывод — по миллиону токенов для каждого. Максимальный объём вывода — 128 000 токенов для Haiku 5.5 против 65 536 для Gemini 3.5 Flash-Lite, так что потолок Anthropic примерно вдвое выше.
• Входные модальности — текст и изображения для Claude Haiku 5.5; текст, изображения, видео, аудио и файлы для Gemini 3.5 Flash-Lite. Оба возвращают текст.
• Независимая оценка — 43,40 у Claude Haiku 5.5 (Max), второе место среди 182 моделей в Intelligence Index v4.3.2, против 22,2 у Gemini 3.5 Flash-Lite — девяносто шестое место из 147 и тридцать четвёртый процентиль в этом рейтинге.
• Независимая стоимость за задачу — $0,21 против $0,1235 на той же плате.
• Пропускная способность — 241,9 выходных токенов в секунду, измеренная Artificial Analysis для Claude Haiku 5.5, против 280,0 для Gemini 3.5 Flash-Lite, измеренных на нашей собственной площадке за последние семь дней. Это два разных измерительных стенда, а не один, поэтому воспринимайте их как порядок величины, а не как гонку.
Двадцать одна точка, и из чего они сделаны
Разрыв в двадцать один пункт по индексу, значения которого достигают шестидесяти с лишним, — это не просто отрыв. Это разница между моделью, способной выдержать агентный цикл, и моделью, которой следует поручать один чётко заданный вызов.
Эти два вендора не измеряют тестовые стенды друг друга, поэтому их собственные наборы тестов невозможно сопоставить напрямую. Anthropic публикует результаты GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 и FrontierCode для Claude Haiku 5.5; Google публикует собственный набор для уровня Flash-Lite; ни один из них не запускал тесты другого. Единственное доступное сравнение в одинаковых условиях — это независимый рейтинг, и там модель Anthropic опережает с отрывом, который отнюдь не мал.
Суббаллы оценщика для Gemini 3.5 Flash-Lite зафиксировали облик этого уровня. Он показывает 83,8% на GPQA Diamond и 54,2% на SWE-Bench Pro, 54% на Terminal-bench 2.1, 41,3% на SciCode и 39,2% на MLE-Bench, а также 18,8% на Humanity's Last Exam. Это цифры компетентного, дешёвого универсального уровня — сильного в вопросах на знание, но заметно отстающего в самых сложных оценках рассуждений и исследований. Claude Haiku 5.5 с 43,40 по композитному показателю находится в совершенно другой весовой категории, и практический вывод таков: работа, требующая многошагового планирования на длительном горизонте, — вовсе не задача для уровня Google.
Миллион токенов контекстного окна и 65 536 — на ответ
Два контекстных окна имеют одинаковый размер, и это не один и тот же продукт.
Длинный контекст у Gemini 3.5 Flash-Lite ухудшается с расстоянием так, что это стоит оценить, прежде чем доверять. На GDM-MRCR v2, оценке извлечения с восемью иглами, он в среднем показывает 72,2%, когда иглы находятся в пределах 128 000 токенов, и 21,3% на точечном варианте с миллионом токенов. Его показатель Long-Context Recall составляет 76%, а CharXiv Reasoning — 74,5% без инструментов и 76,5% с ними. Окно в миллион токенов — это реальная возможность; надёжное извлечение с его дальнего конца — возможность меньшая, и два числа выше — это расстояние между ними. Окно модели Claude не измерялось таким же образом на том же стенде, поэтому для него нет эквивалентного показателя, и эта статья не будет его придумывать.
Потолки вывода — это более непосредственно полезное различие. Claude Haiku 5.5 выдаст 128 000 токенов в одном ответе; Gemini 3.5 Flash-Lite останавливается на 65 536. Если нужный вам артефакт — это длинный файл, полная миграция, сгенерированный набор тестов или переписывание в масштабе транскрипта, одна из этих двух моделей может создать его за один вызов, а другая — нет, — а задача, разбитая на два вызова, стоит более чем вдвое дороже одного вызова, потому что общий префикс отправляется дважды.

Аудио и видео — это не вопрос цены
Gemini 3.5 Flash-Lite принимает видео, аудио и файлы по той же цене, что и текст. Claude Haiku 5.5 принимает текст и изображения.
Для пайплайна, который принимает на вход записи звонков, видеозахват экрана или материалы видеонаблюдения, важная разница в возможностях — не двадцать один балл в индексе. Она в том, что одна из этих моделей принимает входные данные напрямую, а перед другой нужен этап транскрипции или извлечения кадров — вторая модель, второй счёт и новый режим отказа между источником и ответом. Команды в таком положении выбирают не между двумя дешёвыми уровнями. Они выбирают между одной моделью и пайплайном.
Обратное справедливо для изображений и документов. Обе модели читают изображения нативно, и Claude Haiku 5.5 делает это с показателем 43,40 по композитной оценке, так что задача извлечения данных из изображений страниц или понимания диаграмм, в которой нет аудио, судя по цифрам, относится к стороне Anthropic, а не к аргументу о модальности.
Запуск одного из двух отсюда
Gemini 3.5 Flash-Lite представлен в каталоге OrcaRouter по цене из прайс-листа Google с наценкой 0%, а значит, тариф провайдера передаётся напрямую, а не усредняется, и изменение тарифной карты Google отражается в вашем счёте в тот же день, когда оно появляется у них. Это один ключ и один SDK для уровня Google наряду с Claude Sonnet 5.5 и Claude Opus 5.5, которые тоже есть в каталоге, — так что A/B-сравнение плеча Google Flash-Lite и плеча Anthropic — это уже конфигурация, а не проект интеграции. В основе лежит автоматическое переключение при сбоях, поэтому ни одно из плеч не является единой точкой отказа, и DSL маршрутизации позволит выразить эскалацию прямо в маршруте, если именно там должна находиться эта логика.
Профиль задержки этого участка основан на наших собственных измерениях, а не на данных поставщика. За последние семь дней живого трафика Gemini 3.5 Flash-Lite удерживал p50 на уровне 2 426 миллисекунд и p95 на уровне 8 600 миллисекунд при 280 выходных токенах в секунду, с долей ошибок 0,313%. Рассматривайте это как скользящее окно, а не как обещание: показатели меняются вместе с трафиком и условиями у поставщика, и цифра, которой стоит доверять для конкретного пайплайна, — та, которую вы измерите сами через неделю.

Claude Haiku 5.5 отсутствует в каталоге. Он вышел 7 октября 2026 года — за день до того, как это было написано, — и сегодня он не маршрутизируется через нас, поэтому сторона Anthropic в этом сравнении сейчас доступна только у Anthropic. Сказать это прямо лучше, чем оставлять подразумеваемым. Разрыв между выпуском модели и возможностью вызывать модель через нас — это нормально, это не обещание о том, когда он закроется, и читателю, планирующему миграцию, следует планировать исходя из календаря, который он видит, а не из того, который он предпочёл бы.
Какой именно и для кого?
Если работа — это текст на входе и текст на выходе, если промпты укладываются в 100 000 токенов, и если задача требует многошагового планирования или агентов с длинным горизонтом, то Claude Haiku 5.5 — более сильная модель с преимуществом в двадцать один пункт и более дешёвая по стоимости за токен в три–пять раз. Планируйте бюджет исходя из стоимости за задачу, а не из тарифной сетки, ожидайте примерно $0.21 для работы того типа, который измеряет независимый совет, и пересчитывайте свои промпты, прежде чем что-либо прогнозировать, потому что изменение токенизатора само по себе меняет подсчёт примерно на тридцать процентов.
Если работа короткая, высокообъёмная и по форме похожа на ответ — тег, категория, извлечение, решение по защитному ограничению — то арифметика говорит в пользу Gemini 3.5 Flash-Lite, и делает это по прозаической причине. Счёт за вызов, который генерирует очень мало, в основном складывается из входных данных; два тарифа на входные данные — $0.30 против $0.10, а гораздо меньший объём задачи у модели Google означает, что более дешёвый тариф выигрывает по готовой работе, хотя и проигрывает по ценнику. Добавьте видео, аудио или файл на вход — и выбор перестаёт быть связанным с ценой вообще.
То, что на самом деле доказывает это сопоставление, — нечто более узкое, чем «новый Haiku дёшев». Оно доказывает, что заявленная ставка на дешёвом тарифе — плохой ориентир для понимания того, во сколько этот тариф вам обойдётся, и что модель, которая на странице с ценами выглядит в три раза дороже, может выставить вам меньший счёт. Как бы вы ни решили, измеряйте токены, которые вы выдаёте, а не те, которые отправляете, потому что на обеих этих моделях именно по этому счётчику на самом деле и выставляется счёт.
