
Claude Haiku 5.5 против Gemini 3.7 Flash: один из этих двух уже выведен из эксплуатации
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
В основе любого Claude Haiku 5.5 и Gemini 3.7 Flash сравнения, написанного сегодня, лежит неудобный факт: Gemini 3.7 Flash устарел. Производитель выпустил его 13 августа 2026 года, заменил на Gemini 3.8 Flash 2 сентября, а Artificial Analysis теперь хранит страницу 3.7 с пометкой об устаревании. Claude Haiku 5.5, напротив, вышел 7 октября 2026 года, и для него заявлено обязательство не выводить его из эксплуатации ранее октября 2027 года.
Это не делает сравнение бесполезным. Это меняет вопрос. Речь уже не о том, «какой из этих двух мне вызывать», — для большинства команд ответ — ни тот, ни другой, потому что линейка 3.7 была вытеснена внутри собственного семейства. А вот чем оно полезно — так это чем-то более тонким и, возможно, даже более полезным: чётким представлением о том, как быстро за три недели продвинулся уровень Flash от Google, и о том, какие части спецификации модели уровня Flash на самом деле определяют, будут ли её использовать.
Что вы всё ещё можете измерить
Обе модели были протестированы на одном и том же независимом стенде — единственном месте, где эти две вообще можно сопоставить. В Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 набирает 43,40 в конфигурации Max против 39,06 у Gemini 3.7 Flash в конфигурации High — разрыв в 4,33 пункта.
Оба вендора также публикуют собственные оценочные наборы, и они не пересекаются так, чтобы допускать прямое сравнение. Общие независимые строки — это четыре, которые Artificial Analysis провела на обоих:
• Terminal Bench 4.0 — 0.3283 у Claude Haiku 5.5 против 0.1364 у Gemini 3.7 Flash. Абсолютный разрыв в 19 пунктов и самая большая асимметрия в наборе.
• SciCode — 0,5498 против 0,5718. Gemini 3.7 Flash опережает его на 2,2 пункта.
• Humanity's Last Exam — 0,4439 против 0,4787. Gemini 3.7 Flash — на 3,5 балла.
• AutomationBench, частичный балл — 0.3541 против 0.6203. Gemini 3.7 Flash — на 27 пунктов.
Прочитайте этот набор внимательно, потому что в нём содержится интересный результат. Gemini 3.7 Flash побеждает в трёх из четырёх общих бенчмарков и всё же проигрывает по сводному индексу 4,3 балла. Индекс — это взвешенная комбинация, и веса ставят строки терминала и кода — где разрыв идёт в другую сторону с гораздо большим отрывом — выше совокупности остальных. Это не столько артефакт подсчёта баллов, сколько утверждение о том, для чего нужен индекс: он пытается предсказать, способна ли модель довести работу до конца, и в этом вопросе линейка 3.7 оказалась слабой именно так, что её вполне достойные баллы в научных бенчмарках этого не скрывали.

В чём линейка 3.7 на самом деле была плоха
Две строки рассказывают историю лучше, чем индекс.
Terminal Bench 4.0 с результатом 0,1364 — это низкий показатель, и он соседствует с 0,8577 в предыдущем поколении Terminal Bench у той же модели. Это не модель, которая стала хуже; это бенчмарк, который изменил то, что измеряет, и Gemini 3.7 Flash не совершил этот переход. Claude Haiku 5.5 на том же пересмотренном бенчмарке набирает 0,3283 — не впечатляюще в абсолютных величинах, но почти в два с половиной раза больше показателя 3.7 Flash, в строке, которая наиболее напрямую предсказывает производительность в агентном программировании.
Вторая строка — это Tau-Bench Banking, где Gemini 3.7 Flash набирает 0,3278. Надёжность использования инструментов в структурированной области — это именно то, для чего развёртывают дешёвую модель, и оценка ниже 0,33 — это тот тип числа, который тихо убивает пилотный проект. У Claude Haiku 5.5 нет опубликованного показателя Tau-Bench в той же таблице, поэтому там сравнение недоступно — честнее сказать об этом, чем строить догадки.
Gemini 3.7 Flash оставался на высоте именно в том, в чём он всегда оставался на высоте: GPQA с 0.9455 и MMMU-Pro с 0.8549 — это несомненные сильные стороны, и его мультимодальный ввод никогда не вызывал вопросов. Провал был в той части спецификации, которая решает, работает ли агентный цикл, а не в той, что выигрывает строки в таблице лидеров.
Что изменилось за три недели после этого
Gemini 3.8 Flash вышел 2 сентября 2026 года, и движение внутри собственного flash-уровня Google — более полезное сравнение для всех, кто планирует пайплайн на 2027 год.
На том же индексе Gemini 3.8 Flash показывает 40.93 против 39.06 у линейки 3.7 — прирост на 1.87 пункта за три недели. Terminal Bench 4.0 вырос с 0.1364 до 0.1970. Tau-Bench Banking вырос с 0.3278 до 0.4495. Это именно те строки, по которым модель 3.7 показала худшие результаты, что говорит о том, что преемник был нацелен именно на эту слабость, а не на общий прирост возможностей.
Цена вообще не изменилась. Gemini 3.7 Flash предлагался по цене $0.75 за входные и $3.75 за выходные за миллион токенов, а Gemini 3.8 Flash вышел с теми же $0.75 и $3.75 — идентичная тарифная сетка, привязанная к модели, которая на два пункта индекса лучше в строках, важных для агентов.

Именно тарифная сетка становится решающим фактором в этом сравнении
В сравнении с Claude Haiku 5.5 цена Google — это вся суть, и разрыв здесь огромен.
• Ввод — Claude Haiku 5.5: $0,10 за миллион токенов до 100 000, $0,50 свыше; Gemini 3.7 Flash: $0,75 фиксированно, или в семь с половиной раз больше ставки Anthropic в пределах первого уровня.
• Вывод — $0.50 для Claude Haiku 5.5 в пределах первого уровня, $2.50 сверх него; $3.75 для Gemini 3.7 Flash.
• Кэшированный ввод — $0,01 и $0,125 для Claude Haiku 5.5; $0,075 за чтение и $0,75 за запись для Gemini 3.7 Flash.
• Контекст — один миллион токенов у обоих. Максимальный вывод — 128 000 токенов у Claude Haiku 5.5 против 65 536 у Gemini 3.7 Flash.
• Входная модальность — текст и изображения для Claude Haiku 5.5; текст, изображения, речь и видео для Gemini 3.7 Flash. Это остаётся единственной строкой, где спецификация Google строго длиннее, и она пережила переход к 3.8 без изменений.
• Независимая стоимость одной завершённой задачи Index — $0,21 для Claude Haiku 5.5 против $0,93 для Gemini 3.7 Flash. Разрыв в 4,4× шире, чем можно было бы предположить исходя из соотношения входных данных 7,5:1, потому что именно модель Anthropic здесь отличается многословностью: 162 164 выходных токена на задачу Index против 58 387 у Gemini 3.7 Flash. Anthropic также сообщает о токенизаторе, общем с Claude 4.7 и более поздними версиями, который насчитывает примерно на 30% больше токенов для того же текста, что работает в ту же сторону.
• Скорость — 212,3 секунды на одну задачу Index у Gemini 3.7 Flash против 424,6 у Claude Haiku 5.5. Модель Google быстрее из этих двух вдвое, и это единственная строка в этом разделе, где более дешёвая модель не оказывается заодно и лучшей.
Что это значит, если вы выбираете сегодня
Практически это означает, что ни один из этих двух не является правильным ответом, причём по разным причинам.
Gemini 3.7 Flash устарел, стоит столько же, сколько его преемник, и уступает этому преемнику ровно в тех строках, которые нужны недорогой модели для продакшена. Рекомендовать его — всё равно что рекомендовать тарифную сетку, привязанную к вытесненной модели: преемник стоит столько же, а умеет больше. Никто, выбирая между этими двумя в октябре 2026 года, не должен остановиться на линейке 3.7, и именно неизменность её тарифной сетки решает дело.
Claude Haiku 5.5 — это актуальная модель, и в работе формата «текст на входе — текст на выходе» она дешевле по всем параметрам, выше по совокупному показателю и значительно лучше по двум строкам, которые предсказывают успех в агентных сценариях. Она также медленнее и не принимает речь или видео. Имеет ли это значение — вопрос о вашем конвейере, а не о моделях.
Третий вариант, который становится виден из разрыва в индексных пунктах между 3.8 и 3.7, заключается в том, что flash-уровень Google движется настолько быстро, что сравнение трёхнедельной давности уже стало историей. Любое прямое сравнение в рамках flash-уровня следует рассматривать как имеющее срок годности, измеряемый неделями, а не кварталами.
Бегу на той стороне, на какой бы ты ни оказался.
Gemini 3.8 Flash — преемник, а не устаревшая версия 3.7 — представлен в каталоге OrcaRouter по каталожной цене Google с наценкой 0%, так что тариф, который публикует Google, — это тот тариф, который попадает в ваш счёт, а изменения на их стороне становятся доступны у нас в тот же день. Claude Sonnet 5.5 и Claude Opus 5.5 тоже есть в каталоге, что превращает тест маршрутизации между двумя вендорами в настройку, а не в отдельный проект: один API для более чем 200 моделей, один ключ, автоматическое переключение при сбое под капотом и DSL маршрутизации, когда вы предпочитаете держать эскалацию в маршруте, а не в коде.
Сам Gemini 3.7 Flash в нашем каталоге отсутствует, и Claude Haiku 5.5 — тоже. Обе модели по-прежнему доступны через собственные API своих вендоров, а в случае Google — и через несколько сторонних платформ. Об этом стоит сказать прямо, а не оставлять читателю обнаруживать это самостоятельно.

Число, которое нужно вычесть
Дело не в разрыве в 4,33 пункта индекса. Дело в том, что Gemini 3.7 Flash победила в трёх из четырёх общих бенчмарков и всё равно проиграла по композитному показателю четыре пункта, потому что бенчмарк, которому индекс придаёт наибольший вес, был тем, по которому она набрала 0,1364. Показатели модели класса Flash по научным дисциплинам могут выглядеть нормально, пока она проваливается в том, ради чего покупают дешёвые модели.
Следствие таково: преемник исправил именно те строки в течение трёх недель, при неизменной цене. Судя по этим данным, конкурентное давление в этом сегменте определяется не ценой. Оно определяется тем, способна ли модель завершить многошаговую задачу, а это сейчас меняется быстрее, чем прайс-листы.
