Сгенерированная главная карточка для 'Claude Haiku 5.5 vs Gemma 4 12B' с двумя панелями, разделёнными тонкой линией: слева с надписью 'Claude Haiku 5.5', содержащая 'Индекс 43' и 'Проприетарный API', справа с надписью 'Gemma 4 12B', содержащая 'Индекс 14' и 'веса Apache 2.0'. В нижнем колонтитуле написано 'Оценки по данным Artificial Analysis.' Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Claude Haiku 5.5 против Gemma 4 12B: модель с весами, которые можно подержать в руках, против вендорского API

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Claude Haiku 5.5 и Gemma 4 12B конкурируют за одну и ту же нишу; быстрее всего это видно по одной строке: одна из них поставляется с открытыми весами, которые можно скачать, квантовать и запускать на собственном оборудовании, а другая просто существует. Claude Haiku 4.5 появилась 1 октября и сразу достигла максимального балла — 14 — в независимом индексе Artificial Analysis Intelligence Index. Это огромно, и не это причина, по которой большинство команд выбирает между ними.

Выбор обычно навязывается ещё до того, как кто-либо обратится к бенчмаркам: регулируемый конвейер, который не может отправлять токены вендору, периферийное устройство без надёжного исходящего канала, бюджет задержки, измеряемый в миллисекундах, или требование дообучения, которое закрытый API никогда не удовлетворит. Если ничего из этого к вам не относится, ответ очевиден. Если же что-то относится, разрыв в оценках перестаёт иметь значение, и всё решает ограничение развёртывания.

Что и когда измерил совет

Независимые показатели, приведённые ниже, взяты из Artificial Analysis, а тарифы поставщиков — из собственной документации Anthropic и Google. Это два разных типа чисел, и они соответствующим образом обозначены по всему тексту.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemma 4 12B - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Gemma 4 12B column reads independent score 14 (AA, #21 of 142), weights Apache 2.0 12B dense, context 262,000 tokens, input price $0.10 / 1M, output price $0.30 / 1M and throughput 113.1 tok/s. A footer line reads 'Both columns per Artificial Analysis; pricing per each vendor.'

• Независимая оценка — Claude Haiku 5.5: 43 балла в Индексе интеллекта, второе место среди 182 моделей. G​emma 4 12B (Reasoning): 14 баллов, 21-е место из 142 в своём классе. Разрыв в 29 пунктов.

• Цена за миллион входных токенов — Claude Haiku 5.5: $0.10 до 100 000 токенов и $0.50 свыше; Gemma 4 12B — $0.10.

• Цена выходных токенов за миллион — Claude Haiku 5.5: $0.50 до 100 000 токенов и $2.50 свыше; G​emma 4 12B: $0.30.

• Контекстное окно — 1 000 000 токенов для Claude Haiku 5.5; 262 000 для G​emma 4 12B.

• Пропускная способность — 240,4 выходных токена в секунду для Claude Haiku 5.5; 113,1 для Gemma 4 12B при времени до первого токена 2,48 секунды.

• Стоимость одной завершённой задачи Index — $0,21 для Claude Haiku 5.5. Gemma 4 12B достаточно дешёвая в расчёте на токен, так что сводный показатель совета оказывается на уровне $0,12 за миллион токенов, но расчётная стоимость за задачу — не то число, которое должно определять это сравнение.

• Веса — Apache 2.0 для Gemma 4 12B, доступны для скачивания, примерно 12 миллиардов параметров, dense-архитектура. Claude Haiku 5.5 — проприетарная модель; релиза весов нет и не планируется.

• Возраст — G​emma 4 12B существует с июня 2026 года. Claude Haiku 5.5 на момент написания этого текста — всего два дня от роду.

Разрыв составляет 29 пунктов, а разница в цене практически отсутствует

Взгляните ещё раз на две строки с ценами: $0.10 на входе у обоих и $0.30 против $0.50 на выходе. G​emma 4 12B дешевле, и разница достаточно мала, чтобы её перекрыло количество токенов — более новый токенизатор Claude Haiku 5.5 означает, что один и тот же текст даёт примерно на 30% больше токенов, так что номинальное преимущество в 40% по выходной ставке на стороне G​emma на реальном счёте почти не даёт выигрыша.

Итак, вы платите почти ту же цену за модель, отстающую на 29 пунктов Index, или вы платите почти ту же цену за модель, опережающую на 29 пунктов, в зависимости от того, какой столбец вы прочитаете первым. Это честная формулировка, и её следует сказать прямо: в любой задаче, которую могут выполнить обе модели, Claude Haiku 5.5 — более выгодная покупка по каталожной цене, и её преимущество настолько велико, что никакой промпт-инжиниринг для меньшей модели его не закроет.

Поэтому интересный вопрос — не «что лучше», а «на каких из задач в моей очереди Gemma 4 12B терпит неудачу», и ответ на него — единственное, что решает исход сравнения.

Что вам дают веса, чего не может дать API?

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Intelligence Index of 14 at rank 21 of 142, speed rank 19 of 142, input $0.10 and output $0.30, 113.1 output tokens per second, a summary noting text, image, speech and video input with text output and a 262k-token context window, and the note that the score places it well above the median of 8 for comparable models.

Загруженная модель — это актив иного рода, и её преимущества носят структурный, а не инкрементальный характер.

• Граница данных — с G​emma 4 12B в цепочке вообще нет вендора. Для рабочих нагрузок в здравоохранении, юриспруденции, обороне или финансах это часто единственное требование, которое имеет значение, и никакая оценка не делает API приемлемым.

• Фиксированная стоимость вместо переменной — плотная модель 12B, квантованная до четырёх бит, комфортно помещается на одном современном ускорителе. В этот момент предельная стоимость за токен — это электроэнергия, и рабочую нагрузку можно соразмерять с машиной, а не со счётчиком.

• Никакого исходящего трафика, никакой сетевой задержки — локальная модель на 12B отвечает за миллисекунды, потому что ничего не покидает устройство. API вендора расплачивается за круговой обмен и хвост холодного запуска, которых у периферийного развертывания просто нет.

• Дообучение и дистилляция — вы можете адаптировать G​emma 4 12B на собственных данных, поставить адаптер и заморозить его. Разрешит ли когда-нибудь A​nthropic дообучать модель уровня Haiku — это не то, вокруг чего можно строить дорожную карту.

• Страховка для вашего роадмапа — веса не могут быть объявлены устаревшими у вас под ногами. Anthropic обязалась не выводить Claude Haiku 5.5 из эксплуатации до 7 октября 2027 года, и это щедро, но обязательство с датой — всё равно обязательство с датой.

• Модальность, как ни странно, — в таблице отмечено, что Gemma 4 12B принимает на вход текст, изображения, речь и видео для вывода текста; это более широкий набор входных данных, чем текст и изображения у Claude Haiku 5.5. Для локального конвейера, который обрабатывает аудио без отдельного сервиса транскрипции, это реальная возможность, которой нет у API-стороны.

A screenshot of the Hugging Face model card for gemma-4-12B, showing the Google uploader, the 'Any-to-Any' and 'Transformers / Safetensors' tags, the gemma4_unified_image-text-to-text identifier, 'Eval Results', 'Model card', 'Files and versions' and 'Community' tabs, a licence line reading 'License: Apache 2.0, Authors: Google DeepMind', and the opening of the card describing the Gemma 4 12B Unified model as sharing the multimodal functionality of Gemma 4 E2B and E4B with native audio and vision understanding and no separate encoders.

Где 12B не выдерживает контакта

Та же панель, которая измеряет разрыв в 29 пунктов, также фиксирует вещи, которые небольшая плотная модель не может хорошо выполнять, а пропускать их было бы нечестно:

• Длинный контекст — 262 000 токенов против 1 000 000. Конвейер, который заталкивает кодовую базу или годовой объём записей в один промпт, нежизнеспособен на G​emma 4 12B, а разбиение на цикл извлечения добавляет инженерной работы, которой более широкое окно позволило бы избежать.

Агентная работа и работа с использованием компьютера — класс задач, где сбой небольшой модели происходит незаметно и дорого обходится. Собственные данные Anthropic, заявленные производителем, для Claude Haiku 5.5 показывают OSWorld 2.1 на уровне 72,4% против 15,7% у предыдущей Haiku; модель на 12B с индексом 14 не подходит для этой задачи, и цифры производителя здесь — полезный сигнал, даже с учётом того, что ни один независимый запуск их не воспроизвёл.

• Пропускная способность на доллар в общем парке — 113 токенов в секунду на хостинговом экземпляре — это нормально, но причина для самохостинга не в скорости, а развёртывание на одном GPU будет ещё медленнее.

• Ничей резервный вариант — если вы запускаете G​emma 4 12B в продакшене, сбой вашего собственного оборудования — это ваш сбой, без второго провайдера для аварийного переключения, если только вы его не создадите.

Запуск любого из них через один эндпоинт

Сегодня OrcaRouter предлагает в каталоге Gemma 4 31B и Gemma 4 26B-A4B по прайсовой цене Google с наценкой 0%, но не 12B — и об этом стоит сказать прямо, а не намекать на обратное. Модель 12B доступна через собственный канал распространения вендора и несколько сторонних платформ. Claude Haiku 5.5 также пока отсутствует в каталоге; она доступна через API Anthropic и основные облачные платформы.

Что маршрутизатор действительно даёт — так это ту форму, которую и требует это сравнение. Разумное развёртывание дешёвой локальной модели вместе с дорогой API-моделью — это не развилка, а маршрут: Gemma 4 12B или хостинговый вариант Gemma 4 отвечает на лёгкое большинство запросов, а запросы, нарушающие условие по качеству или длине, эскалируются на плечо Anthropic. Claude Haiku 4.5, Claude Sonnet 5.5 и Claude Opus 5.5 уже есть в каталоге, так что путь эскалации можно построить и нагрузить тестами ещё до того, как плечо младшего уровня вообще станет доступно. В OrcaRouter такая композиция — это выражение DSL маршрутизации и автоматическое переключение при сбое, а не сервис, который вы поддерживаете, и поскольку прайсовые цены провайдеров передаются с наценкой 0%, изменение цены на любом плече вступает в силу в тот же день, когда оно происходит.

Правило

Выбирайте Claude Haiku 5.5, если только какое-либо ограничение не исключает его. Он на 29 пунктов индекса опережает Gemma 4 12B при почти одинаковой каталожной цене, поддерживает миллион токенов контекста и является более сильной моделью в каждой задаче, которую обе способны выполнить. Не существует такого варианта этого сравнения, в котором 12B побеждает по существу.

Выбирайте Gemma 4 12B, когда ограничение — это главное: когда токены не могут покинуть вашу инфраструктуру, когда бюджет — это машина, а не счётчик, когда нужно дообучение или когда нужны веса на руках, а не прайс-лист и дата вывода из эксплуатации. Это не предпочтения, а требования, и перед требованием разрыв в 29 пунктов просто не является решающим числом.