Сгенерированная hero-карточка под названием «Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base» с надзаголовком «ДЕШЁВЫЙ НЕ МОЖЕТ ОТВЕТИТЬ НА ВОПРОС» и чипами с надписями: $0.10 против $0.06 за миллион входных токенов, AA Index 43 против 13, а также готов к ответам против базового чекпоинта.
Guides & Insights

Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: Дешёвый не может ответить на вопрос

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

По двум цифрам, которые для таблицы закупок важнее всего, побеждает более дешёвая и быстрая модель. Nemotron 3.5 Lightning 30B A3B Base выдаёт 298,9 выходных токенов в секунду — это самый быстрый показатель среди 142 моделей, отслеживаемых независимо, — и стоит $0,06 за миллион входных токенов против $0,10 у Claude Haiku 5.5. Кроме того, как предупреждает слово «Base» в её названии, она не ассистент. Это предобученный чекпойнт — без дообучения с учителем, без обучения с подкреплением, без сколько-нибудь стоящего шаблона чата, — опубликованный под лицензией OpenMDW-1.1 11 августа 2026 года, чтобы другие люди могли строить на его основе. Claude Haiku 5.5, выпущенная 7 октября 2026 года, — это готовый продукт, которому можно задать вопрос. Сравнивать их по цене — всё равно что сравнивать стоимость муки со стоимостью хлеба, а самое интересное в этом противостоянии — понять, какая из них на самом деле нужна вашей рабочей нагрузке.

Никто в материалах о запуске не говорит об этой части ясно, потому что «дешевле и быстрее, чем Claude Haiku 5.5» — лучший заголовок, чем «дешевле, быстрее и непригодно без запуска дообучения». Оба утверждения верны. Полезно только одно из них.

Что на самом деле представляет собой каждая модель

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, выпущена 7 октября 2026 года. На входе текст и изображения, на выходе текст. Контекст 1 млн токенов, максимальный объём вывода 128 000 токенов (300 000 при использовании бета-заголовка в Batch API), отсечка обучения — июнь 2026 года, вывод из эксплуатации не ранее 7 октября 2027 года. Настраиваемый уровень усилий: Low, Medium, High, Xhigh и Max, по умолчанию — Medium, адаптивное мышление включено по умолчанию. API с тарификацией по использованию, чтение из кэша — $0,01 за миллион, Batch — по половинному тарифу. Доступна через API Anthropic, а оттуда — везде, где перепродаются модели Anthropic.

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, анонсирована 11 августа 2026 года. Чекпоинт гибридной смеси экспертов на 30 миллиардов параметров с примерно 3 миллиардами активных параметров на токен, построенный на стеке Mamba-2 + MoE + attention, дистиллированный из Nemotron 3 Ultra и поставляемый со спекулятивным декодированием MTP, DFlash и DSpark. Контекст достигает 1 млн токенов, хотя примерно 256 000 — практический предел на одной H100. Это текстовая модель. Веса открыты под лицензией OpenMDW-1.1. И это базовый чекпоинт: необработанные предобученные веса без инструкционной настройки, а значит, он дополняет текст, а не следует инструкциям.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• Размеры, по одному в строке

• Цена ввода — Claude Haiku 5.5: $0,10 за миллион до 100 тыс. токенов, далее $0,50; Nemotron 3.5 Lightning 30B A3B Base — $0,06 за миллион.

• Цена вывода — $0.50 за миллион до 100 тыс. токенов, затем $2.50, против $0.20 за миллион.

• Стоимость за выполненную задачу — $0.21 за независимую задачу индексации у Claude Haiku 5.5 против $0.09 у Nemotron — более дешёвая модель обходится дешевле за задачу, а не только за токен.

• Скорость вывода — 243,4 токена в секунду у Claude Haiku 5.5, девятое место из 182; 298,9 токена в секунду у Nemotron, первое место из 142.

• Время до генерации первого токена — около 0,3 секунды для Claude Haiku 5.5 против 0,54 секунды для Nemotron.

• Независимая оценка — индекс интеллекта Artificial Analysis 43 у Claude Haiku 5.5, второе место из 182, при этом конфигурация Max — 43,40; индекс 13 у Nemotron, двадцать девятое место из 142.

• Контекстное окно — по 1 000 000 токенов каждое, при этом примерно 256 000 из них практически доступны для Nemotron на одном H100.

• Модальности — текст и изображение на входе для Claude Haiku 5.5; только текст для Nemotron.

• Веса — проприетарные против открытых по OpenMDW-1.1, гибридная MoE на 30B общих и 3B активных параметров.

• Инструкционная настройка — присутствует в Claude Haiku 5.5, отсутствует в Base checkpoint.

Проблема «Base», изложенная просто

Базовый чекпоинт предсказывает следующий токен. Задайте ему вопрос — и он часто продолжит текст в стиле документа, в котором мог бы встречаться такой вопрос, вместо того чтобы ответить. Дайте ему запрос «Кратко изложи этот договор», и базовая модель может выдать правдоподобное продолжение документа из юридического обучающего корпуса, а не краткое изложение вашего. NVIDIA публикует отдельный чекпоинт BF16 и отдельные родственные модели, дообученные на инструкциях, именно потому, что базовые веса — это сырьё.

В собственной карточке модели NVIDIA — данные заявлены производителем, а не независимо воспроизведены — базовый чекпойнт набирает 78,59 на MMLU, 67,94 на MMLU-Pro, 91,28 на GSM8K, 77,44 на HumanEval и 69,62 на RULER при 1 млн токенов. Карточка Lightning для дообученного собрата сообщает MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 и 86% на PinchBench, при этом вывод примерно на 30% быстрее, чем у модели, которую он заменил. Даже числа для дообученной версии принадлежат самой NVIDIA, а базовые числа относятся к чекпойнту, названному в заголовке этой статьи. На их фоне независимо измеренные 43,40 у Claude Haiku 5.5 — второй результат из 182 в индексе Artificial Analysis, другом индексе, измеряющем другие вещи — не поддаются прямому сравнению, и честный вывод состоит в том, что базовый чекпойнт на 30B и готовая небольшая модель оцениваются разными инструментами для разных целей.

Что можно утверждать без оговорок — так это очертания разрыва. Базовый чекпойнт, которому нужны пайплайн дообучения, стек обслуживания и стенд оценки, прежде чем он вообще сможет что-либо ответить, не заменяет хостируемую модель за $0,10 за миллион. Это отправная точка для того, кто хочет владеть моделью.

Где Nemotron действительно побеждает, и это не утешительный приз

Скорость — прежде всего. 298,9 выходных токенов в секунду — первое место в рейтинге из 142 моделей, на 23% быстрее, чем 243,4 у Claude Haiku 5.5. Для пайплайна, чувствительного к задержкам, это реальная, измеримая разница, и именно поэтому на коробке стоит название «Lightning».

Во-вторых, открытые веса — и это важнее. {{1}}Во-вторых, открытые веса — и это важнее.{{/1}} Claude Haiku 5.5 вообще не поддаётся дообучению, и его нельзя развернуть у себя ни за какую цену. Для команды с проприетарной задачей, необычным распределением входных данных или требованием соответствия, согласно которому трафик никогда не покидает их собственную инфраструктуру, это различие имеет решающее значение, независимо от того, что говорится на страницах с бенчмарками. Модель с общим числом параметров 30B и 3B активных также достаточно мала, чтобы её можно было экономически эффективно обслуживать, — архитектура создана именно для этого.

Третья цена: $0.06 за входные данные и $0.20 за выходные за миллион, со скидкой 17% на кэш и $0.09 за задачу индексации, — это примерно половина от $0.21 у Claude Haiku 5.5. Обе модели дешёвы; Nemotron дешевле.

Там, где побеждает Claude Haiku 5.5, — а это каждое измерение, требующее ответа

Следование инструкциям — потому что модель натренирована на это. Независимая способность — индекс 43 против 13, разрыв в тридцать пунктов на табло, где оценивались обе, и это наибольший подобный разрыв в данном наборе сравнений. Ввод изображений, который Nemotron вообще не принимает. Максимальный вывод в 128 000 токенов против неопубликованного значения, с бета-маршрутом на 300 000 токенов в Batch. И регулятор усилий, который позволяет вернуть затраты, снижая усилие рассуждения, а не перестраивая модель.

Оговорка о многословности здесь работает в обе стороны. В наборе тестов Artificial Analysis Claude Haiku 5.5 выдаёт около 440 млн выходных токенов при медиане примерно 100 млн — она очень много размышляет. Nemotron выдаёт около 120 млн, и тот же источник называет его несколько многословным для своего размера. Тем не менее стоимость одной задачи у Haiku 5.5 составляет $0,21 против $0,09 у Nemotron, так что даже эта болтливая модель не является дорогой. Это говорит о том, что цены за токен вводят в заблуждение в обе стороны, а закладывать бюджет нужно по показателю стоимости за задачу.

Самостоятельный хостинг против одного эндпоинта

Nemotron 3.5 Lightning 30B A3B Base распространяется как открытые веса и обслуживается несколькими провайдерами инференса; NVIDIA также публикует настроенные родственные модели. Claude Haiku 5.5 доступна через API Anthropic, а оттуда — везде, где перепродаются модели Anthropic. Ни той, ни другой нет в каталоге OrcaRouter, и мы не станем делать вид, что это не так, — из этого сегмента мы маршрутизируем anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 и anthropic/claude-fable-5.1 — уровень выше того, о котором идёт речь в этой статье.

Два пути, описанные в этом сравнении, действительно устроены совершенно по-разному, и их стоит назвать. Путь с собственным размещением означает GPU, фреймворк для обслуживания, решение о квантизации и дежурства по эксплуатации. Путь с хостингом означает ключ и строку модели. OrcaRouter существует для второго пути: один API для более чем 200 моделей, один ключ и один счёт, цена по прайс-листу провайдера передаётся с наценкой 0%, так что снижение цены поставщиком вступает в силу в тот же день, с автоматическим переключением при сбое в основе. Это не путь к базовому чекпоинту на 30B, и покупка машины класса DGX — не путь к размещённой небольшой модели.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Кто должен выбирать

Если ваша задача чётко определена, ваших обучающих данных достаточно, чтобы иметь значение, а ваш трафик не может покидать вашу собственную инфраструктуру, то Nemotron 3.5 Lightning 30B A3B Base — более интересный объект: самый быстрый из 142 по скорости вывода, вдвое дешевле за токен, и его можно дорабатывать. Заложите в бюджет затраты на прогон тонкой настройки и стоимость обслуживания, прежде чем считать экономию, потому что ставка $0.06 за входные данные предполагает, что кто-то уже выполнил работу, которая превращает контрольную точку в ассистента.

Если вы хотите отправить промпт и получить ответ сегодня после обеда, Claude Haiku 5.5 — именно тот, кто с этим справится: 43 балла в независимом индексе против 13, поддержка ввода изображений, потолок вывода в 128 000 токенов и цена, которая действительно невелика. Это сравнение кажется близким только в прайс-листе. Оно перестаёт казаться близким в тот момент, когда задача — ответить на вопрос, а не продолжить документ.

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.