
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: Дешёвый не может ответить на вопрос
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
По двум цифрам, которые для таблицы закупок важнее всего, побеждает более дешёвая и быстрая модель. Nemotron 3.5 Lightning 30B A3B Base выдаёт 298,9 выходных токенов в секунду — это самый быстрый показатель среди 142 моделей, отслеживаемых независимо, — и стоит $0,06 за миллион входных токенов против $0,10 у Claude Haiku 5.5. Кроме того, как предупреждает слово «Base» в её названии, она не ассистент. Это предобученный чекпойнт — без дообучения с учителем, без обучения с подкреплением, без сколько-нибудь стоящего шаблона чата, — опубликованный под лицензией OpenMDW-1.1 11 августа 2026 года, чтобы другие люди могли строить на его основе. Claude Haiku 5.5, выпущенная 7 октября 2026 года, — это готовый продукт, которому можно задать вопрос. Сравнивать их по цене — всё равно что сравнивать стоимость муки со стоимостью хлеба, а самое интересное в этом противостоянии — понять, какая из них на самом деле нужна вашей рабочей нагрузке.
Никто в материалах о запуске не говорит об этой части ясно, потому что «дешевле и быстрее, чем Claude Haiku 5.5» — лучший заголовок, чем «дешевле, быстрее и непригодно без запуска дообучения». Оба утверждения верны. Полезно только одно из них.
Что на самом деле представляет собой каждая модель
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, выпущена 7 октября 2026 года. На входе текст и изображения, на выходе текст. Контекст 1 млн токенов, максимальный объём вывода 128 000 токенов (300 000 при использовании бета-заголовка в Batch API), отсечка обучения — июнь 2026 года, вывод из эксплуатации не ранее 7 октября 2027 года. Настраиваемый уровень усилий: Low, Medium, High, Xhigh и Max, по умолчанию — Medium, адаптивное мышление включено по умолчанию. API с тарификацией по использованию, чтение из кэша — $0,01 за миллион, Batch — по половинному тарифу. Доступна через API Anthropic, а оттуда — везде, где перепродаются модели Anthropic.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, анонсирована 11 августа 2026 года. Чекпоинт гибридной смеси экспертов на 30 миллиардов параметров с примерно 3 миллиардами активных параметров на токен, построенный на стеке Mamba-2 + MoE + attention, дистиллированный из Nemotron 3 Ultra и поставляемый со спекулятивным декодированием MTP, DFlash и DSpark. Контекст достигает 1 млн токенов, хотя примерно 256 000 — практический предел на одной H100. Это текстовая модель. Веса открыты под лицензией OpenMDW-1.1. И это базовый чекпоинт: необработанные предобученные веса без инструкционной настройки, а значит, он дополняет текст, а не следует инструкциям.

• Размеры, по одному в строке
• Цена ввода — Claude Haiku 5.5: $0,10 за миллион до 100 тыс. токенов, далее $0,50; Nemotron 3.5 Lightning 30B A3B Base — $0,06 за миллион.
• Цена вывода — $0.50 за миллион до 100 тыс. токенов, затем $2.50, против $0.20 за миллион.
• Стоимость за выполненную задачу — $0.21 за независимую задачу индексации у Claude Haiku 5.5 против $0.09 у Nemotron — более дешёвая модель обходится дешевле за задачу, а не только за токен.
• Скорость вывода — 243,4 токена в секунду у Claude Haiku 5.5, девятое место из 182; 298,9 токена в секунду у Nemotron, первое место из 142.
• Время до генерации первого токена — около 0,3 секунды для Claude Haiku 5.5 против 0,54 секунды для Nemotron.
• Независимая оценка — индекс интеллекта Artificial Analysis 43 у Claude Haiku 5.5, второе место из 182, при этом конфигурация Max — 43,40; индекс 13 у Nemotron, двадцать девятое место из 142.
• Контекстное окно — по 1 000 000 токенов каждое, при этом примерно 256 000 из них практически доступны для Nemotron на одном H100.
• Модальности — текст и изображение на входе для Claude Haiku 5.5; только текст для Nemotron.
• Веса — проприетарные против открытых по OpenMDW-1.1, гибридная MoE на 30B общих и 3B активных параметров.
• Инструкционная настройка — присутствует в Claude Haiku 5.5, отсутствует в Base checkpoint.
Проблема «Base», изложенная просто
Базовый чекпоинт предсказывает следующий токен. Задайте ему вопрос — и он часто продолжит текст в стиле документа, в котором мог бы встречаться такой вопрос, вместо того чтобы ответить. Дайте ему запрос «Кратко изложи этот договор», и базовая модель может выдать правдоподобное продолжение документа из юридического обучающего корпуса, а не краткое изложение вашего. NVIDIA публикует отдельный чекпоинт BF16 и отдельные родственные модели, дообученные на инструкциях, именно потому, что базовые веса — это сырьё.
В собственной карточке модели NVIDIA — данные заявлены производителем, а не независимо воспроизведены — базовый чекпойнт набирает 78,59 на MMLU, 67,94 на MMLU-Pro, 91,28 на GSM8K, 77,44 на HumanEval и 69,62 на RULER при 1 млн токенов. Карточка Lightning для дообученного собрата сообщает MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 и 86% на PinchBench, при этом вывод примерно на 30% быстрее, чем у модели, которую он заменил. Даже числа для дообученной версии принадлежат самой NVIDIA, а базовые числа относятся к чекпойнту, названному в заголовке этой статьи. На их фоне независимо измеренные 43,40 у Claude Haiku 5.5 — второй результат из 182 в индексе Artificial Analysis, другом индексе, измеряющем другие вещи — не поддаются прямому сравнению, и честный вывод состоит в том, что базовый чекпойнт на 30B и готовая небольшая модель оцениваются разными инструментами для разных целей.
Что можно утверждать без оговорок — так это очертания разрыва. Базовый чекпойнт, которому нужны пайплайн дообучения, стек обслуживания и стенд оценки, прежде чем он вообще сможет что-либо ответить, не заменяет хостируемую модель за $0,10 за миллион. Это отправная точка для того, кто хочет владеть моделью.
Где Nemotron действительно побеждает, и это не утешительный приз
Скорость — прежде всего. 298,9 выходных токенов в секунду — первое место в рейтинге из 142 моделей, на 23% быстрее, чем 243,4 у Claude Haiku 5.5. Для пайплайна, чувствительного к задержкам, это реальная, измеримая разница, и именно поэтому на коробке стоит название «Lightning».
Во-вторых, открытые веса — и это важнее. {{1}}Во-вторых, открытые веса — и это важнее.{{/1}} Claude Haiku 5.5 вообще не поддаётся дообучению, и его нельзя развернуть у себя ни за какую цену. Для команды с проприетарной задачей, необычным распределением входных данных или требованием соответствия, согласно которому трафик никогда не покидает их собственную инфраструктуру, это различие имеет решающее значение, независимо от того, что говорится на страницах с бенчмарками. Модель с общим числом параметров 30B и 3B активных также достаточно мала, чтобы её можно было экономически эффективно обслуживать, — архитектура создана именно для этого.
Третья цена: $0.06 за входные данные и $0.20 за выходные за миллион, со скидкой 17% на кэш и $0.09 за задачу индексации, — это примерно половина от $0.21 у Claude Haiku 5.5. Обе модели дешёвы; Nemotron дешевле.
Там, где побеждает Claude Haiku 5.5, — а это каждое измерение, требующее ответа
Следование инструкциям — потому что модель натренирована на это. Независимая способность — индекс 43 против 13, разрыв в тридцать пунктов на табло, где оценивались обе, и это наибольший подобный разрыв в данном наборе сравнений. Ввод изображений, который Nemotron вообще не принимает. Максимальный вывод в 128 000 токенов против неопубликованного значения, с бета-маршрутом на 300 000 токенов в Batch. И регулятор усилий, который позволяет вернуть затраты, снижая усилие рассуждения, а не перестраивая модель.
Оговорка о многословности здесь работает в обе стороны. В наборе тестов Artificial Analysis Claude Haiku 5.5 выдаёт около 440 млн выходных токенов при медиане примерно 100 млн — она очень много размышляет. Nemotron выдаёт около 120 млн, и тот же источник называет его несколько многословным для своего размера. Тем не менее стоимость одной задачи у Haiku 5.5 составляет $0,21 против $0,09 у Nemotron, так что даже эта болтливая модель не является дорогой. Это говорит о том, что цены за токен вводят в заблуждение в обе стороны, а закладывать бюджет нужно по показателю стоимости за задачу.
Самостоятельный хостинг против одного эндпоинта
Nemotron 3.5 Lightning 30B A3B Base распространяется как открытые веса и обслуживается несколькими провайдерами инференса; NVIDIA также публикует настроенные родственные модели. Claude Haiku 5.5 доступна через API Anthropic, а оттуда — везде, где перепродаются модели Anthropic. Ни той, ни другой нет в каталоге OrcaRouter, и мы не станем делать вид, что это не так, — из этого сегмента мы маршрутизируем anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 и anthropic/claude-fable-5.1 — уровень выше того, о котором идёт речь в этой статье.
Два пути, описанные в этом сравнении, действительно устроены совершенно по-разному, и их стоит назвать. Путь с собственным размещением означает GPU, фреймворк для обслуживания, решение о квантизации и дежурства по эксплуатации. Путь с хостингом означает ключ и строку модели. OrcaRouter существует для второго пути: один API для более чем 200 моделей, один ключ и один счёт, цена по прайс-листу провайдера передаётся с наценкой 0%, так что снижение цены поставщиком вступает в силу в тот же день, с автоматическим переключением при сбое в основе. Это не путь к базовому чекпоинту на 30B, и покупка машины класса DGX — не путь к размещённой небольшой модели.

Кто должен выбирать
Если ваша задача чётко определена, ваших обучающих данных достаточно, чтобы иметь значение, а ваш трафик не может покидать вашу собственную инфраструктуру, то Nemotron 3.5 Lightning 30B A3B Base — более интересный объект: самый быстрый из 142 по скорости вывода, вдвое дешевле за токен, и его можно дорабатывать. Заложите в бюджет затраты на прогон тонкой настройки и стоимость обслуживания, прежде чем считать экономию, потому что ставка $0.06 за входные данные предполагает, что кто-то уже выполнил работу, которая превращает контрольную точку в ассистента.
Если вы хотите отправить промпт и получить ответ сегодня после обеда, Claude Haiku 5.5 — именно тот, кто с этим справится: 43 балла в независимом индексе против 13, поддержка ввода изображений, потолок вывода в 128 000 токенов и цена, которая действительно невелика. Это сравнение кажется близким только в прайс-листе. Оно перестаёт казаться близким в тот момент, когда задача — ответить на вопрос, а не продолжить документ.

