
Claude Haiku 5.5 против Ling 3.0 Flash: у одной из этих моделей уже есть преемник
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Начнём со странного факта, потому что именно он должен определять решение. Ling 3.0 Flash — открытая модель Ant Group с 124 млрд параметров, выпущенная в августе 2026 года под лицензией MIT, — теперь помечена как устаревшая, а в качестве её замены названа Ling 3.1 Flash. Claude Haiku 5.5 вышла 7 октября 2026 года, за два дня до написания этого текста, и Anthropic обязалась не выводить её из эксплуатации до октября 2027 года. Две модели в одном ценовом диапазоне, и для одной из них уже указан собственный преемник.
Эта асимметрия — не вердикт о качестве. Ling 3.0 Flash — по-настоящему быстрая модель с открытыми весами и необычной архитектурой, и по ряду параметров она безусловно превосходит уровень Anthropic. Но это означает, что у этого сравнения есть срок годности, и любой материал, который рассматривает эти две как одинаково долговечные, продаёт вам ту часть, у которой истекает срок годности.
Два релиза, две совершенно разные эпохи
Независимые цифры здесь взяты из Artificial Analysis; утверждения конкретных поставщиков взяты из карточек моделей и документации и помечены.
• Выпуск — Ling 3.0 Flash 4 августа 2026 года, репозиторий Hugging Face датирован 2 августа. Claude Haiku 5.5 — 7 октября 2026 года.
• Лицензия — MIT для Ling 3.0 Flash, а это, пожалуй, максимально либерально, насколько это возможно для открытых весов. Claude Haiku 5.5 — проприетарная модель, доступная только через API.
• Статус — Ling 3.0 Flash несёт флаг устаревания, указывающий на Ling 3.1 Flash. Claude Haiku 5.5 — актуальная версия, с обязательством не выводить из эксплуатации до октября 2027 года.
• Внедрение — репозиторий Ling 3.0 Flash набрал 11 797 загрузок и 427 лайков. Это реальное, но скромное присутствие, и это разумный показатель того, насколько вырос объём сторонних инструментов вокруг модели.
Разница в возрасте значит больше, чем предполагают шесть недель. Ling 3.0 Flash вышел в период, когда его собственная линейка уже развивалась; Claude Haiku 5.5 вышел как новейший представитель линейки, у которой нет объявленного преемника.
Архитектура — это та часть, которую стоит прочитать дважды.

Ling 3.0 Flash — это модель со смесью экспертов с общим числом параметров 124 млрд и 5,1 млрд активных параметров на токен. В этом соотношении заключается вся экономическая логика: вы укладываетесь в объём памяти большой модели, а вычислительные затраты несёте как у небольшой. Опубликованная конфигурация вполне конкретна, и это не перекрашенный стандартный трансформер:
• Компоновка слоёв — 35 слоёв KDA с 7 слоями Gated MLA в соотношении 5:1, плюс 2 плотных слоя. Опубликованный рецепт обучения переводит контекстное окно с 8K на 32K, а затем на 256K поэтапно, а не обучает длинное окно с нуля.
• Эксперты — 512 маршрутизируемых экспертов с одним общим экспертом, 8 активируются на токен, при размере скрытого слоя 2 560, промежуточном размере эксперта 768 и промежуточном размере плотного слоя 6 144. Словарь — 157 184 токена.
• Сервинг — эталонное развёртывание из карточки использует SGLang с --context-length 262144, и сообщает, что HiCache с кешированием Mooncake сокращает время до первого токена на 60–80% или более на длинных входных данных. Это заявленная производителем цифра, и она приводится именно как таковая.
Ничто из этого не уловка. Активный объём в 5,1 млрд параметров — причина, по которой Ling 3.0 Flash можно обслуживать с той пропускной способностью, которую он достигает, а работа над кэшированием — причина, по которой задержка до первого токена на длинных промптах остаётся приемлемой. Подход Claude Haiku 5.5 — противоположный: одна плотная проприетарная модель за API, с окном в 1 000 000 токенов и адаптивным мышлением, которое решает для каждого запроса, сколько работы выполнить. Два согласованных ответа на один и тот же вопрос о стоимости.
Числа, бок о бок

• Независимая оценка — Claude Haiku 5.5 с 43 баллами в Индексе интеллекта, второе место из 182. Ling 3.0 Flash с 20 баллами — третье место из 65 в своём классе.
• Цена входных данных за миллион токенов — Claude Haiku 5.5: $0,10 до 100 000 токенов, $0,50 свыше. Ling 3.0 Flash — $0,075, со скидкой 80% при кэшировании.
• Цена вывода за миллион токенов — Claude Haiku 5.5: $0,50 до 100 000 токенов, $2,50 свыше. Ling 3.0 Flash: $0,22.
• Смешанная стоимость — $0,05 за миллион токенов для Ling 3.0 Flash против $0,08 для Claude Haiku 5.5 по собственной методике смешивания совета.
• Скорость — 333,6 выходных токенов в секунду у Ling 3.0 Flash, первое место из 65 в своём классе, против 240,4 у Claude Haiku 5.5. Время до первого токена — почти ничья: 2,50 секунды против результата Anthropic-модели в таблице лидеров.
• Контекст — 262 000 токенов для Ling 3.0 Flash; 1 000 000 для Claude Haiku 5.5.
• Модальность ввода — только текст для Ling 3.0 Flash. Текст и изображения для Claude Haiku 5.5.
• Веса — MIT и доступны для скачивания для Ling 3.0 Flash. Проприетарные для Claude Haiku 5.5.
Козырь Ling — скорость и цена, а не глубина.
Разрыв в 23 пункта по индексу между 43 и 20 — это главная новость, и он указывает в ту же сторону, что и в любом сравнении такого рода: Claude Haiku 5.5 — более сильная модель, и разрыв не маленький. Но колонка Ling чисто выигрывает в двух строках, и обе относятся к тому типу, который отражается в счёте или бюджете задержки.
Во-первых, пропускная способность. 333,6 токена в секунду — самый быстрый результат в своём классе в таблице, примерно на 39% впереди Claude Haiku 5.5, а в сочетании с более низкой смешанной стоимостью это означает, что массовую генерацию — прогоны классификации, разметку данных, крупнообъёмное структурированное извлечение — измеримо дешевле запускать на Ling 3.0 Flash. Когда задача хорошо специфицирована и режим отказа очевиден, модель, отстающая на 23 пункта Index, всё ещё может быть правильным выбором.
Во-вторых, скидка 80% на кэш. Для рабочей нагрузки с большим стабильным префиксом и небольшим изменяющимся хвостом эффективная ставка за входные данные у Ling 3.0 Flash опускается значительно ниже заявленной, и описанная в карточке модели схема кэширования рассчитана именно на такой сценарий. Ставка за чтение из кэша у Claude Haiku 5.5 в $0.01 дешевле в абсолютном выражении, но запись в кэш стоит $0.125, и модель тарифицируется со ступенью на 100 000 входных токенов, которой у Ling нет.
Противовесом служит многословность, и это тот же противовес, что применим к модели Anthropic. Artificial Analysis зафиксировала 260 миллионов выходных токенов при прогоне Index на Ling 3.0 Flash против медианы в 100 миллионов и отмечает её как многословную. Для модели с ценой за токен это подрывает преимущество по тарифу — в 2,3 раза более дешёвый тариф на выходные токены, частично поглощаемый моделью, которая пишет больше токенов, — это меньшее преимущество, чем предполагает карточка.
Что утверждают бенчмарки производителей, а что — нет
Собственная карточка Ling 3.0 Flash сообщает о сильном наборе: MathArena AIME 2026 — 93.2, HMMT February 2026 — 87, SWE-Bench Pro — 56.6, SWE-Bench Multilingual Resolved — 72.4 и Humanity's Last Exam — 22.7. Все эти показатели заявлены вендором, и ни один из них не был независимо воспроизведён здесь. Они также не измерялись в сравнении с Claude Haiku 5.5 на одном и том же стенде — Anthropic публикует свой собственный набор (GDPval-AA v2.1 — 1620, OSWorld 2.1 — 72.4%, Terminal-Bench 4.0 — 39.2%), и два вендора использовали разные наборы тестов. Единственное общее измерение — это независимый рейтинг, и там ответ однозначен.
Наряду с математическими оценками стоит отметить: показатель HLE в 22,7 заметно ниже показателя 45,9 без инструментов, который Anthropic приводит для Claude Haiku 5.5. Разные испытательные стенды, так что это не прямое сравнение, но и не разрыв, который можно было бы объяснить выбором стенда.

Проблема преемника
Это та часть, которая определяет сравнение для всех, кто планирует за пределами текущего квартала, и она не имеет ничего общего с бенчмарками.
Ling 3.0 Flash объявлен устаревшим в пользу Ling 3.1 Flash. Это не значит, что он перестаёт работать — открытые веса не имеют срока годности, а лицензии MIT нельзя отозвать. Но это значит, что экосистема вокруг него начнёт дрейфовать: поддержка в фреймворках для инференса, выпуски квантованных версий, исправления ошибок и инструменты сообщества — всё это следует за текущей моделью, а устаревшей достаётся лишь остаток этого внимания. Если сегодня вы строите что-то на Ling 3.0 Flash, вы строите на весах, которые заморожены и завершены: это нормально для стабильной рабочей нагрузки и неудобно для всего, что вы рассчитываете улучшать.
У Claude Haiku 5.5 — зеркальный набор гарантий: вы не получаете веса, но получаете вендора, чей коммерческий интерес заключается в том, чтобы модель оставалась быстрой, пропатченной и обслуживаемой, плюс обязательство не выводить её из эксплуатации как минимум до октября 2027 года и опубликованный путь миграции на случай, когда этот срок закончится.
Обе стороны этого маршрута — одним ключом.
Честно о доступности: OrcaRouter не предоставляет Ling 3.0 Flash и не предоставляет Claude Haiku 5.5. Ling 3.0 Flash доступна через собственный канал распространения вендора и несколько сторонних платформ; Claude Haiku 5.5 доступна через Anthropic API и основные облачные платформы.
Что остаётся — это вопрос маршрутизации, который поднимают обе модели. Claude Haiku 5.5 с 43 и окном в 1M — естественная цель для эскалации; Ling 3.0 Flash со скоростью 333 токена в секунду — естественный кандидат для массового сегмента. Маршрут, который отправляет большой объём хорошо формализованной работы на быстрый уровень, а всё, что не проходит проверку на длину или качество, эскалирует на более сильный, — это именно та схема, которую выстраивает роутер — в OrcaRouter, Claude Haiku 4.5, Claude Sonnet 5.5 и Claude Opus 5.5 от Anthropic уже сегодня в каталоге, наряду с крупными открытыми моделями, такими как DeepSeek V4.1 Flash и GLM 5.3 Flash, так что и сегмент эскалации, и массовый сегмент можно построить и протестировать под нагрузкой уже сейчас. Один ключ, автоматическое переключение при сбое под капотом, прайс-листовые цены провайдеров транслируются с наценкой 0%, так что изменение цены вступает в силу в тот же день.
Какой из двух, и как долго?
Выбирайте Claude Haiku 5.5, если работа не ограничена четкими рамками, если вам нужны изображения или контекстное окно на миллион токенов, если вы хотите, чтобы поставщик нес ответственность за бесперебойную работу, или если вы планируете дальше следующего квартала. Он опережает на 23 пункта Индекса, он актуален, а не устарел, и разница в цене достаточно мала, чтобы разрыв в оценках доминировал.
Выбирайте Ling 3.0 Flash, если нагрузка массовая, чётко определённая и чувствительная к задержкам; если суть в лицензии MIT или открытых весах; или если 80%-ная скидка на кэш для стабильного префикса — это то, где на самом деле формируется ваш счёт. Она быстрее и дешевле в пересчёте на токен, и она действительно хорошо справляется с задачами, которые под силу модели 20-Index. Просто имейте в виду, что вы берёте законченную модель, а не поддерживаемую, и что преемник, на который она указывает, уже существует.
