Сгенерированная hero-карточка для «Claude Haiku 5.5 vs Ling 3.0 Flash» с двумя панелями, разделёнными тонкой линией: слева подписано «Claude Haiku 5.5» с «Индекс 43» и «Текущий», справа подписано «Ling 3.0 Flash» с «Индекс 20» и «Устаревший». В нижней строке написано «Оценки по Artificial Analysis». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Claude Haiku 5.5 против Ling 3.0 Flash: у одной из этих моделей уже есть преемник

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Начнём со странного факта, потому что именно он должен определять решение. Ling 3.0 Flash — открытая модель Ant Group с 124 млрд параметров, выпущенная в августе 2026 года под лицензией MIT, — теперь помечена как устаревшая, а в качестве её замены названа Ling 3.1 Flash. Claude Haiku 5.5 вышла 7 октября 2026 года, за два дня до написания этого текста, и Anthropic обязалась не выводить её из эксплуатации до октября 2027 года. Две модели в одном ценовом диапазоне, и для одной из них уже указан собственный преемник.

Эта асимметрия — не вердикт о качестве. Ling 3.0 Flash — по-настоящему быстрая модель с открытыми весами и необычной архитектурой, и по ряду параметров она безусловно превосходит уровень Anthropic. Но это означает, что у этого сравнения есть срок годности, и любой материал, который рассматривает эти две как одинаково долговечные, продаёт вам ту часть, у которой истекает срок годности.

Два релиза, две совершенно разные эпохи

Независимые цифры здесь взяты из Artificial Analysis; утверждения конкретных поставщиков взяты из карточек моделей и документации и помечены.

• Выпуск — Ling 3.0 Flash 4 августа 2026 года, репозиторий Hugging Face датирован 2 августа. Claude Haiku 5.5 — 7 октября 2026 года.

• Лицензия — MIT для Ling 3.0 Flash, а это, пожалуй, максимально либерально, насколько это возможно для открытых весов. Claude Haiku 5.5 — проприетарная модель, доступная только через API.

• Статус — Ling 3.0 Flash несёт флаг устаревания, указывающий на Ling 3.1 Flash. Claude Haiku 5.5 — актуальная версия, с обязательством не выводить из эксплуатации до октября 2027 года.

• Внедрение — репозиторий Ling 3.0 Flash набрал 11 797 загрузок и 427 лайков. Это реальное, но скромное присутствие, и это разумный показатель того, насколько вырос объём сторонних инструментов вокруг модели.

Разница в возрасте значит больше, чем предполагают шесть недель. Ling 3.0 Flash вышел в период, когда его собственная линейка уже развивалась; Claude Haiku 5.5 вышел как новейший представитель линейки, у которой нет объявленного преемника.

Архитектура — это та часть, которую стоит прочитать дважды.

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash — это модель со смесью экспертов с общим числом параметров 124 млрд и 5,1 млрд активных параметров на токен. В этом соотношении заключается вся экономическая логика: вы укладываетесь в объём памяти большой модели, а вычислительные затраты несёте как у небольшой. Опубликованная конфигурация вполне конкретна, и это не перекрашенный стандартный трансформер:

• Компоновка слоёв — 35 слоёв KDA с 7 слоями Gated MLA в соотношении 5:1, плюс 2 плотных слоя. Опубликованный рецепт обучения переводит контекстное окно с 8K на 32K, а затем на 256K поэтапно, а не обучает длинное окно с нуля.

• Эксперты — 512 маршрутизируемых экспертов с одним общим экспертом, 8 активируются на токен, при размере скрытого слоя 2 560, промежуточном размере эксперта 768 и промежуточном размере плотного слоя 6 144. Словарь — 157 184 токена.

• Сервинг — эталонное развёртывание из карточки использует SGLang с --context-length 262144, и сообщает, что HiCache с кешированием Mooncake сокращает время до первого токена на 60–80% или более на длинных входных данных. Это заявленная производителем цифра, и она приводится именно как таковая.

Ничто из этого не уловка. Активный объём в 5,1 млрд параметров — причина, по которой Ling 3.0 Flash можно обслуживать с той пропускной способностью, которую он достигает, а работа над кэшированием — причина, по которой задержка до первого токена на длинных промптах остаётся приемлемой. Подход Claude Haiku 5.5 — противоположный: одна плотная проприетарная модель за API, с окном в 1 000 000 токенов и адаптивным мышлением, которое решает для каждого запроса, сколько работы выполнить. Два согласованных ответа на один и тот же вопрос о стоимости.

Числа, бок о бок

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• Независимая оценка — Claude Haiku 5.5 с 43 баллами в Индексе интеллекта, второе место из 182. Ling 3.0 Flash с 20 баллами — третье место из 65 в своём классе.

• Цена входных данных за миллион токенов — Claude Haiku 5.5: $0,10 до 100 000 токенов, $0,50 свыше. Ling 3.0 Flash — $0,075, со скидкой 80% при кэшировании.

• Цена вывода за миллион токенов — Claude Haiku 5.5: $0,50 до 100 000 токенов, $2,50 свыше. Ling 3.0 Flash: $0,22.

• Смешанная стоимость — $0,05 за миллион токенов для Ling 3.0 Flash против $0,08 для Claude Haiku 5.5 по собственной методике смешивания совета.

• Скорость — 333,6 выходных токенов в секунду у Ling 3.0 Flash, первое место из 65 в своём классе, против 240,4 у Claude Haiku 5.5. Время до первого токена — почти ничья: 2,50 секунды против результата A​nthropic-модели в таблице лидеров.

• Контекст — 262 000 токенов для Ling 3.0 Flash; 1 000 000 для Claude Haiku 5.5.

• Модальность ввода — только текст для Ling 3.0 Flash. Текст и изображения для Claude Haiku 5.5.

• Веса — MIT и доступны для скачивания для Ling 3.0 Flash. Проприетарные для Claude Haiku 5.5.

Козырь Ling — скорость и цена, а не глубина.

Разрыв в 23 пункта по индексу между 43 и 20 — это главная новость, и он указывает в ту же сторону, что и в любом сравнении такого рода: Claude Haiku 5.5 — более сильная модель, и разрыв не маленький. Но колонка Ling чисто выигрывает в двух строках, и обе относятся к тому типу, который отражается в счёте или бюджете задержки.

Во-первых, пропускная способность. 333,6 токена в секунду — самый быстрый результат в своём классе в таблице, примерно на 39% впереди Claude Haiku 5.5, а в сочетании с более низкой смешанной стоимостью это означает, что массовую генерацию — прогоны классификации, разметку данных, крупнообъёмное структурированное извлечение — измеримо дешевле запускать на Ling 3.0 Flash. Когда задача хорошо специфицирована и режим отказа очевиден, модель, отстающая на 23 пункта Index, всё ещё может быть правильным выбором.

Во-вторых, скидка 80% на кэш. Для рабочей нагрузки с большим стабильным префиксом и небольшим изменяющимся хвостом эффективная ставка за входные данные у Ling 3.0 Flash опускается значительно ниже заявленной, и описанная в карточке модели схема кэширования рассчитана именно на такой сценарий. Ставка за чтение из кэша у Claude Haiku 5.5 в $0.01 дешевле в абсолютном выражении, но запись в кэш стоит $0.125, и модель тарифицируется со ступенью на 100 000 входных токенов, которой у Ling нет.

Противовесом служит многословность, и это тот же противовес, что применим к модели Anthropic. Artificial Analysis зафиксировала 260 миллионов выходных токенов при прогоне Index на Ling 3.0 Flash против медианы в 100 миллионов и отмечает её как многословную. Для модели с ценой за токен это подрывает преимущество по тарифу — в 2,3 раза более дешёвый тариф на выходные токены, частично поглощаемый моделью, которая пишет больше токенов, — это меньшее преимущество, чем предполагает карточка.

Что утверждают бенчмарки производителей, а что — нет

Собственная карточка Ling 3.0 Flash сообщает о сильном наборе: MathArena AIME 2026 — 93.2, HMMT February 2026 — 87, SWE-Bench Pro — 56.6, SWE-Bench Multilingual Resolved — 72.4 и Humanity's Last Exam — 22.7. Все эти показатели заявлены вендором, и ни один из них не был независимо воспроизведён здесь. Они также не измерялись в сравнении с Claude Haiku 5.5 на одном и том же стенде — Anthropic публикует свой собственный набор (GDPval-AA v2.1 — 1620, OSWorld 2.1 — 72.4%, Terminal-Bench 4.0 — 39.2%), и два вендора использовали разные наборы тестов. Единственное общее измерение — это независимый рейтинг, и там ответ однозначен.

Наряду с математическими оценками стоит отметить: показатель HLE в 22,7 заметно ниже показателя 45,9 без инструментов, который Anthropic приводит для Claude Haiku 5.5. Разные испытательные стенды, так что это не прямое сравнение, но и не разрыв, который можно было бы объяснить выбором стенда.

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

Проблема преемника

Это та часть, которая определяет сравнение для всех, кто планирует за пределами текущего квартала, и она не имеет ничего общего с бенчмарками.

Ling 3.0 Flash объявлен устаревшим в пользу Ling 3.1 Flash. Это не значит, что он перестаёт работать — открытые веса не имеют срока годности, а лицензии MIT нельзя отозвать. Но это значит, что экосистема вокруг него начнёт дрейфовать: поддержка в фреймворках для инференса, выпуски квантованных версий, исправления ошибок и инструменты сообщества — всё это следует за текущей моделью, а устаревшей достаётся лишь остаток этого внимания. Если сегодня вы строите что-то на Ling 3.0 Flash, вы строите на весах, которые заморожены и завершены: это нормально для стабильной рабочей нагрузки и неудобно для всего, что вы рассчитываете улучшать.

У Claude Haiku 5.5 — зеркальный набор гарантий: вы не получаете веса, но получаете вендора, чей коммерческий интерес заключается в том, чтобы модель оставалась быстрой, пропатченной и обслуживаемой, плюс обязательство не выводить её из эксплуатации как минимум до октября 2027 года и опубликованный путь миграции на случай, когда этот срок закончится.

Обе стороны этого маршрута — одним ключом.

Честно о доступности: OrcaRouter не предоставляет Ling 3.0 Flash и не предоставляет Claude Haiku 5.5. Ling 3.0 Flash доступна через собственный канал распространения вендора и несколько сторонних платформ; Claude Haiku 5.5 доступна через A​nthropic API и основные облачные платформы.

Что остаётся — это вопрос маршрутизации, который поднимают обе модели. Claude Haiku 5.5 с 43 и окном в 1M — естественная цель для эскалации; Ling 3.0 Flash со скоростью 333 токена в секунду — естественный кандидат для массового сегмента. Маршрут, который отправляет большой объём хорошо формализованной работы на быстрый уровень, а всё, что не проходит проверку на длину или качество, эскалирует на более сильный, — это именно та схема, которую выстраивает роутер — в OrcaRouter, Claude Haiku 4.5, Claude Sonnet 5.5 и Claude Opus 5.5 от Anthropic уже сегодня в каталоге, наряду с крупными открытыми моделями, такими как DeepSeek V4.1 Flash и GLM 5.3 Flash, так что и сегмент эскалации, и массовый сегмент можно построить и протестировать под нагрузкой уже сейчас. Один ключ, автоматическое переключение при сбое под капотом, прайс-листовые цены провайдеров транслируются с наценкой 0%, так что изменение цены вступает в силу в тот же день.

Какой из двух, и как долго?

Выбирайте Claude Haiku 5.5, если работа не ограничена четкими рамками, если вам нужны изображения или контекстное окно на миллион токенов, если вы хотите, чтобы поставщик нес ответственность за бесперебойную работу, или если вы планируете дальше следующего квартала. Он опережает на 23 пункта Индекса, он актуален, а не устарел, и разница в цене достаточно мала, чтобы разрыв в оценках доминировал.

Выбирайте Ling 3.0 Flash, если нагрузка массовая, чётко определённая и чувствительная к задержкам; если суть в лицензии MIT или открытых весах; или если 80%-ная скидка на кэш для стабильного префикса — это то, где на самом деле формируется ваш счёт. Она быстрее и дешевле в пересчёте на токен, и она действительно хорошо справляется с задачами, которые под силу модели 20-Index. Просто имейте в виду, что вы берёте законченную модель, а не поддерживаемую, и что преемник, на который она указывает, уже существует.