
Claude Haiku 5.5 против Ling 3.1 Flash: модель с 560 миллиардами параметров, которая стоит в четыре раза дороже за каждый ответ
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Их разделяют шесть дней. InclusionAI выпустила Ling 3.1 Flash 1 октября 2026 года; вендор выпустил Claude Haiku 5.5 7 октября. Обе продаются как модели уровня flash, обе имеют контекстное окно в один миллион токенов, и в строках рассуждений единственного независимого бенчмарка, прогнавшего обе, они настолько близки, что разница укладывается в шум. А затем вы доходите до строки, которая измеряет, действительно ли агент доводит дело до конца, — и между ними 26 пунктов; и до строки, которая измеряет, сколько стоит доведённое до конца дело, где модель с 560 миллиардами параметров стоит в четыре с половиной раза дороже той, чьё число параметров никто не публиковал.
Ни одна из тарифных сеток этого не предсказывает. Ling 3.1 Flash указан по цене $0,30 за миллион входных токенов и $0,90 за миллион выходных токенов. Claude Haiku 5.5 указан по цене $0,10 и $0,50 для промптов объёмом до 100 000 токенов, повышаясь до $0,50 и $2,50 сверх этого. Если воспринимать это как цену за токен, Ling втрое дороже по входу и чуть меньше чем вдвое — по выходу, а это тот разрыв, который закрывает сравнение одной строкой.
Это не ставит точку в этом, потому что тарифная сетка рассчитана за токен, а решение — за задачу. Эти два числа выходят из этого сопоставления с противоположными знаками, и причина не в многословности.
Сколько стоит завершённая задача, а не сколько стоит токен
Согласно Artificial Analysis Intelligence Index v4.3.2, измеренная стоимость выполнения одной полной задачи индекса составляет $0,21 для Claude Haiku 5.5 и $0,99 для Ling 3.1 Flash. Это разрыв в 4,6 раза — шире, чем трёхкратное соотношение цен на входные данные, и в том же направлении.
Очевидное объяснение — что дорогая модель просто больше говорит — неверное. Ling 3.1 Flash сгенерировала 100 671 выходной токен на задачу индексирования; Claude Haiku 5.5 — 162 164. Более дешёвая модель — более разговорчивая, причём более чем на 60%. Так что деньги тоже идут не туда, куда указывает тарифная сетка.
Разбейте стоимость на задачу — и она окажется там, где методология индекса фактически её тратит. Из $0.21 Claude Haiku 5.5 примерно 62% приходится на входную часть; у Ling 3.1 Flash из $0.99 — примерно 91%. Это серии рассуждений с интенсивным использованием кэша, и два поставщика оценивают кэшированный входной токен очень по-разному: $0.01 за миллион для Claude Haiku 5.5 против $0.06 за миллион для Ling 3.1 Flash — 6-кратный разрыв по единственной строке, которая доминирует в счёте. В опубликованном прайс-листе сравниваются $0.10 и $0.30. В строке, которая определяет счёт, сравниваются $0.01 и $0.06.
Наш собственный каталог пропускает прайс-листовые цены провайдеров с наценкой 0% — именно так эти две ситуации можно различить в живом счёте, а не в смоделированном. Ling 3.1 Flash отсутствует в каталоге ни в одном написании его вендорского пути, которое нам удалось определить, — ни под InclusionAI, ни под Ling, ни под одной из восьми форм, которые мы пробовали, — поэтому $0.30 и $0.90 выше — это собственные опубликованные тарифы вендора, и сегодня мы не можем маршрутизировать их для вас. Claude Haiku 5.5 тоже нет в каталоге; он работает через собственный API Anthropic. Что каталог действительно предлагает из окружения этого сравнения, так это GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash и Gemini 3.8 Flash — каждый по прейскурантной цене провайдера с наценкой 0%, так что изменение тарифа вендора доходит до нашей стороны в тот же день, что и до их стороны. Если вывод ниже состоит в том, что агентный профиль Ling 3.1 Flash — это то, что нужно вашей рабочей нагрузке, практичным следующим шагом будет прямое сравнение с поддерживающими агентные возможности моделями, которые мы маршрутизируем, на одном ключе с автоматическим переключением при сбое в основе и DSL маршрутизации, когда потолок стоимости должен задаваться в маршруте, а не в коде приложения.

Семь строк, в которых оба были измерены
Artificial Analysis — единственный лидерборд, который прогнал обе модели, и пересечение узкое, но информативное. Строки не согласуются между собой, и направление расхождения не случайно.
• Intelligence Index v4.3.2 — 43,40 у Claude Haiku 5.5 (Max) против 41,09 у Ling 3.1 Flash. Преимущество в 2,31 пункта в пользу Anthropic.
• Стоимость одной завершённой задачи Index — $0,21 против $0,99 на той же доске.
• Время на одну задачу Index — 424,6 секунды у Claude Haiku 5.5 против 360,4 секунды у Ling 3.1 Flash. Это та строка, где ожидание нарушается: модель с 560 миллиардами параметров быстрее из этих двух по всему индексу в целом примерно на 15%.
• Terminal Bench 4.0 — 0,3283 против 0,3333. Ling 3.1 Flash впереди всего на полбалла, а на бенчмарке, на который ссылаются оба вендора, это ничья.
• SciCode — 0,5498 против 0,5405. Claude Haiku 5.5 с отрывом в 0,9 балла. Также ничья.
• Humanity's Last Exam, без инструментов — 0,4439 против 0,3943. Claude Haiku 5.5 — на 5 пунктов впереди, первое реальное разделение.
• AutomationBench, частичная оценка — 0,3541 против 0,6174. Ling 3.1 Flash — на 26 пунктов, причём отрыв шире, чем все остальные разрывы в этом списке вместе взятые.
Есть ещё две строки вне этого общего набора, и их стоит привести, потому что именно их покупатели замечают чаще всего. В GDPval-AA, который Artificial Analysis проводит по 44 профессиям, у этих двух — 1620.05 и 1621.75: статистически неразличимая ничья. В AA-Briefcase v1.1 — оценке длинных профессиональных рабочих задач с рейтингом Elo — Claude Haiku 5.5 показывает 1577.72 против 1400.35 у Ling 3.1 Flash, разрыв в 177 пунктов в пользу Anthropic. Это самое широкое неагентное расхождение между ними где-либо в рейтинге.
Единственная строка, которая должна решать большинство этих разговоров
Усреднённые на уровне индекса показатели скрывают, куда в действительности ушли время и деньги, и эта пара — самый наглядный тому пример в пакете. Показатели по отдельным оценкам на Terminal Bench 4.0 не близки ни по одному измерению, кроме итогового балла.
• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 при $5,49 за задачу и 1 283 секунды на задачу.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 при $0.65 за задачу и 908 секунд на задачу.
Их разделяют пять тысячных пункта оценки. Стоимость выше в 8,4 раза, а реальное время выполнения — в 1,4 раза. Команда, которая читает таблицу бенчмарка и выбирает модель с оценкой 0,3333, согласно собственным подсчётам Artificial Analysis, решила заплатить в восемь раз больше, чтобы получить тот же ответ на треть минуты позже.
Это не аргумент в пользу того, что оценка бессмысленна; это аргумент в пользу того, что оценка — это отношение выполненной работы к предпринятой, и она ничего не говорит о ресурсах, затраченных на достижение результата. Бенчмарки агентного выполнения — это именно та область, где это различие проявляется наиболее остро, потому что агент, который повторяет попытки, — это агент, который платит полную цену за каждую повторную попытку, а модель, которая стоит в восемь раз дороже за попытку, превращает цикл повторных попыток в статью бюджета.

560 миллиардов параметров, и ничего не нужно скачивать
Вот та часть спецификации Ling 3.1 Flash, которая действительно необычна, и дело не в размере.
Ling 3.1 Flash — это разреженная модель на основе смеси экспертов: 560 млрд параметров всего, 25 млрд активных на токен — и Artificial Analysis классифицирует её как проприетарную. Нет ни весов, ни файла лицензии, ни репозитория. Крупная разреженная модель такой конфигурации обычно выходила бы как открытый релиз, потому что именно так поступают остальные в этом сегменте: GLM 5.3 Flash поставляет веса под MIT при 320 млрд общих и 18 млрд активных параметров, а DeepSeek V4.1 Flash поставляет веса под MIT при 552 млрд общих и 16 млрд активных параметров. Ling 3.1 Flash относится к тому же классу архитектуры при том же порядке масштаба, но опубликована только в виде API.
У этого выбора есть последствие, которого строки бенчмарка не показывают. Модель с 25 млрд активных параметров должна где-то обслуживаться, и если вы не можете хранить чекпоинт, вы не можете выбирать, где и с какой маржой — вы арендуете её обслуживание у поставщика. Указанная выше цена задачи Terminal Bench в $5.49 — это в первую очередь не артефакт тарифа за токены; это то, сколько стоит арендовать большую разреженную модель у единственной стороны, способной её запустить. Аналоги с открытыми весами в этом сегменте дают вам возможность самим изменить это число.
Это работает и в обратную сторону, и та же честность здесь применима. Открытый релиз не автоматически становится лучшим продуктом: вместе с весами вы наследуете бремя обслуживания, выбор квантизации и бесконечную гонку обновлений, а файл лицензии — не договор поддержки. Anthropic публикует обязательство о снятии с эксплуатации Claude Haiku 5.5 не ранее 7 октября 2027 года, в API первой стороны и с системной картой. Какой из этих двух вариантов вам нужен — это вопрос о вашей команде, а не о той или иной модели.
Для чего предназначен Ling 3.1 Flash
Прочитайте профиль целиком — и он описывает цельный продукт, а не компромиссный: большая разреженная модель с длинным контекстом, которая завершает автономные многошаговые рабочие процессы лучше всего остального, измеренного в этом ценовом диапазоне, ничем не выделяется в сложных одношаговых рассуждениях и делает это по фиксированной ставке без скачка при увеличении длины промпта. В AutomationBench она опережает Claude Haiku 5.5 на 26 пунктов, а её оценка AA-Briefcase — единственный показатель в этом сравнении, по которому она оказывается позади середины поля, а не в его передней части.
Это оправданное описание пакетного агентного работника: нацельте его на очередь структурированных задач, каждую из которых необходимо выполнить, примите, что задача измеряется минутами, держите промпт достаточно длинным, чтобы пороговый шаг был карательным, и цените надёжность на финишной прямой выше стоимости любого отдельного токена. А вот для чего он плохо подходит — так это для того, ради чего обычно покупают модели уровня flash. Он принимает только текст — без ввода изображений вообще, тогда как Claude Haiku 5.5 принимает текст и изображения. Время выполнения задачи индексации у него короче, но время задачи Terminal Bench длиннее, и при $0.99 за завершённую задачу индексации против $0.21 он тратит в четыре с половиной раза больше, чтобы прийти почти к такому же композитному показателю.

Который из двух, судя по имеющимся доказательствам
Если ваша работа — это текст на входе, текст на выходе, с оплатой за токен при больших объёмах, то Claude Haiku 5.5 побеждает в этом сравнении по каждой строке, которая попадает в счёт: ниже стоимость задачи по индексу, ниже реальная стоимость задачи на бенчмарке, наиболее важном для агентов, выше композитный показатель, лучше оценки длительной профессиональной работы, выше точность, а также поддерживается ввод изображений, которого у другой модели нет вообще.
Если ваша работа — это автономный агент, которому нужно выполнить многошаговый рабочий процесс, Ling 3.1 Flash набирает на 26 баллов больше, чем Claude Haiku 5.5, в единственном общем бенчмарке, который измеряет именно это, и это стоит проверить, а не отвергать из-за цены. Проверяйте его на собственном трейсе, а не по этой таблице — и оценивайте тест в расчёте на выполненное задание, потому что именно это число меняется, когда агент совершает повторные попытки.
Если вам нужен доступ к весам, ни одна из этих двух моделей вам не подойдёт. Ling 3.1 Flash — проприетарная модель на 560 миллиардов параметров; Claude Haiku 5.5 — проприетарная, а число параметров не опубликовано. Открытые релизы в этом классе находятся в другом месте табло, и это сравнение начинается с совершенно другого набора строк.
Композитный показатель говорит о 2,31 балла. Агентный бенчмарк говорит о 26 в другую сторону. Тарифная карта говорит о 3× на входе; стоимость завершённой задачи говорит о 4,6× в том же направлении, что и карта. Четыре числа, два направления — вот почему единственный надёжный способ разрешить это — прогнать оба на трассировке вашей собственной работы и считывать стоимость по завершённым задачам, а не по токенам.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
