
Ling-3.1-flash против DeepSeek V4.1 Flash: два пункта индекса, втрое больший счёт
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Ling-3.1-flash и DeepSeek V4.1 Flash (Max) различаются на два пункта в Artificial Analysis Intelligence Index — 41 против 39 — и совсем не близки друг к другу по цене. Прогоните десять оценок, из которых состоит этот индекс, для каждой модели — и Ling-3.1-flash обойдётся примерно в $0.99 за задачу против $0.27 у DeepSeek. Обе — это модели mixture-of-experts примерно с 550 млрд параметров и заявленным контекстом в 1 млн токенов. Одна — закрытая текстовая модель из лаборатории InclusionAI компании Ant Group, выпущенная 2026-10-01 и до сих пор без опубликованных весов или лицензии. Другая открыта под лицензией MIT с 2026-09-10, работает и с изображениями, и с текстом, доступна у 23 провайдеров и является той моделью, которую большинство команд уже имели бы в конфигурационном файле. По большинству осей сравнение не является близким. Интересный вопрос — почему эти два пункта вообще существуют.
Где Ling-3.1-flash действительно впереди
Он опережает по оценкам, которые измеряют работу с терминалом и написание кода, который должен запускаться, и этот отрыв стоит указать точно, потому что агрегированный показатель его скрывает.
• Terminal-Bench 4.0 — Ling-3.1-flash 0,333 против DeepSeek V4.1 Flash (Max) 0,268. В абсолютных значениях оба результата скромные; разрыв составляет четверть результата DeepSeek.
• SciCode — 0.541 против 0.519.
• Рассуждения по физике CritPt — 0,180 против 0,143.
• GDPval-AA — агентная работа в реальных условиях — 1 621,75 Elo против 1 600 Elo.
Две из этих четырёх — почти равные результаты, одна — победа с минимальным отрывом, и Terminal-Bench 4.0 — единственная строка, где разница сохранилась бы при смене seed. Сопоставьте это с тем, где выигрывает DeepSeek: AA-Briefcase v1.1 (агентная работа со знаниями) — 1 420,47 Elo против 1 400,35, AutomationBench-AA — 0,689 против 0,617, AA-LCR (рассуждения с длинным контекстом) — 0,84 против 0,83, и — строка, которая важнее всего для продакшена, — AA-Omniscience — −5,30 против +2,22 у Ling-3.1-flash по метрике, где галлюцинация хуже отказа. Точность DeepSeek там составляет 46,4% при уровне галлюцинаций 96,5% среди вопросов, на которые он отвечает; Ling-3.1-flash отвечает правильно на 29,1% с уровнем галлюцинаций 37,9%. Ни одну из них нельзя нацелить на базу знаний без поиска перед ней.
Разрыв в ценах больше, чем разрыв в индексе, и дело не только в тарифной карте.
Основные тарифы выглядят почти одинаково. Artificial Analysis указывает для обоих $0,30 за миллион входных токенов. А вот по двум другим показателям они резко расходятся:
• Вывод — Ling-3.1-flash $0,90 за миллион против DeepSeek V4.1 Flash (Max) $1,20 за миллион. Здесь Ling-3.1-flash — однозначно более дешёвая модель, на 25 %.
• Чтение из кэша — Ling-3.1-flash $0,06 за миллион против DeepSeek V4.1 Flash (Max) $0,006 за миллион: скидка 98% против 80%. Именно здесь эти две модели перестают быть сопоставимыми.
Смешанная цена при соотношении попаданий в кэш / входных / выходных токенов 7:2:1 составляет $0,192 для Ling-3.1-flash и $0,184 для DeepSeek V4.1 Flash (Max) — почти без разницы. Но это смешение — допущение о том, как вы используете модель, и от этого допущения многое зависит. Любая нагрузка с активным повторным использованием промпта — длинный системный промпт, вводная часть для поиска, агентный цикл, который заново отправляет накопленный контекст на каждом шаге, — сдвигает эффективное соотношение в сторону чтения из кэша, и там в игру вступает 10-кратная разница в цене кэша. Объём токенов накладывается таким же образом: Ling-3.1-flash — многословный ризонер, генерирующий 220 млн выходных токенов по всем оценкам индекса против 250 млн у DeepSeek, и в среднем примерно 357 секунд на задачу оценки против 285 у DeepSeek. Он больше думает над каждым ответом и тратит на это больше времени.

Разобранный пример: один и тот же цикл агента на обоих
Возьмём агента, управляющего инструментами, который обрабатывает 1 млн входных токенов на задачу, причём 90% из них обслуживаются из кеша, и возвращает 200 000 выходных токенов. На Ling-3.1-flash при указанных выше цифрах: 900 000 кешированных входных токенов по $0,06 плюс 100 000 новых входных токенов по $0,30 плюс 200 000 выходных токенов по $0,90 — это около $0,26 за задачу. Тот же цикл на DeepSeek V4.1 Flash (Max) даёт около $0,14 — примерно вдвое меньше.
Теперь примените расписание DeepSeek, потому что именно эту часть большинство сравнений пропускает. Тариф DeepSeek в непиковое время — тот, что выше, и непиковое время охватывает выходные и большую часть дня; но в течение двух окон по будням, 01:00–04:00 и 06:00–10:00 UTC, цены на ввод и кэш удваиваются. Перенесите тот же цикл в пиковое окно, и стоимость DeepSeek окажется около $0.28 — в этот момент фиксированная, более высокая тарифная сетка Ling-3.1-flash становится более дешёвым вариантом для этого часа, а 10-кратная скидка на кэш оказывается сведена на нет часами.
Вся суть решения — в одной паре чисел. Если трафик ваших агентов в основном кэшируемый и вы можете планировать его, DeepSeek V4.1 Flash (Max) стоит примерно вдвое дешевле Ling-3.1-flash при разнице в индексе в два пункта. Если трафик ваших агентов в основном кэшируемый и попадает в пиковые окна DeepSeek, эти две модели стоят примерно одинаково, и тогда чуть лучший показатель terminal-agent у Ling-3.1-flash становится решающим фактором.
Оси, по которым не требуется сравнение
Три параметра сильно различаются, и именно они обычно определяют архитектуру ещё до того, как речь заходит о цене.
• Веса и лицензия — у Ling-3.1-flash нет опубликованных весов и текста лицензии, а Artificial Analysis классифицирует её как проприетарную. DeepSeek V4.1 Flash (Max) — открытые веса под лицензией MIT, доступные для скачивания на Hugging Face, коммерческое использование разрешено. Одну из этих моделей можно развернуть на своём сервере, дообучить и использовать в изолированном контуре; другую — нет.
• Модальность — Ling-3.1-flash работает с текстом на входе и текстом на выходе. DeepSeek V4.1 Flash (Max) принимает изображения вместе с текстом и оценивается по мультимодальным бенчмаркам. Если какой-либо компонент вашего пайплайна передаёт модели скриншот, диаграмму или скан, сравнение на этом заканчивается.
• Поверхность обслуживания — DeepSeek V4.1 Flash (Max) доступна через 23 провайдера, включая OrcaRouter; Ling-3.1-flash работает через собственный API вендора и сторонние платформы, на которых представлен её релиз. Для продакшена количество провайдеров — это свойство отказоустойчивости, а не конкурс популярности.
Ещё одна асимметрия, которая не отражена ни в одном из этих списков: DeepSeek V4.1 Flash (Max) предоставляет 384 000 выходных токенов в одном ответе. Ant не опубликовала максимальную длину вывода для Ling-3.1-flash, поэтому рабочую нагрузку с длинной генерацией пока нельзя соразмерить с ней. Отсутствие опубликованного лимита — не то же самое, что небольшой лимит, но и не число, под которое можно проектировать.
Запуск обоих, и как это на самом деле выглядит
Ling-3.1-flash сегодня нет в каталоге OrcaRouter — запрос к нашему публичному API моделей возвращает not-found для этой модели в разделе InclusionAI, и этот материал не станет делать вид, что это не так. DeepSeek V4.1 Flash доступна для маршрутизации прямо сейчас по прейскурантной цене без наценки, поэтому изменение цены вендором вступает в силу на нашей стороне в тот же день, когда оно происходит, а доступ к ней открывается по тому же единственному API-ключу, что и ко всему остальному каталогу, с автоматическим переключением между вышестоящими провайдерами при сбое.
Эта асимметрия имеет практическое выражение. Разумный способ проводить сравнение, когда одна модель закрыта, стоит примерно в четыре раза дороже своей предшественницы и доступна только через одного поставщика, — оставить открытую, широко обслуживаемую модель путём по умолчанию, а к претенденту относиться как к тому, что вы тестируете, а не как к тому, на что вы делаете ставку. DeepSeek V4.1 Flash (Max) уже сегодня может вытягивать продакшен-цикл — открытые веса, ввод изображений, вывод 384K, скидка 98% на кэш, — тогда как Ling-3.1-flash достаётся работа, специфичная для агентов, где её преимущества по Terminal-Bench и SciCode действительно применимы. Поскольку обе поддерживают OpenAI-совместимый формат chat-completions, это разделение — решение о маршрутизации, а не проект по интеграции: одна конечная точка, один ключ и правило, которое направляет задачи той модели, где она измеримо лучше.
Вердикт
По имеющимся данным, DeepSeek V4.1 Flash (Max) побеждает в этом противостоянии, и побеждает в основном за счёт факторов, не имеющих отношения к двум баллам Index: открытые веса под лицензией MIT, ввод изображений, 384 000 выходных токенов, 98-процентная скидка на кеш и 23 провайдера, между которыми можно переключаться при сбое. Позиция Ling-3.1-flash более узкая, но реальная — он лучший из двух агент для терминала и инструментов, и это единственный из пары, кто не опубликовал тарифную сетку со встроенным коэффициентом за пиковые часы.
Две вещи изменили бы эту оценку. Если Ant опубликует веса под разрешительной лицензией, разрыв в открытости закроется, и сравнение превратится в разговор исключительно о возможностях и стоимости. А если обслуживаемое Ant окно длинного контекста подтвердится на заявленных обеими моделями 1 млн токенов, утверждение о паритете контекста перестанет быть просто утверждением. До тех пор честный вывод таков: модель может выиграть строку агентного бенчмарка и всё равно проиграть оценку — и разрыв в два пункта по индексу между этими моделями стоит примерно 3,6× стоимости за задачу, а на такой компромисс стоит идти только конкретной рабочей нагрузке.


