Титульная карточка главного баннера для «Ling-3.1-flash vs DeepSeek V4.1 Flash», с подзаголовком «Два пункта индекса, тройной счёт». Две скруглённые карточки расположены рядом друг с другом с чётким промежутком между ними: левая, с подписью «Ling-3.1-flash», содержит «AA Index: 41», «Стоимость за задачу: $0,99», «Веса: закрытые»; правая, с подписью «DeepSeek V4.1 Flash (Max)», содержит «AA Index: 39», «Стоимость за задачу: $0,27», «Веса: MIT». В строке нижнего колонтитула указано: «Затраты и значения индекса — по данным Artificial Analysis». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Ling-3.1-flash против DeepSeek V4.1 Flash: два пункта индекса, втрое больший счёт

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ling-3.1-flash и DeepSeek V4.1 Flash (Max) различаются на два пункта в Artificial Analysis Intelligence Index — 41 против 39 — и совсем не близки друг к другу по цене. Прогоните десять оценок, из которых состоит этот индекс, для каждой модели — и Ling-3.1-flash обойдётся примерно в $0.99 за задачу против $0.27 у DeepSeek. Обе — это модели mixture-of-experts примерно с 550 млрд параметров и заявленным контекстом в 1 млн токенов. Одна — закрытая текстовая модель из лаборатории InclusionAI компании Ant Group, выпущенная 2026-10-01 и до сих пор без опубликованных весов или лицензии. Другая открыта под лицензией MIT с 2026-09-10, работает и с изображениями, и с текстом, доступна у 23 провайдеров и является той моделью, которую большинство команд уже имели бы в конфигурационном файле. По большинству осей сравнение не является близким. Интересный вопрос — почему эти два пункта вообще существуют.

Где Ling-3.1-flash действительно впереди

Он опережает по оценкам, которые измеряют работу с терминалом и написание кода, который должен запускаться, и этот отрыв стоит указать точно, потому что агрегированный показатель его скрывает.

• Terminal-Bench 4.0 — Ling-3.1-flash 0,333 против DeepSeek V4.1 Flash (Max) 0,268. В абсолютных значениях оба результата скромные; разрыв составляет четверть результата DeepSeek.

• SciCode — 0.541 против 0.519.

• Рассуждения по физике CritPt — 0,180 против 0,143.

• GDPval-AA — агентная работа в реальных условиях — 1 621,75 Elo против 1 600 Elo.

Две из этих четырёх — почти равные результаты, одна — победа с минимальным отрывом, и Terminal-Bench 4.0 — единственная строка, где разница сохранилась бы при смене seed. Сопоставьте это с тем, где выигрывает DeepSeek: AA-Briefcase v1.1 (агентная работа со знаниями) — 1 420,47 Elo против 1 400,35, AutomationBench-AA — 0,689 против 0,617, AA-LCR (рассуждения с длинным контекстом) — 0,84 против 0,83, и — строка, которая важнее всего для продакшена, — AA-Omniscience — −5,30 против +2,22 у Ling-3.1-flash по метрике, где галлюцинация хуже отказа. Точность DeepSeek там составляет 46,4% при уровне галлюцинаций 96,5% среди вопросов, на которые он отвечает; Ling-3.1-flash отвечает правильно на 29,1% с уровнем галлюцинаций 37,9%. Ни одну из них нельзя нацелить на базу знаний без поиска перед ней.

Разрыв в ценах больше, чем разрыв в индексе, и дело не только в тарифной карте.

Основные тарифы выглядят почти одинаково. Artificial Analysis указывает для обоих $0,30 за миллион входных токенов. А вот по двум другим показателям они резко расходятся:

• Вывод — Ling-3.1-flash $0,90 за миллион против DeepSeek V4.1 Flash (Max) $1,20 за миллион. Здесь Ling-3.1-flash — однозначно более дешёвая модель, на 25 %.

• Чтение из кэша — Ling-3.1-flash $0,06 за миллион против DeepSeek V4.1 Flash (Max) $0,006 за миллион: скидка 98% против 80%. Именно здесь эти две модели перестают быть сопоставимыми.

Смешанная цена при соотношении попаданий в кэш / входных / выходных токенов 7:2:1 составляет $0,192 для Ling-3.1-flash и $0,184 для DeepSeek V4.1 Flash (Max) — почти без разницы. Но это смешение — допущение о том, как вы используете модель, и от этого допущения многое зависит. Любая нагрузка с активным повторным использованием промпта — длинный системный промпт, вводная часть для поиска, агентный цикл, который заново отправляет накопленный контекст на каждом шаге, — сдвигает эффективное соотношение в сторону чтения из кэша, и там в игру вступает 10-кратная разница в цене кэша. Объём токенов накладывается таким же образом: Ling-3.1-flash — многословный ризонер, генерирующий 220 млн выходных токенов по всем оценкам индекса против 250 млн у DeepSeek, и в среднем примерно 357 секунд на задачу оценки против 285 у DeepSeek. Он больше думает над каждым ответом и тратит на это больше времени.

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Разобранный пример: один и тот же цикл агента на обоих

Возьмём агента, управляющего инструментами, который обрабатывает 1 млн входных токенов на задачу, причём 90% из них обслуживаются из кеша, и возвращает 200 000 выходных токенов. На Ling-3.1-flash при указанных выше цифрах: 900 000 кешированных входных токенов по $0,06 плюс 100 000 новых входных токенов по $0,30 плюс 200 000 выходных токенов по $0,90 — это около $0,26 за задачу. Тот же цикл на DeepSeek V4.1 Flash (Max) даёт около $0,14 — примерно вдвое меньше.

Теперь примените расписание DeepSeek, потому что именно эту часть большинство сравнений пропускает. Тариф DeepSeek в непиковое время — тот, что выше, и непиковое время охватывает выходные и большую часть дня; но в течение двух окон по будням, 01:00–04:00 и 06:00–10:00 UTC, цены на ввод и кэш удваиваются. Перенесите тот же цикл в пиковое окно, и стоимость DeepSeek окажется около $0.28 — в этот момент фиксированная, более высокая тарифная сетка Ling-3.1-flash становится более дешёвым вариантом для этого часа, а 10-кратная скидка на кэш оказывается сведена на нет часами.

Вся суть решения — в одной паре чисел. Если трафик ваших агентов в основном кэшируемый и вы можете планировать его, DeepSeek V4.1 Flash (Max) стоит примерно вдвое дешевле Ling-3.1-flash при разнице в индексе в два пункта. Если трафик ваших агентов в основном кэшируемый и попадает в пиковые окна DeepSeek, эти две модели стоят примерно одинаково, и тогда чуть лучший показатель terminal-agent у Ling-3.1-flash становится решающим фактором.

Оси, по которым не требуется сравнение

Три параметра сильно различаются, и именно они обычно определяют архитектуру ещё до того, как речь заходит о цене.

• Веса и лицензия — у Ling-3.1-flash нет опубликованных весов и текста лицензии, а Artificial Analysis классифицирует её как проприетарную. DeepSeek V4.1 Flash (Max) — открытые веса под лицензией MIT, доступные для скачивания на Hugging Face, коммерческое использование разрешено. Одну из этих моделей можно развернуть на своём сервере, дообучить и использовать в изолированном контуре; другую — нет.

• Модальность — Ling-3.1-flash работает с текстом на входе и текстом на выходе. DeepSeek V4.1 Flash (Max) принимает изображения вместе с текстом и оценивается по мультимодальным бенчмаркам. Если какой-либо компонент вашего пайплайна передаёт модели скриншот, диаграмму или скан, сравнение на этом заканчивается.

• Поверхность обслуживания — DeepSeek V4.1 Flash (Max) доступна через 23 провайдера, включая OrcaRouter; Ling-3.1-flash работает через собственный API вендора и сторонние платформы, на которых представлен её релиз. Для продакшена количество провайдеров — это свойство отказоустойчивости, а не конкурс популярности.

Ещё одна асимметрия, которая не отражена ни в одном из этих списков: DeepSeek V4.1 Flash (Max) предоставляет 384 000 выходных токенов в одном ответе. Ant не опубликовала максимальную длину вывода для Ling-3.1-flash, поэтому рабочую нагрузку с длинной генерацией пока нельзя соразмерить с ней. Отсутствие опубликованного лимита — не то же самое, что небольшой лимит, но и не число, под которое можно проектировать.

Запуск обоих, и как это на самом деле выглядит

Ling-3.1-flash сегодня нет в каталоге OrcaRouter — запрос к нашему публичному API моделей возвращает not-found для этой модели в разделе InclusionAI, и этот материал не станет делать вид, что это не так. DeepSeek V4.1 Flash доступна для маршрутизации прямо сейчас по прейскурантной цене без наценки, поэтому изменение цены вендором вступает в силу на нашей стороне в тот же день, когда оно происходит, а доступ к ней открывается по тому же единственному API-ключу, что и ко всему остальному каталогу, с автоматическим переключением между вышестоящими провайдерами при сбое.

Эта асимметрия имеет практическое выражение. Разумный способ проводить сравнение, когда одна модель закрыта, стоит примерно в четыре раза дороже своей предшественницы и доступна только через одного поставщика, — оставить открытую, широко обслуживаемую модель путём по умолчанию, а к претенденту относиться как к тому, что вы тестируете, а не как к тому, на что вы делаете ставку. DeepSeek V4.1 Flash (Max) уже сегодня может вытягивать продакшен-цикл — открытые веса, ввод изображений, вывод 384K, скидка 98% на кэш, — тогда как Ling-3.1-flash достаётся работа, специфичная для агентов, где её преимущества по Terminal-Bench и SciCode действительно применимы. Поскольку обе поддерживают OpenAI-совместимый формат chat-completions, это разделение — решение о маршрутизации, а не проект по интеграции: одна конечная точка, один ключ и правило, которое направляет задачи той модели, где она измеримо лучше.

Вердикт

По имеющимся данным, DeepSeek V4.1 Flash (Max) побеждает в этом противостоянии, и побеждает в основном за счёт факторов, не имеющих отношения к двум баллам Index: открытые веса под лицензией MIT, ввод изображений, 384 000 выходных токенов, 98-процентная скидка на кеш и 23 провайдера, между которыми можно переключаться при сбое. Позиция Ling-3.1-flash более узкая, но реальная — он лучший из двух агент для терминала и инструментов, и это единственный из пары, кто не опубликовал тарифную сетку со встроенным коэффициентом за пиковые часы.

Две вещи изменили бы эту оценку. Если Ant опубликует веса под разрешительной лицензией, разрыв в открытости закроется, и сравнение превратится в разговор исключительно о возможностях и стоимости. А если обслуживаемое Ant окно длинного контекста подтвердится на заявленных обеими моделями 1 млн токенов, утверждение о паритете контекста перестанет быть просто утверждением. До тех пор честный вывод таков: модель может выиграть строку агентного бенчмарка и всё равно проиграть оценку — и разрыв в два пункта по индексу между этими моделями стоит примерно 3,6× стоимости за задачу, а на такой компромисс стоит идти только конкретной рабочей нагрузке.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube