Сгенерированная редакционная hero-карточка с заголовком «Ling-3.1-flash vs Qwen3.8-Flash» и подзаголовком «Два ответа на один и тот же вопрос: как построить быстрый тир?» Левая панель с заголовком «Масштабировать и анонсировать» содержит подпись «~560B всего · ~25B активных · 1M контекст» и тег «веса: скоро появятся». Правая панель с заголовком «Уменьшить и выпустить» содержит «125B всего · 6B активных · превью Qwen4» и тег «веса: на Hugging Face».
Engineering & Research

Ling-3.1-flash против Qwen3.8-Flash: два способа построить быстрый уровень, и только один из них доходит до релиза

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две китайские лаборатории этой осенью взялись за одну и ту же проблему — как построить дешёвую, быструю модель, достаточно хорошую, чтобы работать внутри агентного цикла, — и пришли к противоположным ответам. Ling-3.1-flash, анонсированная Ant Group 30 сентября 2026 года, — это mixture-of-experts примерно на 560 миллиардов параметров, активирующая около 25 миллиардов параметров на токен, с заявленным контекстным окном до 1 миллиона токенов и озвученным намерением открыть исходный код «скоро». Qwen3.8-Flash, выпущенная командой Aliba​s Qwe​n 26 августа 2026 года, — это мультимодальная mixture-of-experts на 125 миллиардов параметров, активирующая около 6 миллиардов параметров на токен, с весами, уже опубликованными на Hugging Face под названием Qwen3.8-Flash-Next, продакшен-модель, доступная в QwenCloud API по цене $0.15 за миллион входных токенов и $0.47 за миллион выходных, и поддержкой с первого дня в SGLang. Одна лаборатория увеличила масштаб и анонсировала. Другая уменьшила и выпустила. Эта разница поучительнее любого бенчмарка, опубликованного обеими лабораториями.

Это также причина, по которой к этому сравнению следует относиться внимательно. У Ling-3.1-flash нет весов, нет лицензии, нет карточки модели, нет цены API и нет независимой оценки; вся опубликованная информация — это анонсирующий пост, график бенчмарков от вендора и позиция в собственном продукте Ant — Ling Studio. У Qwen3.8-Flash есть всё это, а также четырёхнедельная фора в том, что его запускают люди, не работающие в Alibaba. Сравнивать архитектурный выбор — справедливо. Сравнивать возможности — пока нет.

Два проектных решения и почему они расходятся

Ставка Qwen в том, что быстрый уровень должен структурно отличаться от флагмана, а не просто быть меньше него. Qwen3.8-Flash активирует 6 млрд из своих 125 млрд параметров — примерно 95% разреженности — и получает свои возможности за счёт того, куда направляются вычисления, а не за счёт одной лишь широты. Alibaba прямо заявила, что лежащая в основе архитектура, которая сочетает Gated DeltaNet с Qwen Sparse Attention и таблицей N-граммных эмбеддингов, представляет собой ранний предпросмотр поколения Qwen4, намеренно опубликованный заранее, чтобы движки вывода, инструменты квантизации и схемы развёртывания могли созреть вокруг неё до того, как поверх неё будут построены дорогостоящие модели. В результате получилась модель, которая по построению дёшева в расчёте на токен: около 6 млрд параметров работы на каждый токен, по цене, которую Alibaba установила в $0,15 за вход и $0,47 за выход за миллион токенов.

Ставка Ant, насколько это позволяет понять анонс, ближе к традиционному масштабированию с очень длинным контекстом. Ling-3.1-flash сохраняет большую долю активных параметров — примерно 25 млрд параметров на токен из 560 млрд, то есть примерно одна двадцать вторая — и заявляет окно размером до 1 млн токенов, в четыре раза больше, чем у предыдущего поколения Ling. Приложение Ling Studio описывает его как созданное для «агентов общего назначения, поиска, рутинной офисной работы и разработки ПО/кода», что является позиционированием в быстром сегменте, но экономика параметров здесь как у гораздо более тяжёлой модели. На одинаковом входе токен, проходящий через 25 млрд активных параметров, требует примерно в четыре раза больше вычислений, чем токен, проходящий через 6 млрд, ещё до того, как в дело вступает какое-либо решение о ценообразовании.

Ни один из подходов не является ошибочным, и оба — обоснованные ответы на вопрос «что ограничивает дешёвую модель». Qwen делает ставку на то, что потолок — это разреженность и новый стек внимания. Ant делает ставку на то, что потолок — это контекст и знания о мире, и что может позволить себе эти вычисления. Что отличает их для читателя — не философия дизайна, а форма поставки: дизайн, который можно скачать и измерить, в отличие от дизайна, о котором можно только прочитать.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Сколько вам стоит каждый из них и что это значит на практике

Ценовой разрыв не тонок и не мал. Qwen3.8-Flash опубликован по цене $0,15 за миллион входных токенов, $0,47 за миллион выходных и $0,018 за миллион при чтении из кэша — одни и те же цифры в анонсе Alibaba, в производственной карточке модели от вендора и на странице маршрутизируемой модели, которую мы обслуживаем; именно так выглядит сквозная передача с наценкой 0%, если проверить её по трём источникам. Ant вообще не публиковала тариф для Ling-3.1-flash — ни цены API, ни скидки на кэш, ничего сопоставимого. Единственная опубликованная цифра для линейки Ling — это цифра предыдущего поколения: $0,075 за вход и $0,22 за выход за миллион, примерно половина входного тарифа Qwen и меньше половины его выходного тарифа. Если новый уровень Ling будет стоить около того, где находился старый, он на бумаге окажется дешевле Qwen3.8-Flash; если его цена будет хоть отдалённо близка к объёму вычислений, который подразумевают его 25B активных параметров, то нет. Это в любом случае лишь догадка, потому что числа не существует.

Именно в контексте заявка Ling действительно крупнее. Ant заявляет до 1 млн токенов для Ling-3.1-flash; Qwen3.8-Flash поставляется с контекстом по умолчанию размером 1 млн токенов в production API и с нативным окном 262 144 токена в открытых весах, которое можно расширить. С цифрой Ling связаны две оговорки, и ни одна из них не снята. Во-первых, «до 1 млн» — это спецификация, а не измерение: никто не публиковал поведение при извлечении из длинного контекста для модели, которую никто за пределами Ant не может вызвать. Во-вторых, у предыдущего поколения Ling был ровно такой же разрыв между заявленным окном и архитектурной историей за ним, и ответ появился только тогда, когда веса, формат и ограничения контекста наконец опубликовали. Цифра 1 млн в заголовке — это обещание. 1 млн у Qwen3.8-Flash — это обслуживаемое значение по умолчанию, с которым можно сопоставить заявку Ant.

Почему «предварительный просмотр» — честное слово на одной стороне этого

То, как сама Alibaba позиционирует Qwen3.8-Flash, сводится к следующему: это предварительный показ архитектуры, выпущенный под именем серийного продукта, — открытые веса несут суффикс «Next» именно для того, чтобы никто не спутал прототип с настроенной моделью для обслуживания. Это позиционирование подтвердили не маркетинговые материалы, а сами события: SGLang обеспечил поддержку Qwen3.8-Flash-Next в день выпуска, модель также была настроена для Transformers, vLLM и TokenSpeed, а веса с тех пор подхватили сообщества, занимающиеся квантованием. Версии быстро стали обыденностью — именно так и выглядит выпущенная модель.

Анонс Ant имеет ту же форму, только на шаг раньше: публикация спецификации до релиза, с прямым заявлением, что модель скоро станет открытой. Это законный способ запуска — Ling-3.0-flash в точности прошёл этот путь в июле, а веса вышли под лицензией MIT 7 августа, примерно двумя неделями позже. Но сегодняшнее состояние этих двух проектов несопоставимо, и никакое чтение графиков не закроет этот разрыв. Стоит конкретно сказать, что человек со стороны может привнести в каждый из них.

Что сегодня можно независимо проверить в отношении Ling-3.1-flash: что анонс существует и датирован 30 сентября; что показатели параметров, активных параметров и контекста — это собственные данные Ant; что модель присутствует в продукте Ant Ling Studio; и что ни веса, ни лицензия, ни карточка модели не опубликованы. Что можно независимо проверить в отношении Qwen3.8-Flash: что веса доступны для скачивания в BF16 и FP8; что условия лицензии доступны для чтения; что цена API опубликована; и что заявленные Alibaba результаты бенчмарков открыты для воспроизведения с конца августа. Второй список длиннее — и это всё сравнение в миниатюре.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

Как бы эти два на самом деле оценивались

Ant опубликовала карточку бенчмарка с Ling-3.1-flash, где она противопоставлена GPT-5.6 Sol, Claude Opus 5, Kimi K3, двум вариантам GLM и DeepSeek-V4.1-Flash, с ключевыми показателями 1,673 Elo на GDPVal-AA v2.1, 75.16 на FrontierSWE и 65.35 на HealthBench Professional. На этой карточке есть две проблемы ещё до того, как кто-либо начнёт спорить о цифрах. Первая — набор для сравнения: обе передовые модели, которые выбрала Ant, отстают на поколение, поскольку Claude Opus 5.5 и GPT-6 Sol вышли 22 сентября 2026 года и сейчас доступны для маршрутизации, а значит, карточка сравнивает октябрьскую модель с июльским фронтиром, а не с текущим. Вторая — сноска на самой карточке, где сказано, что результат HealthBench Professional был получен в «среде AQ» и что медицинские возможности модели сейчас можно испытать только в AQ — среде, которую не описывает ни один публичный документ. Ключевой показатель, среда оценки которого не названа, невозможно воспроизвести даже в принципе.

Сопоставимые утверждения Qwen3.8-Flash, напротив, прозвучали, когда веса уже были опубликованы, и Alibaba сделала ставку в своём позиционировании на утверждении, которое может проверить каждый: что именно коэффициент разреженности, а не количество параметров, лежит в основе возможностей. Четыре недели использования — это не вердикт, но это достаточно долго, чтобы утверждения перестали быть бесспорными, — а это полезное состояние для модели.

Что с этим вообще делать сегодня

Для разработчиков практическое разделение простое. Ling-3.1-flash — это не компонент, который можно внедрить на этой неделе: нет endpoint’а, к которому можно обратиться, нет весов, которые можно разместить у себя, нет лицензии, которую можно проверить, и нет цены, под которую можно закладывать бюджет. Какой бы ни оказалась финальная модель, полезный шаг прямо сейчас — установить триггер — веса опубликованы, лицензия разрешительная, независимая оценка на FrontierSWE где-то около 75.16 — и вернуться к этому позже. История самого предыдущего поколения показывает, что веса могут появиться через две недели после анонса, так что этот триггер может сработать быстро.

Qwen3.8-Flash — уже компонент. Он доступен в нашем каталоге как маршрутизируемая модель по прайсовой цене провайдера с нулевой наценкой — в карточке маршрута указано $0.15 за вход, $0.47 за выход и $0.018 за миллион чтений кэша, те же цифры, что публикует Alibaba, и именно это означает политика 0% наценки на практике, а не на слайде. За одним ключом она стоит рядом с Claude Opus 5, GPT-5.6 Sol и DeepSeek-V4.1-Flash, так что сравнение, к которому приглашает Ant — кандидат против текущего фронтира, — можно провести, направив конфиг на два маршрута вместо поддержки двух интеграций, а автоматическое переключение при сбое возьмёт на себя те выходные, когда провайдер забарахлит. В этом и разница между разговором об архитектуре и экспериментом.

Вердикт, насколько его вообще можно вынести: Qwen сделала более смелую архитектурную ставку и имела смелость опубликовать её рано и позволить людям разобрать её по частям. Ant сделала более тяжёлую ставку — больше параметров, больше активных вычислений на токен, больше контекста — и пока что опубликовала график вместо модели. График выглядит хорошо. График ещё и единственное, что у кого-либо есть.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно