Сгенерированная редакционная hero-карточка под названием «Ling-3.1-flash против Gemini 3.8 Flash» с подзаголовком «Бесплатная пробная версия на 256K против производственного API на 1M токенов». Две строки сравнения гласят: «Ling-3.1-flash: бесплатная двухнедельная пробная версия, контекст 262 144 токена, веса не опубликованы» и «Gemini 3.8 Flash: $0.75 / $3.75 за 1M токенов, контекст 1 048 576 токенов, мультимодальный ввод», над нижним колонтитулом с текстом «Показатели Ling предоставлены производителем; показатели Gemini по данным OrcaRouter и Artificial Analysis».
Guides & Insights

Ling-3.1-flash против Gemini 3.8 Flash: пробная модель на 256K против действующей модели на 1M токенов

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте Ling-3.1-flash и Gemini 3.8 Flash рядом — и несоответствие окажется не в интеллекте, а в статусе. Ling-3.1-flash, mixture-of-experts от Ant Group с ~560 млрд параметров, анонсированная 29–30 сентября 2026 года, — это бесплатная двухнедельная пробная версия с обслуживаемым контекстом 256K, лимитом вывода в 32 768 токенов, только текстовым вводом и без опубликованных весов, лицензии или цены. Gemini 3.8 Flash, модель рассуждений уровня Flash от Google, выпущенная 2 сентября 2026 года, — это общедоступный API с полным окном в 1 048 576 токенов, выводом в 65 536 токенов, мультимодальным вводом и публичной тарифной сеткой. На бумаге это сравнение двух моделей; на практике — сравнение модели, на которой можно строить уже сегодня, с той, которую можно только протестировать в этом месяце.

Это не повод отвергать Ling-3.1-flash. Бесплатная 560B MoE с агентным уклоном стоит двух недель чьего угодно времени на оценку. Но это меняет то, для чего нужно очное сравнение: не «что мне выбрать в качестве стандарта», а «достаточно ли хороша пробная модель, чтобы мне подстраховаться насчёт ответа через пятнадцать дней». Это разные вопросы, и по каждой из осей ниже у них разные ответы.

Три вещи, которые решают исход ещё до того, как это сделает любой бенчмарк

Большинство сравнений начинается со счёта. Это следует начать с доступности, потому что разрыв там — не вопрос степени.

• Цены — Ling-3.1-flash бесплатен на протяжении пробного периода, и опубликованной тарифной сетки после его окончания у него нет вообще. Gemini 3.8 Flash в течение промо-периода указан по цене $0,75 за миллион входных токенов и $3,75 за миллион выходных, а с 1 января 2027 года вернётся к $1,50 / $7,50. Цены из прайс-листа, заявленные производителем; обе могут измениться.

• Контекст — Ling-3.1-flash обслуживает 262 144 токена в пробной версии, а 1 000 000 заявлены как конечная цель. Gemini 3.8 Flash уже сегодня поддерживает полные 1 048 576 токенов. Если ваша рабочая нагрузка зависит от окна в миллион токенов, сейчас оно есть только у одного из этих двух.

• Веса — у Ling-3.1-flash опубликованных весов нет: ни репозитория, ни лицензии, ни чекпоинта — лишь заявленное намерение открыть исходный код после испытательного периода. Gemini 3.8 Flash закрыт и всегда таким останется, но это управляемый API, который сегодня можно вызывать без всякой двусмысленности.

Если читать их вместе, эти три пункта складываются в один тезис: главные преимущества модели Ling — либо промо-характера (бесплатность), либо перспективные (контекст 1M, открытые веса), тогда как преимущества модели Gemini — договорные. Эта асимметрия пронизывает всё последующее.

Где модель Ling действительно выигрывает

Два места, и оба настоящие.

Первый — это стоимость на этапе оценки. Двухнедельный бесплатный пробный период для модели такого размера — не маркетинговый трюк, от которого можно отмахнуться, — это самый дешёвый способ выяснить, справляется ли смесь экспертов на 560B с вашими промптами. Gemini 3.8 Flash, какова бы ни была его цена, не бесплатен, а серьёзная оценка на нескольких тысячах вызовов стоит реальных денег.

Второй — траектория открытости. Ling-3.1-flash — преемник модели, которая действительно выпустила веса под лицензией MIT, и Ant публично заявила, что намерена открыть исходный код и этой. Если это произойдёт под разрешительной лицензией, вы получите то, чего Gemini 3.8 Flash никогда не сможет предложить: возможность самостоятельно размещать, дообучать или дистиллировать базовую модель на 560B. Подвох — тот, что важнее всего: вы ставите на обещание, а обещание предыдущего поколения было выполнено с двухнедельной задержкой, а не гарантированно.

Где Gemini 3.8 Flash и близко не проигрывает

Если отбросить судебный процесс и вопрос открытости, то операционное сравнение складывается явно не в пользу Google.

• Ввод — Gemini 3.8 Flash принимает текст, изображения, видео, файлы и аудио. Ling-3.1-flash принимает текст и возвращает текст. Для рабочих процессов с документами, скриншотами или видео это не предпочтение, а граница возможностей.

• Потолок вывода — 65 536 токенов против 32 768. Актуально с того момента, как вы генерируете отчёты, файлы кода или длинный структурированный вывод за один проход.

• Пропускная способность — независимое тестирование оценивает медианную скорость вывода Gemini 3.8 Flash примерно в 249 токенов в секунду, а собственная семидневная телеметрия OrcaRouter фиксирует 552 токена в секунду при p50 времени до первого токена 4,95 секунды. Для пробного хостинга Ling-3.1-flash сообщалось о примерно 63 токенах в секунду. Модель Gemini относится к совершенно иному классу скорости.

• Глубина референса — за Gemini 3.8 Flash стоит массив независимых измерений; все показатели Ling-3.1-flash — собственные, на совершенно новом эндпоинте, и пока ни одна третья сторона их не воспроизводила.

• Мультимодальные агенты — всё, что должно прочитать скриншот, PDF или запись звонка, — это задача для Gemini по определению, а не по качеству.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Бенчмарки, и почему эти два набора на самом деле нельзя сравнивать

Заявленный вендором результат для Ling-3.1-flash — это совокупный показатель 81,0 по пяти агентным бенчмаркам, при этом 40,4% на Terminal-Bench 4.0, 55,9% на SWE-Atlas и 65,35% на HealthBench Professional; собственные данные Ant добавляют 1 673 Elo на GDPVal-AA v2.1 и 75,16 на FrontierSWE. Каждое из этих значений — измерение самой Ant. Не опубликовано ни харнесса, ни, что важнее, весов, на которых кто-либо мог бы повторно прогнать этот набор.

Картина с Gemini 3.8 Flash качественно иная. В текущей сборке Intelligence Index от Artificial Analysis (v4.3.2) он набирает 40,9 при высоких усилиях рассуждения, 39,8 — при средних и 33,5 — при низких; и стоит отметить, что индекс недавно был пересмотрен, поэтому цифры, опубликованные об этой модели ранее осенью, были рассчитаны на другой сборке и не сопоставимы напрямую с этими. Собственные заявления Google об этой модели включают 54,9 на HLE-Verified и сильные результаты Terminal-Bench 2.1 — в верхней части диапазона 80-х. Независимые и вендорские цифры — рядом, обе правомерны, но не взаимозаменяемы.

Стоит сделать одно чистое перекрёстное сравнение, потому что обе модели относятся к одному семейству бенчмарков. На Terminal-Bench 4.0 заявленный вендором показатель Ling-3.1-flash составляет 40.4%. Claude Sonnet 5.5 — модель среднего уровня, а не флагман — набирает 70.6% на той же версии. Эта единственная строка — сильнейший аргумент против того, чтобы воспринимать карточку Ant как «близкую к фронтиру»: модель конкурентоспособна по агентным метрикам, которые Ant решил выделить, и явно уступает по метрике терминального кодинга, где существует внешняя цифра.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

Практическая форма выбора

Если вам нужно что-то построить в ближайшие две недели, ответ однозначен, и это не упрёк Ling-3.1-flash. Gemini 3.8 Flash — единственная из двух, которая даёт стабильный эндпоинт, опубликованную цену, полное окно в миллион токенов, мультимодальный ввод и лицензию, которую можно прочитать. Это продакшн-модель уровня Flash.

Ling-3.1-flash — это объект оценки. Её ценность сейчас в том, что оценка бесплатна, а модель интересна: 560B MoE всего с ~25B активных параметров на токен — это ставка на разреженность, и Ant позиционировала её именно под агентные и поисковые рабочие нагрузки, а также нагрузки в офисной автоматизации, за которые конкурируют модели уровня Flash. Прогонять через неё свои промпты в течение пробного периода стоит именно потому, что никто за пределами Ant ещё этого не делал, — вы окажетесь среди первых, у кого будет мнение, независимое от вендора.

Дерево решений, которое имеет смысл в этом месяце: направьте продакшен на Gemini 3.8 Flash, потратьте бесплатный пробный период на прогон Ling-3.1-flash на ваших самых сложных промптах и оставьте вопрос об открытых весах как настоящую развилку. Если веса появятся с разрешительной лицензией и цена окажется близкой к уровню Flash, Ling-3.1-flash станет реальной второй опцией — той, которую вы сможете разместить у себя, чем Gemini никогда не станет. Если же они появятся с оговорками, пробный период закончится — как и сравнение.

Запускать оба с одного ключа и честно говорить о том, чего не хватает

Gemini 3.8 Flash уже сегодня доступна в каталоге OrcaRouter под идентификатором модели google/gemini-3.8-flash по собственной прейскурантной цене Google без наценки — так что, когда в январе промо-тариф перестанет действовать, цена, которую вы платите здесь, будет отслеживать её автоматически, без необходимости заключать новый договор. DeepSeek-V4.1-Flash — другая недорогая модель уровня Flash, которую стоит измерить в том же эксперименте, — присутствует в том же каталоге по прейскурантной цене своего провайдера, поэтому тройственное сравнение тестируемой модели с проверенными вариантами уровня Flash выполняется через один API-ключ с автоматическим переключением при сбое между ними.

Ling-3.1-flash отсутствует в нашем каталоге, и запрос к нашему публичному API моделей возвращает not-found для неё и для предыдущего поколения — поэтому честная формулировка такова: пробный доступ работает там, где он работает, через собственную площадку вендора и сторонние платформы инференса, и мы не заявляем, что размещаем её у себя. Это та часть сравнения, которая может измениться быстрее всего: модель в бесплатном пробном режиме с необъявленной ценой — ровно то, что попадает на слой маршрутизации в тот момент, когда Ant и её хостинг-провайдеры публикуют тарифную сетку, а сквозная передача с нулевой наценкой означает, что в тот же день цена здесь — это цена там.

Итак, вывод оказывается более узким, чем можно заключить по количеству параметров. Ling-3.1-flash — более амбициозная модель и более интересный исследовательский результат; Gemini 3.8 Flash — та, которую можно выпускать в продакшен. Пока лицензия и цена не появились, в этом и состоит вся разница — и это не та разница, которую решит одна строка в бенчмарке.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно