Сгенерированная главная титульная карточка с надписью «Gemini 3.1 Pro против Qwen3.8-27B», подзаголовком «Семимесячное превью против чекпоинта, который можно скачать», с двумя карточками: Gemini 3.1 Pro — в превью с 19 февраля 2026 года, $2.00 за 1 млн вводимых токенов и $12.00 за 1 млн выводимых токенов, индекс интеллекта Artificial Analysis — 29.7, против Qwen3.8-27B — открытые веса с 14 августа 2026 года, $0.50 за 1 млн вводимых токенов и $3.00 за 1 млн выводимых токенов, индекс — 33.7, с медальоном VS между ними и логотипом OrcaRouter в правом нижнем углу. Футер: «Artificial Analysis Intelligence Index v4.3.2, зафиксировано 2026-09-23; цены указаны по прайс-листам провайдеров».
Guides & Insights

Gemini 3.1 Pro против Qwen3.8-27B: семимесячный предпросмотр против чекпоинта, который можно скачать

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

18 сентября 2026 года пользователи на собственном форуме вендора для разработчиков ИИ начали сообщать, что Gemini 3.1 Pro исчезла из селектора моделей AI Studio — включая платные аккаунты, несмотря на очистку кэша и окна инкогнито. Ветка, в которой вендора просили сказать, было ли это «багом или намеренным решением», всё ещё была активна 21 сентября. Уведомления об устаревании нет, пути миграции нет, ответа от сотрудников тоже нет. Тем временем Qwen3.8-27B, которую лаборатория 14 августа выпустила с открытым исходным кодом под лицензией Apache 2.0, невозможно отнять у любого, кто её скачал. Именно эта асимметрия — а не разрыв в бенчмарках, который реален, но скромен — на самом деле определяет это противостояние, и именно поэтому две модели на самом деле не конкурируют за одно и то же место, хотя в сравнительных таблицах их ставят рядом.

Далее следует прямое сопоставление по имеющимся цифрам, причём каждая из них снабжена пометкой об источнике: данные Artificial Analysis из снимков, сделанных 23 сентября 2026 года, собственная карточка модели Alibaba, пост Google о запуске и наша собственная телеметрия маршрутизации — всё это на протяжении всего текста остаётся раздельным. Там, где ничего не измерено, эта страница говорит об этом прямо, а не строит догадки.

Что произошло на этой неделе и что это значит, а что — нет

Сообщения конкретны, и они исходят с собственного форума Google, а не из блога конкурента. В теме под названием «Gemini 3.1 Pro отсутствует в AI Studio с 2026-09-18 — баг или намеренно?» описывается, как платные пользователи теряют доступ к модели без каких-либо анонсов, поддержка Google One предлагает не относящиеся к делу шаги по устранению неполадок, а страница статуса Google не сообщает ни о каких проблемах. Вторая тема, «Модель Gemini 3.1 Pro Preview недоступна в AI Studio для создания приложения», собирает ту же жалобу, в том числе от пользователя, чей ассистент для программирования был построен на Preview и работал уже несколько месяцев, и который говорит, что Flash «делает халтуру» в своей кодовой базе.

Три честных оговорки. Это исчезновение из консоли разработчика, а не подтверждённый сбой API: Gemini 3.1 Pro по-прежнему указан и доступен для маршрутизации в нашем собственном каталоге, где за последние семь дней через него прошло 94,7 млн токенов. Это данные, о которых сообщают пользователи, — Google ничего не сказал, поэтому никто за пределами Google не может отличить «тихое снятие с поддержки» от «проблемы с мощностями» и от «бага в консоли». И сроки не льстят, учитывая, что эта модель находится в статусе предварительной версии с 19 февраля 2026 года — семь месяцев без объявленной даты GA, пока Google выпускал под ней целую лестницу моделей Flash. Отдельно: GitHub Copilot прекратил поддержку Gemini 3.1 Pro 1 сентября 2026 года, уведомив за 30 дней, — это другое, не связанное событие, но оно указывает в ту же сторону: preview-эндпоинт без обязательств по GA — это зависимость, из-за которой вы вправе нервничать.

Одну цифру с нашей стороны стоит поставить рядом с этим контекстом, потому что мы не можем её объяснить и предпочитаем прямо об этом сказать. Наша семидневная телеметрия по позиции Gemini 3.1 Pro в каталоге показывает уровень ошибок 80,5%; у соседних моделей, которые мы проверили тем же утром, — Qwen3.8-Max, Claude Fable 5.1 — этот показатель составляет 5,9% и 6,9%. Мы не знаем, та ли это проблема, о которой сообщает форум, неудачная неделя для одного вышестоящего провайдера или артефакт инструментирования. Считайте это поводом запустить канареечный тест, прежде чем зафиксировать изменения, а не вердиктом о модели.

Одна и та же линейка — два разных результата.

Это та часть, в которой большинство страниц сравнения ошибаются, поэтому к ней стоит подойти аккуратно. Artificial Analysis оценивает обе эти модели по Intelligence Index v4.3.2. Мы зафиксировали обе страницы 23 сентября 2026 года, и обе содержат одну и ту же ревизию — так что, в отличие от большинства утверждений об индексах при сравнении разных моделей, здесь используется один и тот же снимок, и разрыв реальный.

• Qwen3.8-27B (xhigh) — Индекс интеллекта 33.7

• Gemini 3.1 Pro Preview — Индекс интеллекта 29.7

Qwen лидирует с отрывом в четыре пункта по текущей шкале. Более сложный вопрос — что это значит, ведь сама шкала как минимум трижды менялась в этом году. В феврале Artificial Analysis опубликовала статью, назвав Gemini 3.1 Pro Preview «новым лидером в ИИ», опережающим Claude Opus 4.6 на четыре пункта, и тогдашние публикации в прессе сообщали о результате 57 по тогдашней версии Index v4.0. В v4.3.2 это 29,7. Artificial Analysis анонсировала v4.3 7 сентября 2026 года, через четыре дня после v4.2, и в ходе этого пересмотра Terminal-Bench 2.1 был заменён на гораздо более сложный Terminal-Bench 4.0 с 66 заданиями, а τ³-Banking — на AutomationBench-AA. Февральские сильные стороны Gemini 3.1 Pro относились к оценкам, которые новый индекс исключил или вес которых изменил. Итак: не модель стала хуже, а экзамен. Но если вы выбираете модель сегодня, именно сегодняшняя цифра — та, на которую вы действительно можете опираться, и сегодняшняя цифра говорит в пользу Qwen.

Там, где эти двое действительно расходятся

Агрегированные оценки скрывают форму различия, а ведь именно форма и есть самое полезное. Каждый показатель ниже взят из одного и того же снимка страниц Artificial Analysis v4.3.2 для обеих моделей от 23 сентября, на одной и той же ревизии.

• Рассуждение и знания — Gemini явно лидирует. GPQA Diamond 94,1 против 90,5; Humanity's Last Exam 47,0 против 33,9; SciCode 58,7 против 46,6; CritPt 17,7 против 5,4.

• Задачи из реальной профессиональной деятельности — Qwen лидирует, и с большим отрывом. Нормализованный GDPval — 45,4% против 13,8%.

• Агентные банковские операции и транзакции — Qwen лидирует. τ-Banking 48,0 против 21,4 у Gemini.

• Агентное использование инструментов на общем бенчмарке — Gemini лидирует там, где Qwen не измерялся. τ²-Bench — 95,6 у Gemini; значения для Qwen3.8-27B не существует.

• Работа в терминале — близко, и оба плохо выступили на новом бенчмарке. Terminal-Bench 2.1: Qwen 79.8, Gemini 73.8. Terminal-Bench 4.0: Qwen 5.6%, Gemini 4.0% — у обоих однозначные числа.

• Калибровка — самое резкое расхождение на обеих страницах. В AA-Omniscience Gemini набирает 31,9 при точности 54,9% и уровне галлюцинаций 50,9%; Qwen набирает −10,0 при точности 15,6% и уровне галлюцинаций 30,3%. Gemini знает больше и выдумывает более чем в половине случаев; Qwen часто отказывается отвечать и галлюцинирует примерно в трети случаев, на которые всё же отвечает.

• Длинный контекст — абсолютно равные показатели воспроизведения длинного контекста: по 82,0 у каждого. В мультимодальном воспроизведении длинного контекста: Qwen — 21,7% против Gemini — 15,6%.

Воспринимайте записи «не измерено» такими, какие они есть. У Gemini нет опубликованного нормализованного показателя GDPval-AA в сравнении с 45,4% у Qwen, а у Qwen нет показателя по τ²-Bench, IFBench, Terminal-Bench Hard или ITBench-SRE в сравнении с 77,1, 53,8 и 30,3 у Gemini. Каждый из этих пробелов — это место, где сводная таблица незаметно вписала бы победителя.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

Расхождение, которое определяет бюджеты: одинаковая стоимость ведения индекса

Qwen3.8-27B обходится кардинально дешевле за токен. По рыночным данным, которые публикует Artificial Analysis, это $0,50 за миллион входных токенов и $3,00 за миллион выходных при 80-процентной скидке за кэш и смешанной ставке 7:2:1 в $0,47. Gemini 3.1 Pro Preview — это $2,00 и $12,00, то есть в четыре раза выше цена за вход и в четыре раза выше за выход, при 90-процентной скидке за кэш и смешанной ставке $1,74.

А теперь цифра, которую никто не публикует: собственный подсчёт Artificial Analysis оценивает стоимость прогона всего Intelligence Index в $1,310.21 для Gemini 3.1 Pro Preview и $1,335.92 для Qwen3.8-27B. Qwen не дешевле в эксплуатации. Он совсем немного дороже, потому что тратит больше времени, чтобы добраться до результата. В счёте Qwen за вывод $512.36 пришлось на токены рассуждений против $82.51 за собственно ответ; у Gemini $691.82 — на рассуждения против $113.08 за ответ. Цена за токен — это тариф, а не счёт.

Ещё два факта о ценах, которые упускают сравнительные таблицы. Во-первых, цена Gemini 3.1 Pro зависит от размера входных данных каждого запроса: $2.00/$12.00 до 200K входных токенов, затем $4.00/$18.00 выше этого, при этом чтение из кэша удваивается с $0.20 до $0.40. Контекстное окно в миллион токенов реально, но последние 800 000 токенов из него стоят вдвое дороже. Во-вторых, наша собственная запись в каталоге для Qwen3.8-27B — обслуживается с block-FP8, vision tower на полной точности — указывает $0.40 за вход и $4.21 за выход, что дешевле на входе и дороже на выходе, чем рыночный показатель выше, и вообще не публикует тариф на кэшированные токены. У разных провайдеров разные пропорции. Проверьте тариф, по которому с вас фактически выставят счёт.

Обе модели доступны через один ключ OrcaRouter по прайсовой цене провайдера с наценкой 0%, поэтому изменение цены поставщиком отражается на нашей стороне в тот же день, а не после цикла пересмотра цен — а это важнее обычного, когда у одной из двух граница тарифного уровня находится на отметке 200K токенов.

Задержка: самый быстрый первый токен принадлежит более медленной модели

Это самая вводящая в заблуждение пара чисел во всём сравнении, и именно по ней читатель с наибольшей вероятностью сделает неверный вывод.

• Время до первого чанка — Qwen 4,04 с против Gemini 28,37 с. Qwen выглядит в семь раз быстрее.

• Время до фактического ответа — Gemini 28,37 с против Qwen 52,52 с. Gemini выигрывает примерно в 1,8 раза, потому что Qwen тратит 48,48 секунды на размышления между первым фрагментом и первым токеном ответа.

• Скорость вывода — 116,5 токена в секунду у Gemini против 41,3 у Qwen. Gemini в 2,8 раза быстрее, как только начинает писать, по сравнению с медианой среди аналогичных моделей, которую Artificial Analysis оценивает в 95,4 токена в секунду. На собственной странице Qwen говорится, что он «заметно медленный».

Если ваш продукт отправляет пользователю первый токен, заявленная латентность Qwen — это ложь, которую вы скажете себе один раз. Если ваш продукт ждёт полного ответа, Gemini — более быстрая модель. Обе цифры — измерения Artificial Analysis; обе были получены при уровне усилия Qwen xhigh, который является значением по умолчанию в карточке модели.

Эта настройка по умолчанию — предмет живых жалоб среди практиков, и карточка модели это отчасти признаёт. Qwen3.8-27B предоставляет параметр reasoning_effort с тремя уровнями — xhigh (значение по умолчанию, «для сложных задач, требующих тщательного анализа»), medium и low. В публикациях сообщества за сентябрь сообщается, что xhigh порождает очень длительные фазы размышления, и рекомендуется переходить на medium или low и ограничивать бюджет рассуждений. В собственной карточке Alibaba предупреждает, что в многоходовой агентной работе снижение усилия «не всегда сокращает общее время выполнения задачи» — для карточки модели это откровенное заявление и предупреждение о том, что очевидное решение не всегда является решением.

Контекст: 1M против 262K, и что реально помещается

Gemini 3.1 Pro имеет контекстное окно размером 1 000 000 токенов при максимальном объёме вывода 65 536 токенов. Qwen3.8-27B изначально поддерживает 262 144 токена с возможностью расширения до 1 000 000 с помощью масштабирования YaRN, при этом внутри него рекомендуется предусмотреть отдельные бюджеты: до 262 144 токенов на содержимое рассуждений и до 131 072 на итоговый ответ.

Две честные сноски. В таблице спецификаций Artificial Analysis окно Qwen указано как 256,000, тогда как в тексте собственного FAQ Artificial Analysis говорится 260K, а в карточке модели — 262,144; это различия в округлении одного и того же числа, но указывайте 262,144, потому что именно так сказано в карточке. А расширение до 1M — это техника масштабирования, а не то же самое, что нативное окно на миллион токенов: воспроизведение информации в длинном контексте при 1M на модели, расширенной с помощью YaRN, — это не то, что измеряет показатель 82.0 AA-LCR. Никто не публиковал оценку воспроизведения в контексте 1M для Qwen3.8-27B. Рассматривайте окно Gemini как то, поведение которого измерено на полной длине, а окно Qwen — как то, которое вам следует протестировать самостоятельно, прежде чем проектировать с расчётом на него, — и помните, что при превышении 200K входных токенов цена Gemini удваивается.

Агентная работа и вызов инструментов

Именно здесь сравнение действительно не завершено, и именно здесь искусственно назначить победителя было бы легко и неправильно. У Qwen3.8-27B есть измеренные показатели агентности, которых нет у Gemini, и наоборот.

Аргумент Qwen опирается на сильное независимое число и сильное число от вендора. Независимое число — это τ-Banking с 48.0 против 21.4 у Gemini — более чем вдвое, на той же ревизии, на бенчмарке о многошаговом использовании инструментов внутри банковской среды. Число от вендора — это собственная карточка Alibaba, в которой перечислены OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9, CoWorkBench 70.7, JobBench 33.4 и Agents' Last Exam 20.4 Pass@1. Это оценки Alibaba, никем не перепроверенные, и они находятся именно в тех категориях, где независимо измеренный результат GDPval (45.4% нормализованных против 13.8%) указывает в том же направлении.

Аргумент Gemini в том, что у него единственный высокий абсолютный показатель агентности в этом сравнении — τ²-Bench 95.6 — а у Qwen вообще нет оценки по τ²-Bench. У него также есть IFBench 77.1 за следование инструкциям — ещё один пробел на стороне Qwen. И у него семимесячная история работы в продакшене, которой нет у пятинедельного релиза с открытыми весами.

Тайбрейкер — это не счёт, это ваша топология. Агентное преимущество Qwen измеряется на бенчмарках, где модель работает внутри большой, уже существующей программной системы, которую она не проектировала. Преимущество Gemini измеряется на бенчмарках, где модель должна долго и точно следовать инструкциям. Это разные навыки, и оба они реальны.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

Программирование

Программирование делится так же, поэтому вопрос «кто лучше пишет код» не имеет здесь однозначного ответа. Gemini лидирует в области научных вычислений — SciCode 58,7 против 46,6, — а его AA Coding Index 68,8 на странице нашего каталога отличается от 68,1 у Qwen в пределах ошибки округления, что уж точно укладывается в любой доверительный интервал, о котором стоит упоминать. В агентной работе с терминалом обе модели близки на старом бенчмарке — Qwen 79,8 против Gemini 73,8 на Terminal-Bench 2.1, — а на новом неразличимы: обе падают до однозначных цифр.

Карточка Alibaba заявляет гораздо больше — SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 — но это данные, заявленные производителем, и в примечании к карточке указано, что SWE-bench Pro и QwenSWEBench запускались в тестовом стенде Claude Code, а это не тот стенд, который использовали бы для показателя конкурента. Можно безопасно утверждать, что на единственном бенчмарке по программированию, на котором модели обеих лабораторий измеряла третья сторона, их разделяют четыре пункта на Terminal-Bench 2.1 и 1,6 пункта на Terminal-Bench 4.0, и обе плохо справляются с более сложным.

Открытые веса против эндпоинта предпросмотра

Это та ось, по которой эти двое совершенно несопоставимы, и именно она имеет наибольшие практические последствия.

Qwen3.8-27B распространяется под Apache 2.0, имеет 27B плотных параметров, 64 слоя и гибрид линейного внимания Gated DeltaNet с полным вниманием в соотношении примерно 3:1 — именно эта конструкция делает окно в 262K доступным для обслуживания. Он работает. В 4-битном квантовании он умещается примерно в 17 ГБ, то есть на одной потребительской GPU; целая экосистема сжатия выросла вокруг него за пять недель — от квантов Dynamic V3 от Unsloth, включая 1-битную сборку, которая, по словам Unsloth, работает в 8 ГБ при примерно 77% исходной точности, до Ternary Bonsai 2 27B от PrismML в середине сентября. Его можно дообучать, можно проверять, и его можно запускать на ноутбуке с отключённой сетью.

Gemini 3.1 Pro — это закрытый preview-эндпоинт, которому уже семь месяцев, без даты GA, с карточкой модели, которая прямо предупреждает, что preview-версии могут не обладать стабильностью, доступностью и поддержкой стабильного релиза, и — начиная с этой недели — с консолью разработчика, которую он, судя по всему, тихо покинул. Вы не можете скачать его, не можете закрепить версию и не можете переключиться на самого себя.

Если вам нужен честный ответ по маршрутизации, а не вердикт: именно наличие открытого чекпойнта делает зависимость от Gemini выживаемой. Разместите Qwen3.8-27B на локальном или самостоятельно развёрнутом пути в качестве резервного варианта, оставьте Gemini 3.1 Pro на основном пути для задач с интенсивными рассуждениями, где он измеримо лучше, и поместите оба за одним эндпоинтом с автоматическим переключением при отказе, чтобы тихое исчезновение из чужой консоли было инцидентом, который поглощает ваш слой маршрутизации, а не сбоем, который видят ваши пользователи. Это не рекламный питч продукта — это единственная конфигурация, в которой новости этой недели не стоят вам выходных.

Выберите Gemini 3.1 Pro, если

Ваша самая сложная работа — это рассуждение, требующее глубоких знаний, а не долгосрочное использование инструментов — она лидирует по GPQA Diamond со счётом 94,1 против 90,5, по Humanity's Last Exam — 47,0 против 33,9, по SciCode — 58,7 против 46,6 и по CritPt — 17,7 против 5,4.

• Вам действительно нужны по-настоящему длинные входные данные. Измеренное окно в миллион токенов, recall-поведение которого проверено на длинных последовательностях, превосходит окно в 262K, расширенное с помощью технических приёмов, — при условии, что вы готовы смириться с удвоением цены после 200K входных токенов.

• Время до завершения ответа важнее времени до первого токена, и вы хотите 116,5 токенов в секунду, а не 41,3.

Сегодня вам нужна широкая мультимодальность: ввод аудио, файлов, изображений, текста и видео в сравнении с текстом, изображениями и видео от Qwen.

• Вы готовы принять риск, связанный с предварительным просмотром, и у вас есть подконтрольный вам запасной вариант.

Выберите Qwen3.8-27B, если

• Ваши агенты работают внутри больших существующих систем — τ-Banking 48,0–21,4 и GDPval 45,4%–13,8% в нормализованном виде — это два крупнейших преимущества одной модели во всём этом сравнении.

• Вам нужно, чтобы ответ был честным, а не уверенным. Доля галлюцинаций 30,3% против 50,9% у Gemini — это продукт иного рода.

• Лицензирование или правила резидентности данных исключают закрытый API, либо вам нужно дообучить модель на собственных данных.

• Вы хотите, чтобы счёт за токены составлял четверть от счёта Gemini, и принимаете, что разницу потратите на токены мышления — запуск индекса стоит одинаково на обоих.

• Вы готовы понизить reasoning_effort с его уровня xhigh по умолчанию, а не выпускать его как есть.

Что мы не смогли проверить

Для протокола, и поскольку страница сравнения хороша ровно настолько, насколько хороши её пробелы: для Qwen3.8-27B при сниженных усилиях рассуждения не публиковалось независимой оценки, поэтому его компромисс между скоростью и качеством на среднем и низком уровне остаётся неизмеренным. Для расширенной с помощью YaRN конфигурации на 1M не существует оценки recall для длинного контекста. У Gemini 3.1 Pro нет опубликованной нормализованной оценки GDPval-AA, а у Qwen3.8-27B её нет для τ²-Bench, IFBench или ITBench-SRE. И никто — включая Google — не сказал, почему Gemini 3.1 Pro покинул селектор AI Studio 18 сентября. Мы обновим эту страницу, когда что-либо из этого изменится.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно