Титульная карточка с надписью «GPT-6 против Gemini 3.1 Pro», с плашкой «Gemini 3.1 Pro: в предварительном просмотре с 2026-02-19», две строки с ценами «GPT-6 Sol $2 / $10» и «Gemini 3.1 Pro $2 / $12», а также нижний колонтитул «Показатели индекса согласно Artificial Analysis v4.3.2; позиции GPT-6, заявленные производителем, помечены в тексте». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

GPT-6 против Gemini 3.1 Pro: линейка Pro от Google не выпускала новую модель с февраля

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 3.1 Pro находится в прайс-листе Google уже семь с половиной месяцев и так и не вышла из превью. Она была анонсирована 19 февраля 2026 года, до сих пор обслуживается через эндпоинт под названием Gemini 3.1 Pro Preview, и по состоянию на сегодня нет ни обязательства по переходу в общий доступ, ни даты отключения — двух дат, которые сказали бы, где модель находится в планах её собственного поставщика. GPT-6 Sol, напротив, был выпущен 22 сентября 2026 года, а 7 октября 2026 года стал моделью, стоящей за платными тарифами глобального развёртывания ChatGPT для более чем 1,2 млрд пользователей в неделю.

Итак, главное сравнение — не между двумя флагманскими уровнями. Оно между уже выпущенным продуктом и бессрочным превью, и эта разница, как выясняется, значит больше, чем разрыв в бенчмарках. Поставьте их рядом в Intelligence Index v4.3.2 от Artificial Analysis — и семимесячное превью Goo​gle набирает 29,7 против 47,6 у GPT-6 Sol, при этом беря в 1,25 раза больше за каждую выполненную задачу индекса — $1,30 против $1,04. Оба этих числа реальны, и к обоим нужно приложить оговорку, прежде чем вы потратите на них деньги.

Что делает это достойным прочтения, а не того, чтобы от него отмахнуться, — так это то, что превью действительно выигрывает. Оно превосходит GPT-6 Sol по GPQA Diamond, по τ²-Bench для агентного использования инструментов и по одному измерению длинного контекста — и принимает аудио и видео на вход, чего GPT-6 Sol не делает. Семимесячное превью, которое всё ещё выигрывает два боя из четырёх, — это не модель, которую можно списать со счетов. Это модель, у которой проблема — жизненный цикл, а не возможности.

Цифры — и оговорка о пересмотре, которая должна идти вместе с ними

Artificial Analysis повторно запускает свой набор тестов и повторно публикует оценки в рамках текущей редакции индекса, а значит, одна и та же модель может иметь два разных числа в зависимости от того, когда вы читаете информацию. Для Gemini 3.1 Pro этот разброс необычно широк: более ранние публикации об этой модели сообщали 57 в старой редакции, тогда как страница в её нынешнем виде сообщает 29.7 в v4.3.2. Обе цифры подлинные, и обе находятся на одном и том же сайте.

Это важно, потому что вычитать можно только показатели из одной и той же ревизии. Здесь следует использовать пару 29.7 и 47.6, поскольку обе взяты из v4.3.2 — того же прогона, в котором Claude Opus 5.5 получает 57.6, а GPT-6 Astra — 52.7. Показатели того же прогона, по одной строке на измерение:

• Индекс интеллекта, v4.3.2 — GPT-6 Sol 47,6 против Gemini 3.1 Pro 29,7
• Стоимость одного выполненного задания индекса — Gemini 3.1 Pro $1,30 против GPT-6 Sol $1,04; более старая модель на 25% дороже за готовый ответ
• Цена ввода — $2,00 за 1 млн у обеих, на заявленном уровне
• Цена вывода — GPT-6 Sol $10,00 против Gemini 3.1 Pro $12,00; Sol на 17% дешевле
• Условие для длинного контекста — GPT-6 Sol пересчитывает весь запрос по тарифу $4,00/$15,00 свыше 272 000 входных токенов; Gemini 3.1 Pro переходит на $4,00/$18,00 свыше 200 000
• Контекстное окно — GPT-6 Sol 1 050 000 токенов против Gemini 3.1 Pro 1 048 576, фактически на одном уровне
• Максимальный объём вывода — GPT-6 Sol 128 000 токенов против Gemini 3.1 Pro 65 536; у Sol почти вдвое больше
• Входные модальности — GPT-6 Sol текст, изображение, файл против Gemini 3.1 Pro текст, изображение, аудио, видео, PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

Две строки там заслуживают пояснения, потому что они переворачивают очевидное прочтение. Строка о стоимости за задачу говорит, что более дешёвая на вид тарифная сетка принадлежит модели, которая дороже за выполненную работу — ставка Gemini 3.1 Pro за вывод в $12 плюс объём его рассуждений выполняет больше работы, чем предполагает его заявленная входная цена в $2. А шаг с длинным контекстом стоит перечитать с обеих сторон: тариф Gemini 3.1 Pro начинается с 200 000 токенов, что ниже, чем 272 000 у GPT-6 Sol, но переназначает цену за вывод на $18.00, тогда как Sol переназначает на $15.00. Ни один из них не является фиксированной тарифной сеткой, и точки пересечения не совпадают.

Где предпросмотр всё ещё выигрывает

Goo​gle — не реликт. Вытяни оценки, которые несут обе карточки:

• GPQA Diamond — Gemini 3.1 Pro 94.1% против GPT-6 Sol, сопоставимый показатель в этой ревизии не опубликован
• τ²-Bench, агентное использование инструментов — Gemini 3.1 Pro 95.6% против GPT-6 Sol, не опубликовано в том же рейтинге
• Воспроизведение в длинном контексте — Gemini 3.1 Pro 82.0% против GPT-6 Sol 83.7%, разрыв в 1.7 пункта
• SciCode — Gemini 3.1 Pro 58.7% против GPT-6 Sol 57.6%, фактически на одном уровне
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4.0% против GPT-6 Sol 43.9%; единственная категория, где предварительная версия неконкурентоспособна

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

94,1% на GPQA Diamond и 95,6% в агентном использовании инструментов — это передовые показатели, а не устаревшие, и именно поэтому разрыв в индексе на 17,9 пункта превышает практическую дистанцию. Индекс — это композитный показатель по десяти оценкам, а провалы Gemini 3.1 Pro в этом наборе сосредоточены там, где набор тестов сильно смещён в сторону разработки ПО — Terminal-Bench 4.0 с 4,0% — катастрофический выброс на фоне его 58,7% в SciCode и 73,8% в Terminal-Bench 2.1. Модель, которая набирает почти максимум в одном агентном тесте и почти минимум в его преемнике, говорит вам о дате своего обучения, а не о своём потолке.

Аудио- и видеовход — это ещё одно конкретное преимущество, причём это ворота, а не градиент. Если ваш пайплайн принимает на вход запись встречи или снимок экрана, Gemini 3.1 Pro может с этим справиться, а GPT-6 Sol — нет. Никакое лидерство по индексам этого не заменит.

Во что вам конкретно обходится «всё ещё в предварительной версии»

Статус предварительной версии — это не косметическая метка, и издержки такого рода проявляются только после того, как вы на чём-то построили.

Эндпоинт предварительного просмотра не несёт обязательства по общей доступности, а значит, поставщик не обещал, что модель всё ещё будет доступна по графику, на который можно рассчитывать. Он также не несёт даты отключения, что звучит как хороший вариант того же самого — ничего не выводится из эксплуатации, — но читается и противоположным образом: Google не опубликовал жизненный цикл для модели, которая находится в этом состоянии с февраля, при этом выпуская модели уровня Flash на протяжении того же периода. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, линейка Flash 3.6 и 3.8: уровень Pro остался на месте, а преемник вместо этого появился как Gemini 4 Argon, который Google анонсировал 30 сентября 2026 года в рамках поэтапного развёртывания для названной группы партнёров по безопасности, тоже без указания даты общей доступности.

Вот та закономерность, вокруг которой на самом деле и строится это сравнение. Если вы строите долгосрочный пайплайн на Gemini 3.1 Pro Preview, вы строите его на модели, о которой сам её поставщик не сказал, когда она выйдет из предварительной версии, будет заменена или выведена из эксплуатации. Позиция GPT-6 Sol — противоположная: это общедоступный API-продукт с опубликованным прайс-листом, и с 7 октября 2026 года он также используется по умолчанию в приложении, которым пользуется большинство ваших коллег. Согласно данным поставщика, пока не подтверждённым независимо, OpenAI заявляет, что в ChatGPT GPT-6 формирует ответы, используя текст, графику, диаграммы и интерактивные элементы управления, с помощью возможности, которую называет Intelligent UI; ответы, требующие веб-поиска, начинают формироваться на 44% раньше, чем в GPT-5.6 Instant; а уровень усилий Extra High начинает отвечать так же быстро, как GPT-5.6 на уровне Medium. Ничто из этого не меняет интеграцию с API. Всё это объясняет, почему GPT-6 теперь является негласным выбором по умолчанию, а предварительная версия — нет.

Есть также простая версия этого аргумента. Вы платите на 25% больше за каждую выполненную задачу при более низкой оценке возможностей — за модель, жизненный цикл которой не объявлен. Контраргумент реален — вы получаете GPQA Diamond на уровне 94,1% и аудиовход — но это конкретный аргумент для конкретной рабочей нагрузки, а не общая причина предпочитать старую модель.

Тестирование предпросмотра без ставок на него

Ошибка, которой следует избегать для модели в положении Gemini 3.1 Pro, — это рассматривать «стоит ли её использовать» как одно бинарное решение. Это не так. И Gemini 3.1 Pro Preview, и GPT-6 Sol находятся в каталоге OrcaRouter за одним эндпоинтом, совместимым с Ope​nAI, и одним ключом, с наценкой 0% к прайс-листу провайдера — так что preview можно встроить в реальный путь запросов, измерить на своих рабочих нагрузках и оставить или убрать без второго договора с вендором и без изменения кода.

Автоматическое переключение при сбое — вот что делает это безопасным для модели, находящейся в жизненном цикле предварительной версии. Направляйте аудио- и видеотрафик в Gemini 3.1 Pro, поскольку только он из двух способен принимать такой ввод; направляйте трафик для программной инженерии и длинных выводов в GPT-6 Sol; и настройте резервный маршрут так, чтобы, если эндпоинт предварительной версии будет объявлен устаревшим, ограничен по частоте запросов или незаметно переоценён, запрос попадал на общедоступную модель, а не завершался ошибкой. Это та структура, которую заслуживает семимесячная предварительная версия, — не избегание, а путь, который от неё не зависит.

Если вы хотите пойти дальше, DSL маршрутизации объединяет несколько моделей в один логический вызов, поэтому запрос можно попробовать на Gemini 3.1 Pro и GPT-6 Sol, а ответ выбрать по своим собственным критериям, а не по критериям одного поставщика. Слияние моделей делает то же самое в другом направлении — панель моделей, отвечающих на один вопрос, — что является разумным способом выяснить, за какие конкретные сильные стороны предварительной версии стоит платить, прежде чем закреплять за ней производственный путь.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

Вердикт — и число, за которым стоит следить

Для новых задач GPT-6 Sol — более безопасный выбор по четырём из шести параметров, определяющих развёртывание, и он дешевле в расчёте на завершённую задачу, набирая на 17,9 индексных пункта больше при той же ревизии. Для рабочих нагрузок, требующих аудио- или видеовхода, или там, где 94,1% GPQA Diamond — это то, что вы покупаете, Gemini 3.1 Pro Preview всё ещё выигрывает, а метка preview — это риск, которым нужно управлять, а не повод отказываться.

Число, за которым стоит следить, — это не индекс. Это дата в названии эндпоинта Gemini 3.1 Pro. Когда суффикс preview исчезнет — или когда Argon станет общедоступным с настоящим идентификатором API, — это сравнение полностью изменит форму, и семимесячный разрыв между последним релизом уровня Pro и сегодняшним днём станет тем, о чём эта статья.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно