
Gemini 4 Argon против GPT-6 Sol: Пятая часть цены, вчетверо больший счёт
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Запустите набор индексов Artificial Analysis на Gemini 4 Argon — и он обойдётся в $2,407. Запустите тот же набор на GPT-6 Sol — и он обойдётся в $1,546. Тот же индекс, те же задачи, та же неделя. У этих двух моделей одинаковые цены по прайс-листу — $2.00 за миллион входных токенов и $10.00 за миллион выходных токенов, причём у Argon это заявленный вводный тариф от Google, а у Sol — постоянный тариф OpenAI, — и всё же итоговая стоимость выполнения идентичной работы различается на 56% в пользу модели, которая набирает на пять баллов меньше. Этот разрыв и есть вся причина, по которой это сравнение стоит писать, и он не имеет никакого отношения к тарифной сетке.
Google объявила о выпуске Gemini 4 Argon 30 сентября 2026 года, назвав его новой эрой передового интеллекта, по цене $2 за вход и $10 за выход, а кешированный ввод — со скидкой 95%, постепенно открывая доступ доверенным специалистам по киберзащите через программу Fairwind Program. GPT-6 Sol находится в общем доступе с 22 сентября 2026 года, когда OpenAI выпустила средний уровень линейки GPT-6 по цене $2 за вход и $10 за выход со скидкой 90% на кеш. Один можно купить уже сегодня через OpenAI-совместимый эндпоинт, а второй не может купить никто за пределами названной группы, что и представляет собой практическую развилку в этой статье. Но описанная выше инверсия стоимости сохраняется, даже если полностью отвлечься от вопроса доступности, и понимание того, почему это так, и есть самое полезное.
Инверсия, если сказать прямо
Artificial Analysis публикует и Индекс интеллекта, и расчёт того, во сколько обошлось проведение этого индекса. Если читать их вместе, они говорят следующее:
• Intelligence Index — Gemini 4 Argon 52,6 против GPT-6 Sol 47,5. Разрыв в пять пунктов, измеренный при настройке Argon на свой высокий уровень усилий, а Sol — на максимальный уровень, так что это сравнение скорее благоприятно для Sol, а не для Argon.
• Цена по прайс-листу за миллион токенов — идентична. $2.00 за ввод / $10.00 за вывод у обоих. Чтение из кэша — единственное различие: $0.10 у Argon, $0.20 у Sol.
• Стоимость одной задачи индексации — Gemini 4 Argon $1.99 против GPT-6 Sol $1.05. Argon обходится примерно вдвое дороже за задачу, несмотря на одинаковую стоимость за токен.
• Стоимость запуска полного набора — Gemini 4 Argon $2,407 против GPT-6 Sol $1,546.
• Измеренная скорость вывода — GPT-6 Sol: 77,0 токенов в секунду против 48,9 у Gemini 4 Argon; разница в 1,6 раза проявляется как в задержке, так и в расходах.
В том списке есть одна строка, которая объясняет все остальные, и это не цена. Это количество токенов. На собственных задачах индекса Gemini 4 Argon сгенерировал примерно 561 000 выходных токенов на задачу; GPT-6 Sol — примерно 282 000. Argon размышляет вдвое дольше, чтобы ответить на тот же вопрос, и при одинаковой ставке за токен это ровно вдвое больший счёт.

Почему токены — это цена
Вот поправка, которую стоит усвоить, прежде чем кто-либо начнёт закладывать бюджет на миграцию, потому что интуиция подсказывает неверное. Когда модель стоит столько же, сколько её конкурент, и расходует вдвое больше выходных токенов, чтобы завершить работу, цена за токен — это ещё не цена. Цена — это цена за токен, умноженная на то, сколько токенов модель решает потратить, и второй множитель — свойство модели, а не прайс-листа.
Маржа по задачам варьируется колоссально, что только усугубляет ситуацию — нельзя применить единый множитель и просто двигаться дальше:
• Terminal-Bench 4.0 — Argon: 165 330 выходных токенов на задачу против 97 372 у Sol. Здесь Argon стоит $6,78 за задачу против $4,00 у Sol, хотя Argon набирает 57,1 % против 43,9 % у Sol.
• CritPt — у Argon 109 533 токена против 31 848 у Sol. Соотношение токенов 3,4× в задаче, где Sol фактически набирает более высокий результат — 30,9% против 27,1%.
• GDPval — у Argon 74 571 токен против 41 567 у Sol, $1,82 за задачу против $1,32.
• Omniscience — соотношение токенов 938 против 2 662 в пользу Argon, при $0,010 за задачу против $0,027 у Sol. Единственное семейство задач, где направление меняется.
• Рассуждение с длинным контекстом — Argon 2 197 токенов против 954 у Sol, и единственная задача в наборе, где Sol явно побеждает по оценке: 83,7% против 79,7%.
CritPt — поучительный пример. Модель, которая сжигает в три с половиной раза больше токенов, чтобы выдать чуть худший ответ на тот же вопрос, — это не история о возможностях; это история о привычке тратить. Рассуждения Argon получаются длинными, и в одних типах задач эта длина превращается в оценку, а в других — просто в доллары. Показатель индекса 52.6 и показатель Sol 47.5 — это агрегат, а агрегаты скрывают именно это.
Откуда на самом деле взялись эти пять пунктов
Поскольку разрыв в индексе и разрыв в затратах указывают в противоположных направлениях, полезно знать, какие задачи определяют каждый из них.
• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% против GPT-6 Sol 43,9%. Крупнейшая отдельная победа Argon, а также семейство задач, наиболее близкое к долгосрочному агентному программированию.
• Всезнание — Gemini 4 Argon 42.4 против GPT-6 Sol 27.1. Разрыв в пятнадцать пунктов по охвату фактов — крупнейший пропорциональный разрыв в наборе.
• AutomationBench-AA — Gemini 4 Argon 77,5% против GPT-6 Sol 61,6%.
• SciCode — Gemini 4 Argon 61,8% против GPT-6 Sol 57,6%.
• Последний экзамен человечества — Gemini 4 Argon 57,1% против GPT-6 Sol 47,9%.
• GDPval — Gemini 4 Argon 1 611 против GPT-6 Sol 1 487.
• ApexAgents / AA-Briefcase — GPT-6 Sol 1 482,78 Elo против 1 493,84 у Argon, разрыв в 11 пунктов, который находится внутри опубликованных доверительных интервалов и должен считаться ничьей.
• Рассуждение с длинным контекстом — GPT-6 Sol 83,7 % против Gemini 4 Argon 79,7 %. Единственная явная победа Sol.
• CritPt — GPT-6 Sol 30,9% против Gemini 4 Argon 27,1%. Sol снова побеждает, но с небольшим отрывом.
Итак, суть не в том, что «Argon лучше». А в том, что Argon лучше в двух вещах, с которых начинались его материалы к запуску — сквозное выполнение бизнес-задач и долгосрочная разработка ПО, — а Sol не уступает или опережает на академически окрашенной лестнице рассуждений и в сохранении связности на длинном контексте. Для читателя, чья рабочая нагрузка — это пайплайн поиска с промптом на 400K токенов, Sol одновременно и лучшая модель, и более дешёвая, а это необычная и комфортная позиция.
Различия в спецификациях, которые переживут обсуждение бенчмарков
• Максимальный объём вывода — Gemini 4 Argon 1 000 000 токенов в рамках одной траектории, что Google описывает как крупнейший в отрасли и как увеличение по сравнению с ограничением предыдущего поколения в 64K. GPT-6 Sol 128 000 токенов.
• Контекстное окно — в карточке вендора GPT-6 Sol указано примерно 1 050 000 токенов; у Argon — 1 000 000. Artificial Analysis с помощью своего харнесса измерила Sol на уровне 872 000 токенов; это измерение харнесса, а не цифра из карточки — считайте карточку спецификацией, а число харнесса — тем, что оценщик фактически прогнал.
• Входные модальности — обе принимают на вход текст, изображения и файлы. В материалах к запуску Argon также делается упор на понимание длинных видео, где Google заявляет о 91,7 % на LVBench и называет этот результат передовым; это заявленный производителем показатель, и пока ни одна независимая комиссия его не воспроизвела.
• Видеовход — неоднозначно. Artificial Analysis в своих графиках указывает Argon с отключённым видеовходом и явно упоминает видео при запуске, тогда как в карточке Sol видео вообще не перечислено. Если видеовход критичен для вашего пайплайна, ни одна из карточек не даёт окончательного ответа, и перед проектированием архитектуры вам следует провести тестирование.
• Усилие рассуждения — Sol предоставляет настраиваемое усилие (от none до max, по умолчанию medium) на уровне API и был оценён при max. Argon был оценён при high; никто не публиковал тот же набор тестов при его максимальной настройке.
Потолок вывода в 1M токенов — это тот, который действительно может изменить архитектуру, а не бюджет. Всё, что вы сейчас разбиваете на дюжину последовательных вызовов, чтобы уложиться в лимит 128K — набор патчей для нескольких файлов, полный отчёт об аудите, длинный документ за один проход — становится одним вызовом с меньшим числом мест, где агентный цикл может потерять состояние. Стоит ли это вдвое большей стоимости за задачу, полностью зависит от того, есть ли у вас такая рабочая нагрузка. Если есть, вероятно, оно того стоит. Если ваши вызовы — это классифицировать и вернуть, это деньги, потраченные на запас, которым никто не воспользуется.
Настройка усилий, которую никто не повторил, и почему это важно
Одна оговорка заслуживает отдельного абзаца, потому что она идёт вразрез с трактовкой пятипунктового разрыва в индексе как чистого различия в возможностях. Artificial Analysis отображает Gemini 4 Argon в режиме высокого усилия рассуждения, а GPT-6 Sol — в режиме максимального. Это не одна и та же ступень на двух лестницах, и направление несоответствия интересно: Sol запустили на его самом дорогом режиме, а Argon — на среднем.
Ниже следуют две трактовки, и данные не позволяют их различить. Либо Argon в режиме max набрал бы больше 52,6 — но также потратил бы больше 561 000 токенов на задачу и стоил бы больше $1,99 — либо набрал бы примерно столько же, что означало бы, что регулятор усилий на этом наборе мало что меняет. Нет опубликованного запуска, который бы это разрешил. Любой, кто цитирует 52,6 как потолок Argon, цитирует конфигурацию, а не модель, и эта конфигурация — та, которую поставщик Argon решил опубликовать первой.
Та же логика применима к 47.5 от Sol, только в обратном направлении: max находится на вершине своей лестницы, поэтому эта цифра ближе к потолку, чем к полу. Честная борьба при сопоставимых усилиях могла бы сократить разрыв, а также могла бы перевернуть сравнение затрат, поскольку токены, которые сжигает max, — это токены, которые стоят $10 за миллион.
Развилка доступности, которая определяет фактический ответ
Gemini 4 Argon не находится в общем доступе. В объявлении Google говорится, что он распространяется среди ряда доверенных киберзащитников в рамках Fairwind Program, что компания участвует в добровольном процессе правительства США по предоставлению доступа к модели до выпуска, а общий доступ для разработчиков, предприятий и потребителей появится «как можно скорее», начиная с платных клиентов API и подписчиков Google AI Ultra. Нет ни идентификатора модели, ни эндпоинта, ни квоты, ни даты. Его нет ни в одном публичном API, включая наш, — проверьте каталог, и он вернёт 404, потому что там его пока нет.
GPT-6 Sol — это продукт, доступный для вызова. В OrcaRouter это openai/gpt-6-sol, на том же OpenAI-совместимом эндпоинте, что и остальные более 200 моделей в каталоге, по прайс-листовой цене OpenAI, которая передаётся с нулевой наценкой, поэтому указанные выше $2/$10 и переход к $4/$15 при длинном контексте в 272 000 токенов — это то, что вы фактически платите, а не то, что обещает тарифная карта. Автоматическое переключение при сбое между провайдерами покрывает случай, когда маршрут деградирует в середине выполнения, а DSL маршрутизации позволяет одному приложению направлять свой дешёвый трафик классификации в меньшую модель, а сложный трафик рассуждений — в Sol, без второго SDK.

Последний вариант — честный ответ на это сравнение для большинства команд. Аргумент в пользу Argon с точки зрения стоимости реален, но только при рабочей нагрузке, где преобладает работа агентов на длинном горизонте; аргумент против него с точки зрения стоимости реален при любой другой нагрузке; и в этом месяце его всё равно не купить. Дешёвый ход — уже сейчас собрать стенд для оценки — собственные промпты, собственная система оценки, запуск против Sol при нескольких настройках усилий, — чтобы, когда Argon доберётся до платных клиентов API, у вас был измеренный ответ на вопрос, на который все остальные будут отвечать по таблице лидеров.
Что бы это уладило
Три вещи, в порядке того, насколько сильно они могли бы изменить вердикт. Общая доступность Argon по реальной, не вводной цене — слово «вводная» означает, что $2/$10 могут измениться, и собственная последовательность Google ставит платных клиентов API на первое место, так что первый опубликованный тариф после запуска — это то, за чем стоит следить. Опубликованный прогон Artificial Analysis для Argon на его максимальной настройке усилий, который сказал бы, является ли 52.6 потолком или чуть-чуть не дотягивает до него. И одно независимое воспроизведение показателя DeepSWE v1.1 — Google заявляет 77.9% и называет это новым уровнем техники; по состоянию на сегодня это заявлено производителем и не воспроизведено за пределами Google.
До тех пор разделение остаётся чистым и слегка ироничным. GPT-6 Sol — лучше верифицированная модель, более быстрая, более дешёвая в расчёте на завершённую задачу, и та, которую можно вызвать уже сегодня днём. Gemini 4 Argon — модель с более высоким баллом в таблице, которую её вендор решил опубликовать, примерно вдвое дороже в реальном использовании и пока не поступила в продажу. Выбор между ними — это не оценка возможностей. Это оценка того, какое из этих двух предложений описывает ваш месяц.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
