Титульная карточка hero с надписью «Gemini 4 Argon vs Claude Opus 5.5 — раскол в бенчмарках», полоса дат с надписями «Argon анонсирован 2026-09-30» и «Opus 5.5 выпущен 2026-09-22», бейдж с текстом «Argon: определённый пилот, а не общая доступность» и строка нижнего колонтитула с текстом «Показатели Argon — по данным вендора; показатели индекса обеих моделей — по данным Artificial Analysis».
Guides & Insights

Gemini 4 Argon против Claude Opus 5.5: раскол в бенчмарках, которого никто не ожидал

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 4 Argon и Claude Opus 5.5 расходятся во мнениях о том, кто лучше, и это расхождение — не шум. В Intelligence Index от Artificial Analysis между ними пять пунктов в пользу Opus 5.5. В Vals Index — рейтинге экономического влияния, взвешенном по ВВП, — Gemini 4 Argon занимает первое место, а Claude Opus 5.5 — третье, уступая и Argon, и Claude Sonnet 5.5. Оба рейтинга оценивали одни и те же две модели на одной и той же неделе. В этом и суть статьи: какую из них выбрать, зависит от того, похожа ли ваша работа скорее на экзаменационный вопрос или на обычный вторник в юридической фирме, и от того, есть ли у вас вообще доступ к Argon через API, а на сегодняшний день его почти ни у кого нет.

Google анонсировала Gemini 4 Argon 2026-09-30 в посте DeepMind, автором которого указан Корай Кавукчуоглу, старший вице-президент Google DeepMind и главный архитектор по ИИ. Anthropic выпустила Claude Opus 5.5 на восемь дней раньше, 2026-09-22. Один из них — это GA-релиз, который можно вызвать уже сегодня днём. Другой — поэтапное развёртывание для названной группы специалистов по киберзащите и собственных инженеров Google, с заявленным намерением охватить «платных клиентов API и подписчиков Google AI Ultra», как только будут готовы защитные механизмы, и без привязки к какой-либо дате.

Ответ в одну строку, перед подробностями

Если сегодня вам нужны лучшие измеренные общие способности к рассуждению и доступ по продакшен-ключу, Claude Opus 5.5 уже доступен на OrcaRouter, а Gemini 4 Argon нет ни в одном публичном API. Если вы создаёте агентов для финансов, юриспруденции, налогов или программирования, которых оценивают по экономической отдаче на доллар, показатели Argon лучше, а его цена за задачу составляет пятую часть цены Opus 5.5 на единственном лидерборде, который измеряет именно это. Если вы занимаетесь киберзащитой критической инфраструктуры, у Argon есть программа, на которую можно подать заявку, и ответ может быть «да».

Откуда на самом деле берётся каждое число

Два совета по индексам, две методологии — и стоит точно указывать, что есть что, потому что два лагеря будут месяцами цитировать друг друга невпопад.

• Индекс интеллекта Artificial Analysis v4.3 — Claude Opus 5.5 с 57,6 и Gemini 4 Argon с 52,6, оба показателя считаны с Artificial Analysis 2026-09-30. Это композит из десяти оценок, намеренно ориентированный на широкий круг задач, и именно эту таблицу большинство людей цитирует как «тот самый» рейтинг.

• Vals Index, обновлено 2026-09-29 — Gemini 4 Argon на первом месте с 68,90% (±0,97), Claude Sonnet 5.5 на втором месте с 67,04% (±0,92), Claude Opus 5.5 на третьем месте с 66,97% (±0,89). Vals взвешивает задачи в области финансов, программирования, права и налогообложения по доле каждого сектора в ВВП США, поэтому модель, посредственная в головоломках, но превосходная в проверке договоров и работе с электронными таблицами, получает здесь высокий балл.

Разрыв в пять пунктов по AA реален, и он не мал. Разрыв в два пункта по Vals тоже реален, а с доверительными интервалами, указанными в таблице лидеров, 68,90 ±0,97 у Argon против 66,97 ±0,89 у Opus 5.5 — это разница примерно в 1,5 стандартной ошибки: лучше, чем подбрасывание монеты, но не подавляющее преимущество. Ни одна из таблиц не ошибается. Они измеряют разные задачи.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

Одна оговорка по конфигурации, и она говорит против того, чтобы трактовать разрыв AA как чистое сравнение моделей. Artificial Analysis показывает Gemini 4 Argon в его высокой настройке усилий, а Claude Opus 5.5 — в режиме «Adaptive Reasoning, Max Effort, Default Fallback». Это не одна и та же точка на двух шкалах усилий, поэтому заголовочные 57,6 против 52,6 — не сравнение равного с равным при одинаковых бюджетах рассуждений. Это число публикуют обе страницы, и именно его стоит приводить, если вы хотите быть справедливы к Anthropic, но это не контролируемый эксперимент.

Именно здесь, когда речь заходит о стоимости за задачу, разрыв становится некомфортным

Artificial Analysis также публикует расчёт того, во сколько обходится запуск его набора индексов, и здесь две модели сильно различаются.

• Стоимость одной задачи индексации — Gemini 4 Argon $1.99 против Claude Opus 5.5 $5.98.

• Стоимость запуска всего набора индексов — Gemini 4 Argon $2,407 против Claude Opus 5.5 $8,708.

• Цена за миллион токенов — Gemini 4 Argon: $2 за вход / $10 за выход (заявленный Google introductory rate, при кэшированном вводе скидка 95%, то есть $0,10) против Claude Opus 5.5: $4 за вход / $20 за выход.

• Пропускная способность — Gemini 4 Argon выдаёт 48,9 выходных токенов в секунду, первый токен через 2,79 секунды; Claude Opus 5.5 — 92,2 выходных токена в секунду, но задержка до первого токена составила 702 секунды на том же стенде, и это та самая плата за расширенное мышление, проявившаяся на виду у всех.

• Стоимость Vals за запуск — Gemini 4 Argon $15,68 против Claude Opus 5.5 $32,14 на одном и том же наборе задач, взвешенном по ВВП.

Есть нюанс, который стоит отметить, а не сглаживать: в таблице лидеров Vals тарифы Argon указаны как $4 за вход / $20 за выход, тогда как в анонсе Google указано $2 за вход / $10 за выход на вводный период. Наиболее вероятная трактовка: Vals показывает стандартную ставку по прайс-листу, а Google — промоакционную, но это предположение, а не опубликованное заявление ни от одной из сторон. Если ваш бюджет зависит от этой цифры, спросите у Google.

Что утверждает Argon и что было проверено

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Пост Google изобилует цифрами, и все они приведены по данным самого вендора. Ни одну из них, насколько мне удалось выяснить, не воспроизвели независимо, а независимые стенды выше измеряют не то, что Google решила вынести в заголовки. Если сформулировать как собственные утверждения Google:

• DeepSWE v1.1 — 77,9 %, описывается как новый передовой результат в области долгосрочной программной инженерии реального мира.

• LVBench — понимание длинных видео — 91,7%, описывается как передовой результат.

• AutomationBench (бенчмарк Zapier для сквозных бизнес-задач) — 1-е место с 51,3%.

• Устранение уязвимостей в CWE-bench v1 — делит первое место с результатом 68%, опираясь на результат Gemini 3.8 Flash Cyber на табло v0.

• Gray Swan Indirect Prompt Injection — описывается как лидирующий, при этом в посте не опубликовано никаких цифр.

• Vals Finance Agent v2 и Harvey's Legal Agent Benchmark — названные лидирующими, также без напечатанного числа в анонсе.

Два семейства утверждений, у которых действительно есть независимая поддержка, заслуживают наибольшего доверия: Vals подтверждает позицию в индексе значением и интервалом, а Artificial Analysis подтверждает индекс 52,6 и цену. Внутренние истории о продуктивности — улучшение на 40% относительно опубликованного базового уровня в квантовой подпрограмме, более 300 ТиБ памяти, освобождённой агентами Argon во всём парке Google, — это внутрикорпоративные результаты без внешней проверки, и воспринимать их следует именно так.

Что такое Opus 5.5, если вы жили под камнем

Claude Opus 5.5 — флагман Anthropic: контекст 1M токенов, максимальный вывод 128K, мультимодальный ввод текста, изображений и файлов, расширенное мышление, использование инструментов и структурированные выходные данные. Он сменил Claude Opus 5 22.09.2026, и, пожалуй, главной новостью запуска стала цена снижение — тариф пошёл вниз, а не вверх: $4/$20 при чтении из кеша по $0.20. Сегодня его можно маршрутизировать через OrcaRouter ровно по этому тарифу; прайс-лист провайдера передаётся с нулевой наценкой, и изменение цены у вендора появляется на нашей стороне в тот же день, что и на их.

Что касается оценок на уровне задач, которые есть у обеих моделей, картина представляет собой настоящие качели, а не безоговорочную победу:

• Terminal-Bench 4.0 — Claude Opus 5.5 — 59,6 % против Gemini 4 Argon — 57,1 %.

• SciCode — Claude Opus 5.5 66,9 % против Gemini 4 Argon 61,8 %.

• Humanity's Last Exam — Claude Opus 5.5 61,4% против Gemini 4 Argon 57,1%.

• Рассуждение в длинном контексте — Claude Opus 5.5 84.7% против Gemini 4 Argon 79.7%.

• CritPt — Claude Opus 5.5 31,7 % против Gemini 4 Argon 27,1 %.

• Omniscience — Claude Opus 5.5 46.4 против Gemini 4 Argon 42.4.

• GDPval — Claude Opus 5.5: 1 846 против Gemini 4 Argon: 1 611.

• AutomationBench-AA — Gemini 4 Argon 77,5% против Claude Opus 5.5 69,5%. Это единственный результат очного сравнения по задачам, где Argon явно побеждает, и это также семейство задач, наиболее близкое к тому, что поощряет Vals Index.

Итак, закономерность устойчива: Opus 5.5 впереди в лестнице рассуждений с академическим уклоном, а Argon впереди в сквозном выполнении задач. Это уже не противоречие между двумя рейтингами. Это один и тот же вывод, выраженный дважды.

Возможность, по которой никто не сравнивает

Потолок вывода Gemini 4 Argon составляет 1 000 000 токенов в рамках одной траектории — против 64K у предыдущего поколения. Claude Opus 5.5 ограничивает вывод на уровне 128K. У обоих контекстное окно на 1 млн токенов, но контекст и вывод — это разные бюджеты, и это самый крупный единичный скачок по характеристикам в анонсе.

Имеет ли это значение, полностью зависит от того, что вы запускаете. Ограничение вывода в 128K щедро для чата, ревью кода, структурированного извлечения данных и шагов агента. Оно становится жёсткой стеной при генерации целого набора патчей миграции, полного отчёта об аудите или длинного документа за один проход — именно те сценарии, которые Google выбрала, чтобы проиллюстрировать запуск. Если ваш конвейер выстраивает цепочку из двадцати вызовов, чтобы остаться в пределах лимита, потолок Argon сэкономит вам задержку и код оркестрации. Если нет, вы платите за запас, который не будете использовать.

Доступность — решающая переменная, а не качество

Это та часть сравнения, к которой не привязан ни один эталон и которая значит больше, чем все они.

Gemini 4 Argon пока не находится в общем доступе. В сообщении Google говорится, что он распространяется среди доверенных киберзащитников в рамках программы Fairwind, что компания участвует в добровольном процессе доступа к моделям до выпуска, принятом в правительстве США, и что более широкий доступ для разработчиков, предприятий и потребителей появится «как можно скорее», начиная с платных клиентов API и подписчиков Google AI Ultra. Нет ни идентификатора модели, ни конечной точки, ни опубликованной квоты, ни даты. Его нет в нашем каталоге, и его также нет в публичном API у кого-либо ещё, поэтому страницы с ценами для Argon пока не существует.

Claude Opus 5.5 выходит сегодня. В OrcaRouter он доступен как anthropic/claude-opus-5.5, доступный через тот же OpenAI-совместимый эндпоинт, что и более 200 других моделей в каталоге, с автоматическим переключением при сбое между провайдерамикогда один маршрут деградирует, а также DSL маршрутизации для случаев, когда вы хотите направлять часть трафика в Opus 5.5, а остальной — в другое место на том же ключе. Никакого второго контракта, никакого второго SDK.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

Практическая рекомендация на следующий месяц прозаична: строить на Opus 5.5, хранить название модели в значении конфигурации, а не в строковом литерале, и поставить дешёвую модель за логикой повторных попыток, чтобы всплеск задержки на 702-секундном прогоне до первого токена не утянул за собой ваш продукт. Последний пункт не теоретический — задержка первого токена у Opus 5.5 на стенде AA составляет одиннадцать минут, и независимо от того, артефакт ли это стенда или модель действительно думает дольше, чем что-либо прежде, ваш бюджет тайм-аута должен задаваться этой цифрой, а не маркетингом.

Что могло бы изменить этот вердикт?

Три вещи, в порядке вероятности. Общая доступность Argon с опубликованной ценой, что сделало бы аргумент о стоимости немедленно применимым и проверило бы, выдержит ли $2/$10 столкновение с реальным трафиком. Независимый воспроизводимый запуск DeepSWE v1.1 и CWE-bench v1 за пределами Google, который либо подтвердил бы заявления вендора, либо опроверг бы их. Или конфигурация Artificial Analysis для Argon на его максимальной настройке усилий, которая бы установила, является ли пятипунктовый разрыв в индексе различием в возможностях или артефактом настроек усилий.

Пока что-либо из этого не выйдет, честный итог таков: Opus 5.5 — более проверенная модель, а Argon — более выгодное по цене заявление. А вот что из этого вы действительно можете использовать сегодня — тут и вопроса нет.

Claude Opus 5.5 уже доступна на OrcaRouter по прайсовой цене производителя, без наценки, наряду с остальным каталогом — если вы хотите протестировать её на собственной рабочей нагрузке, а не по таблице лидеров, anthropic/claude-opus-5.5— это идентификатор для вызова, а замена впоследствии на другую модель — это изменение одной строки с тем же ключом.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube