Титульная карточка Hero с надписью «Gemini 4 Argon on FrontierSWE: кричит „Эврика“, а затем сам себе ставит оценку», чип с надписью «FrontierSWE v2: среднее значение @5 — 55,0 %», чип с надписью «Третий из десяти моделей» и чип с надписью «129,36 доллара за попытку», а также строка нижнего колонтитула с надписью «Показатели FrontierSWE согласно публичному лидерборду Proximal Labs, 2026-09-30».
Guides & Insights

Gemini 4 Argon на FrontierSWE: он восклицает «Эврика!», а затем сам оценивает свою домашнюю работу.

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У Gemini 4 Argon проблема с личностью, и это самое интересное, что кто-либо говорил об этой модели с тех пор, как Goo​ogle анонсировала её 2026-09-30. В бенчмарке FrontierSWE с ультрадлинным горизонтом модель, занявшая третье место — после GPT-6 Astra и Claude Opus 5.5, — произвела на своих оценщиков запоминающееся впечатление: её любимое слово — «Эврика!», и она тратит значительную часть двадцатичасового бюджета задачи на то, чтобы быть чрезвычайно строгой к себе. Это наблюдение на грани утечки из единственного источника от оператора бенчмарка, а не заявление вендора и не примечание к релизу, и стоит точно понимать, что оно вам сообщает, а что нет. Ни у одной из трёх упомянутых выше моделей нет привязанной даты GA для Argon; наблюдение касается поведения внутри тестового стенда, а цифры, которые к нему прилагаются, — это первое независимое измерение Argon на бенчмарке, который Goo​ogle не проводит сама.

Что на самом деле представляет собой восклицание «Эврика!»

Источник — это пост @nrehiew_, инженера, занимающегося оценкой моделей, опубликованный 30 сентября 2026 года, в котором цитируется анонс Сундара Пичаи о Gemini 4 Argon. Суть — три утверждения: Argon — самая забавная модель из всех, что они оценивали на FrontierSWE; её любимое слово — «Эврика!»; и она крайне самокритична. Автор поста описывает её как большое улучшение по сравнению с предыдущими Gemini и при этом отмечает, что она сохраняет ту индивидуальность, а также называет её впечатляющей.

Читайте это внимательно, потому что тут легко переоценить. Это всего лишь впечатление одного оценщика, наблюдавшего за трассировками агентов, а не результат с оценкой, не опубликованная метрика и не то, что Proximal Labs — которые создают и запускают FrontierSWE — подписались бы как под выводом. В таблице лидеров нет колонки «самокритика». Это замечание стоит упоминания не потому, что оно авторитетно, а потому, что это единственная качественная интерпретация Argon, которую кто-либо за пределами Google предложил, и, поскольку модель широко недоступна, подобные трассировки сейчас — единственный способ увидеть, как эта вещь себя ведёт.

Это также выводит на реальный вопрос для любого, кто планирует запускать Argon в качестве агента. Долгосрочные прогоны программирования — это в основном задача управления бюджетом: модель, которая прерывает саму себя, чтобы переосмыслить, которая оценивает свою промежуточную работу и объявляет о прорывах, — это модель, которая тратит токены на процесс. Является ли это преимуществом или платой, полностью зависит от того, сходится ли самокритика или зацикливается. Один оценщик, говорящий «впечатляюще», — это точка данных, а не ответ.

FrontierSWE v2, и почему третье место — это и есть настоящая история

FrontierSWE — это не тот бенчмарк, для которого достаточно взглянуть на одну итоговую цифру. Его создала Proximal Labs, и в своём репозитории они описывают его как сверхдлинногоризонтный бенчмарк для кодинг-агентов, проверяющий реализацию, инженерию производительности и ML-исследования. Версия 2 вышла в сентябре 2026 года и добавила 21 новую задачу к исходному набору, всего 34, и предполагается, что агент будет продолжать работать до двадцати часов. Всё выполняется через собственный харнесс Proximal, proximus, который построен на mini-swe-agent и добавляет сжатие контекста, зрение и явный инструмент отправки. Оценка — mean@5, среднее по пяти попыткам на задачу, а заявленный диапазон неопределённости охватывает от среднего по худшим запускам каждой задачи до среднего по лучшим запускам.

Эта методология важна для честного прочтения строки Argon:

• Оценка — Gemini 4 Argon 55,0 % mean@5, ±9,9, в сравнении с GPT-6 Astra 65,5 % и Claude Opus 5.5 62,3 %

• Разброс — результаты прогонов Argon варьируются от 44,5% (худший@5) до 64,3% (лучший@5); этот диапазон пересекается с диапазоном Opus 5.5 52,0%–71,5% в верхней части, а с диапазоном Astra 55,1%–73,0% — нигде.

• Стоимость одного испытания — Argon $129.36, Opus 5.5 $98.87, Astra $1,029.65

• Фактическое время на одно испытание — Argon 10,6 часа, Opus 5.5 — 14,2 часа, Astra — 12,1 часа

Первое, что вы замечаете, — Argon на третьем месте, и по баллам он неблизок ко второму. Второе — то, что должно определить, волнует ли вас это, — на этом бенчмарке Argon строго доминируется Claude Opus 5.5. Opus 5.5 набрал больше баллов (62,3% против 55,0%) и стоил меньше за попытку ($98,87 против $129,36). Здесь нет ни одной оси, по которой Argon выигрывает. Его единственное преимущество — время: 10,6 часа против 14,2 у Opus 5.5, что реально, если вы платите за реальное время, а не за токены, и не имеет значения, если вы платите за бюджет на попытку.

Собственная таблица лидеров Proximal содержит сноску к строке Argon, которую должны повторять все, кто цитирует это число: «Gemini 4 Argon: доля попаданий в кэш гораздо ниже из-за настройки, не предназначенной для production». Это оценщики отмечают, что они запускали Argon вне конфигурации, которую использовало бы производственное развёртывание, что завышает его стоимость и, вероятно, задержку. Это оговорка именно к показателю стоимости, и именно поэтому $129.36 следует читать как верхнюю границу, а не как прайс-лист.

Число, которое не показывает собственная диаграмма Google

Вот здесь работа с источниками становится по-настоящему интересной — и именно здесь большинство разборов этого результата ошибутся. В анонсирующем посте Google есть диаграмма бенчмарка со строкой FrontierSWE v2. В этой строке указано: GPT-6 Astra — 65.5%, Claude Fable 5.1 — 56.3%, Claude Opus 5.5 — 62.3%. Gemini 4 Argon в ней нет. В онлайн-лидерборде Proximal у Astra — 65.5%, а у Opus 5.5 — 62.3% — те же цифры, — но Claude Fable 5.1 там указан с 56.5%, а не 56.3%, и Gemini 4 Argon указан с 55.0%.

Причина этого умолчания не загадочна, и Google сама об этом говорит: методические примечания, сопровождающие их набор для оценки, гласят, что результаты FrontierSWE приводятся из официальной публичной таблицы лидеров Proximal. Google не рассчитывала этот бенчмарк самостоятельно. Они цитируют ту же третью сторону, что и мы, а единственный показатель Argon, который эта третья сторона публикует, — 55,0%. Так что честная трактовка состоит в том, что результат Argon в FrontierSWE — это по-настоящему независимое измерение — Proximal провела его на своём стенде, на своих задачах — и что оно оставляет Argon позади двух конкурентов.

Всё остальное на диаграмме Google — это данные, сообщённые производителем, и в голове их стоит помечать именно так: Argon — 63,1% на Vals Index против 67,0% у Opus 5.5, 41,4% AutomationBench против 42,5% у Opus 5.5, 89,6% Vibe Code Bench против 90,3% как у Astra, так и у Opus 5.5, 87,5% LVBench против 83,7%, 68,0% CWE-bench v1 против 67,0% у Opus 5.5. Это прогоны Google на выбранных Google оценках. Строка FrontierSWE — единственная на той картинке, которую читатель может проверить независимо, и именно поэтому третье место весит больше, чем окружающая его картина ничьих или незначительных побед.

Что говорит Artificial Analysis, независимо

FrontierSWE — это один ракурс. Artificial Analysis — другой, и он согласуется с общей картиной. В их Intelligence Index v4.3.2 Gemini 4 Argon в конфигурации с высоким уровнем рассуждений набирает 52,56 балла — измерено независимо на их собственном оборудовании, а не по данным Google — при каталожной цене $2,00 за миллион входных токенов и $10,00 за миллион выходных токенов, со скидкой 95% на кэшированный ввод. Их инструментарий оценивает стоимость одной задачи индекса в $1,99.

Сравнение, которое действительно имеет значение, — это то же, которое провела FrontierSWE. Claude Opus 5.5 в конфигурации high набирает более высокий балл в индексе — 53,58 — при более низкой стоимости за задачу — $1,82. Два независимых оценщика, использовавших разные задачи и разные тестовые стенды, поставили Argon ниже Opus 5.5 и по качеству, и по стоимости. Это устойчивый сигнал, а не единичный артефакт бенчмаркинга, и это самое сильное, что сейчас можно сказать об экономике Gemini 4 Argon.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

Анонсировано, а не выпущено — и почему такая формулировка не педантизм

Идентификатора модели Gemini 4 Argon не существует. Доступ постепенно предоставляется через программу Fairwind проверенным специалистам по киберзащите, наряду с поэтапным открытием для платных клиентов API и подписчиков Google AI Ultra; дата общего доступа не опубликована. Публикация Google — это анонс модели и набора оценок, а не запуск эндпоинта, который можно вызвать. Если вы читали материалы, где это описывалось как релиз, эти материалы опережают факты.

Это различие имеет практические последствия для каждого, кто читает показатель FrontierSWE. Оценка проводилась на модели, к которой Proximal имел доступ по той или иной договорённости; она говорит о том, что модель умеет, а не о том, что можете получить вы. Это также означает, что показатели производительности имеют более короткий срок жизни, чем обычно. Модель, ещё не находящаяся в статусе GA, всё ещё может меняться — настройки декодирования, системные промпты, параметры использования инструментов по умолчанию и защитная обвязка всё ещё настраиваются, и указанная причина низкой доли попаданий в кэш у Argon состоит именно в том, что оценщики запускали не продакшен-конфигурацию. Ожидайте, что 55.0% и $129.36 изменятся.

Что изменило бы эту картину: опубликованный ID модели с тарифной сеткой, дата GA, повторный прогон FrontierSWE в продакшн-настройках и второй независимый оценщик, воспроизводящий результат третьего места. Пока не появятся хотя бы первые два из этих пунктов, считайте любые числа Argon — включая хорошие на собственном графике Google — предварительными.

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

Оценка личности — это то, что лучше всего сохранится со временем

Баллы в бенчмарках для модели на стадии pre-GA имеют срок годности, измеряемый неделями. А поведенческое наблюдение — нет. Долгосрочная работа агента — это то, где на самом деле проявляется характер модели, потому что двадцатичасовой бюджет с 34 задачами — это достаточно длинная дистанция, чтобы склонности модели накапливались: как она восстанавливается после неудачного подхода, останавливается ли она, чтобы перепланировать, способна ли отличить сложную задачу от неверного поворота. Оценщик, который просматривает множество таких трасс и описывает модель как самокритичную и склонную восклицать, когда что-то срабатывает, описывает модель, которая экстернализует свои рассуждения о собственном прогрессе. Это гипотеза о том, почему разброс результатов прогонов Argon составляет от 44,5 % до 64,3 % — диапазон шире, чем у Opus 5.5, — и её можно проверить, как только модель станет доступна для вызова.

Вторая половина этого замечания — та, к которой и следует относиться скептически. «Большое улучшение по сравнению с предыдущими Gemini» — это сравнение с моделями, которые никогда не оценивались на этом бенчмарке в рамках этой тестовой обвязки, поэтому его вообще невозможно проверить по таблице лидеров. Это впечатление, и относиться к нему следует именно как к впечатлению, каким бы заслуживающим доверия ни был человек, который его высказывает.

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

Что это значит для вас, если вам сегодня действительно нужен агент с длинным горизонтом

Нельзя называть Gemini 4 Argon, поэтому практический вопрос не в том, Argon против кого-то — а в том, какую модель вам следует использовать для работы, на которой тестировался Argon. Собственный порядок FrontierSWE отвечает на это: GPT-6 Astra возглавляет таблицу с 65,5%, но при $1 029,65 за попытку — примерно в десять раз дороже двух моделей под ней, тогда как Claude Opus 5.5 даёт 62,3% за $98,87. Лучший выбор по соотношению цены и качества в этом бенчмарке — Opus 5.5, и это также модель, которая обошла Argon в Artificial Analysis при более низкой стоимости за задачу.

Обе эти модели, как и большинство из топ-10 рейтинга — среди них GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp и Muse Spark 1.2 — можно маршрутизировать через единый API OrcaRouter наряду с более чем 200 другими — один ключ, 0% наценки, так что вы платите по прейскурантной цене провайдера, а снижение цены вендором отражается на нашей стороне в тот же день. Последнее свойство ценнее обычного для модели до GA: если цены Argon изменятся в период между сейчас и GA, на что намекает сноска о кэше для непроизводственных сред, в вашей интеграции ничего не изменится, когда это произойдёт. Автоматическое переключение при сбое — это ещё один элемент, который подходит для данного конкретного случая — незнакомая модель, режимы отказа которой ещё никто не описал, — это именно то, чего не хочется на единственном жёстко заданном продакшн-пути.

Чтобы внести ясность в один момент: Gemini 4 Argon отсутствует в нашем каталоге. Запрос к нашему публичному API моделей для google/gemini-4-argon возвращает «model not found», и больше никто его не хостит — доступ к нему ограничен программой Fairwind Program от Google, а идентификатор модели не опубликован. Когда он станет доступен для вызова, мы будем его маршрутизировать, и приведённые выше показатели FrontierSWE — это причина следить за наступлением этого дня, а не пассивно его ждать. Модели, которым он уступил, уже там.

Что посмотреть

Сигналы, которые превратили бы это из того, что мы знаем на данный момент, в решение, конкретны. Опубликованный ID модели и её тарифная карта. Дата выхода в общую доступность. Повторный запуск FrontierSWE в производственных настройках, который позволил бы определить, является ли стоимость $129.36 за попытку реальной ставкой или артефактом конфигурации кэша, на которую указала Proximal. И, в идеале, второй оценщик, публикующий трассировки Argon, чтобы наблюдение «Эврика!» перестало быть выборкой из одного.

А до тех пор честное резюме остаётся узким, и за него стоит держаться: Gemini 4 Argon анонсирован, по мнению одного оценщика, он необычайно выразителен в длинногорizonтных трассах агентов, а на единственном независимом бенчмарке, который мы можем проверить, он занял третье место, уступив двум моделям — одна из которых обошла его одновременно и по баллам, и по стоимости.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube