
FrontierSWEでのGemini 4 Argon:「エウレカ!」と叫び、その後自分の宿題を採点する
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 261 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
Gemini 4 Argonには性格上の問題があり、それはGoogleが2026-09-30に発表して以来、このモデルについて誰かが述べたことの中で最も興味深いものだ。超長期ホライズンのFrontierSWEベンチマークでは、3位で終えたモデル——GPT-6 AstraとClaude Opus 5.5に後れを取った——が、評価者たちに忘れがたい印象を残した。そのモデルのお気に入りの言葉は「Eureka!」で、20時間のタスク予算の多くを、自分に対して極端に厳しくすることで費やしている。これはベンチマーク運用者による、リークに近い単一情報源の観察であり、ベンダーの主張でもリリースノートでもない。そして、それが何を伝え、何を伝えないかについては正確を期す価値がある。上記の3モデルのいずれにもArgonのGA日は付随していない。この観察はハーネス内部での振る舞いに関するものであり、それに付随する数値は、Google自身が運営していないベンチマーク上でのArgonの最初の独立した測定値である。
「Eureka!」という言葉の実際のところとは何か
出典は、モデル評価に携わるエンジニア @nrehiew_ が2026-09-30に公開した投稿で、Sundar Pichai の Gemini 4 Argon 発表を引用している。内容は3つの主張からなる。Argon は FrontierSWE で彼らが評価した中で最も愉快なモデルであること、そのお気に入りの言葉は「Eureka!」であること、そして極めて自己批判的であること。投稿者は、以前の Gemini 群からの大きな改善でありながら、その個性を保っていると述べ、印象的だと評している。
それは注意深く読んでください。過剰に読み取るのはたやすいからです。これは、ある評価者がエージェントのトレースを眺めて得た一つの印象であり、点数化された結果でも、公表された指標でも、FrontierSWE を構築・運営する Proximal Labs が所見として名を連ねたものでもありません。リーダーボードに「自己批判」欄はありません。この発言が記事に値するのは、それが権威的だからではなく、Google の外部で誰かが Argon について示した唯一の定性的な見解だからです。そして、このモデルは一般には入手できないため、こうしたトレースが現在、そのモデルがどう振る舞うかを目にする唯一の手段なのです。
これはまた、Argonをエージェントとして動かそうと考えている人にとって、本質的な問いに行き着く。長期的なコーディング実行は、主に予算管理の問題だ。自らを中断して考え直し、自分の途中作業を採点し、ブレークスルーを発表するモデルは、プロセスにトークンを費やすモデルである。それが強みなのか負担なのかは、自己批判が収束するかループするかに完全に依存する。単一の評価者が「印象的だ」と言うのは、一つのデータ点であって、答えではない。
FrontierSWE v2、そして3位入賞こそが本当の話題である理由
FrontierSWE は、見出しの数値だけを読めば済むようなベンチマークではありません。これは Proximal Labs によって構築され、彼らのリポジトリでは、実装、パフォーマンスエンジニアリング、機械学習研究を試す超長期的なコーディングエージェントベンチマークとして説明されています。バージョン2は2026年9月に、元のセットに21の新規タスクを追加した形でリリースされ、合計34タスクとなり、エージェントが最大20時間作業を続けることを想定しています。すべては Proximal 独自のハーネス、proximusを通して実行されます。これは mini-swe-agent 上に構築されており、コンテキスト圧縮、視覚、明示的な submit ツールを追加しています。採点は mean@5 — タスクごとの5回の試行の平均 — で、報告される不確実性の幅は、各タスクの最悪実行の平均から最良実行の平均に及びます。
その方法論は、Argonの行を正直に読むうえで重要です:
• スコア — Gemini 4 Argon 55.0% mean@5、±9.9、対 GPT-6 Astra 65.5%、Claude Opus 5.5 62.3%
• ばらつき — Argon の実行は 44.5%(worst@5)から 64.3%(best@5)の範囲にわたり、その範囲は Opus 5.5 の 52.0%–71.5% とは上端で重なるが、Astra の 55.1%–73.0% とはどこも重ならない
• 試験あたりのコスト — Argon $129.36、Opus 5.5 $98.87、Astra $1,029.65
• 試行あたりの実時間 — Argon 10.6時間、Opus 5.5 14.2時間、Astra 12.1時間
最初に気づくのは、Argonが3位で、スコアで2位とは大きく差があることだ。次に気づくこと——あなたが気にするべきかどうかを決めるのはこれだ——は、このベンチマークでArgonがClaude Opus 5.5に厳密に支配されていることだ。Opus 5.5はより高いスコア(62.3% 対 55.0%)で、1試行あたりのコストも安かった($98.87 対 $129.36)。ここにはArgonが勝つ軸が一つもない。唯一の利点は時間だ。10.6時間 対 Opus 5.5の14.2時間で、トークンではなく実時間に金を払っているなら意味があり、1試行あたりの予算に金を払っているなら無関係だ。
Proximal自身のリーダーボードには、Argonの行に対して、この数値を引用する全員が繰り返すべき脚注が付いている:「Gemini 4 Argon:キャッシュヒット率は、非本番設定のためにはるかに低い。」これは、評価者たちが、本番デプロイで使われる構成の外でArgonを実行したことを指摘しており、そのコストを膨らませ、おそらくレイテンシも膨らませている。これは特にコストの数値に関する注意書きであり、$129.36を料金表ではなく上限として読むべき理由である。
グーグル自身のチャートが示していない数字
ここからが情報源の検証が本当に面白くなるところであり、この結果について書かれたほとんどの記事がここで誤ることになる。Googleの発表記事には、FrontierSWE v2の行を含むベンチマークチャートが掲載されている。その行には、GPT-6 Astra 65.5%、Claude Fable 5.1 56.3%、Claude Opus 5.5 62.3%と記されている。Gemini 4 Argonはそこに含まれていない。Proximalのライブリーダーボードでは、Astraが65.5%、Opus 5.5が62.3% — 同じ数値だ — だが、Claude Fable 5.1は56.3%ではなく56.5%とされ、Gemini 4 Argonは55.0%として掲載されている。
その省略の理由は不可解ではないし、Google自身がそう言っている。彼らの評価スイートに付随する方法論ノートには、FrontierSWEの結果はProximalの公式公開リーダーボードから報告されたものだと記されている。Googleはこのベンチマークを自ら計算したのではない。彼らは我々と同じ第三者から引用しており、その第三者が公表している唯一のArgonの数値は55.0%である。したがって正直に解釈すれば、ArgonのFrontierSWEスコアは真に独立した測定値であり——Proximalが彼らのハーネスで、彼らのタスクで実施したものだ——そしてそれはArgonを2社の競合他社より下位に置くということになる。
Googleのチャートにある他のすべてはベンダーによる報告であり、頭の中ではそのようにラベル付けすべきだ:ArgonはVals Indexで63.1%で、Opus 5.5の67.0%に対して。41.4% AutomationBenchで、Opus 5.5の42.5%に対して。89.6% Vibe Code Benchで、AstraとOpus 5.5の両方の90.3%に対して。87.5% LVBenchで、83.7%に対して。68.0% CWE-bench v1で、Opus 5.5の67.0%に対して。これらはGoogleが選んだ評価をGoogleが実行したものだ。FrontierSWEの行は、その図の中で読者が独立に検証できる唯一のものであり、まさにだからこそ、3位という結果は、その周囲にある引き分けまたは僅差の勝利というパターンよりも重みを持つ。
Artificial Analysisが独自に述べていること
FrontierSWEは一方のレンズだ。もう一方はArtificial Analysisであり、それはこの話の輪郭と一致している。同社のIntelligence Index v4.3.2では、Gemini 4 Argonの高推論構成が52.56を記録している——Googleによる報告ではなく、同社自身のハードウェア上で独立に測定されたものだ——定価は入力100万トークンあたり$2.00、出力100万トークンあたり$10.00で、キャッシュ済み入力には95%の割引が適用される。同社の計測では、1つのインデックスタスクのコストは$1.99となる。
重要な比較とは、FrontierSWE が示したまさにその比較だ。Claude Opus 5.5 はハイ構成において、インデックス上でより高いスコア 53.58 を記録し、タスクあたりコストはより低い $1.82 だ。異なるタスクと異なるハーネスを使う2人の独立した評価者が、品質とコストの両方で Argon を Opus 5.5 より下位に置いた。それは単一のベンチマーク上の産物ではなく一貫したシグナルであり、Gemini 4 Argon の経済性について現時点で言える最も強いことだ。

発表済み、未リリース — そしてその言い回しが重箱の隅をつつくことではない理由
Gemini 4 Argon というモデル ID は存在しません。アクセスは Fairwind Program を通じて、審査を通過したサイバー防御担当者に順次提供されており、あわせて有料 API 顧客と Google AI Ultra 購読者への段階的な開放が進められていますが、一般提供日は公表されていません。Google の投稿は、モデルと一連の評価の発表であり、呼び出せるエンドポイントのリリースではありません。これをリリースとして伝える報道を読んだのであれば、その報道は事実より先走っています。
その区別は、FrontierSWEの数値を読む人にとって実際的な意味を持つ。この評価は、Proximalが何らかの取り決めの下でアクセスできたモデルに対して実施されたものであり、そのモデルができることを示すのであって、あなたが利用できるものを示すのではない。また、性能指標の半減期が通常より短いことも意味する。まだGAしていないモデルは変わり得る — デコーディング設定、システムプロンプト、ツール使用のデフォルト、安全性のスキャフォールディングはすべてまだ調整中であり、Argonのキャッシュヒット率が低かったとされる理由はまさに、評価者たちが本番構成で実行していなかったからだ。55.0%と$129.36が動くことを想定しておくべきだ。
この状況を変えるものは、料金表を伴う公開されたモデルID、GA日、本番環境設定下でのFrontierSWEの再実行、そして3位の結果を再現する第2の独立した評価者だ。少なくともそのうち最初の2つが存在するまでは、すべてのArgonの数値を——Google自身のチャートにある良好な数値も含めて——暫定的なものとして扱うこと。

パーソナリティの読み取りは、最も時を経ても色あせない部分だ。
GA前モデルのベンチマークスコアの賞味期限は数週間単位で測られる。行動観察のそれは違う。長期間を見据えたエージェント作業こそ、モデルの性格が実際に現れる場だ。なぜなら、34タスクに20時間の予算は、モデルの傾向が複利的に積み上がるのに十分な余裕を与えるからだ。失敗したアプローチからどう立ち直るか、再計画のために止まるか、難しい問題と誤った方向転換を見分けられるか。こうしたトレースを数多く見ている評価者が、そのモデルを自己批判的で、何かがうまくいったときに思わず声を上げがちだと表現するとき、その評価者は、自身の進捗についての推論を外在化するモデルを描写している。これが、Argonの実行結果が44.5%から64.3%へと広がった理由についての仮説であり——Opus 5.5のものより広い幅である——、モデルが呼び出し可能になれば検証できる。
その発言のもう半分こそ、懐疑的に見るべき部分だ。「以前のGemini群からの大幅な改善」は、このベンチマークでこのハーネスの下で採点されたことのないモデルとの比較であり、したがってリーダーボードと照合することはまったくできない。それは印象であり、それを述べる人物がどれほど信用できようとも、印象として扱うべきである。

今日、実際に長期的なタスクをこなすエージェントを必要としているなら、これによってあなたがどうなるか
Gemini 4 Argon を呼び出すことはできないので、実用的な問いは Argon 対何かではなく、Argon がベンチマークされた作業にどのモデルを実行すべきかである。FrontierSWE 自身の順位付けがその答えを示している。GPT-6 Astra が 65.5% で首位だが、1試行あたり $1,029.65 で、そのすぐ下の2モデルのおよそ10倍のコストがかかる。一方、Claude Opus 5.5 は $98.87 で 62.3% を達成する。このベンチマークでのコスパ最優秀は Opus 5.5 であり、Artificial Analysis で Argon をタスクあたりより低いコストで破ったモデルでもある。
これらのモデルはどちらも、そしてリーダーボードのトップ10の大半——GLM-5.3、Grok 4.7、Kimi K3、Qwen3.8-Max、DeepSeek V4 Flash Vision Exp、Muse Spark 1.2 など——は、OrcaRouter の単一 API を通じてルーティングできます他 200 以上と並んで ——1 つのキー、0% のマークアップ。つまりプロバイダーの定価がそのまま支払額となり、ベンダーの値下げは当日中にこちら側にも反映されます。この最後の特性は、GA 前のモデルではいつも以上に価値があります。Argon の価格が現時点から GA までの間に変わるとしても——非本番キャッシュに関する脚注が示唆しているように、変わる可能性はあります——それが起きても、あなたの統合に変更は一切生じません。 自動フェイルオーバーも、この特定のケースに適合するもう一つの要素です ——失敗モードがまだ誰にもマッピングされていない不慣れなモデルは、まさに単一のハードコードされた本番パスに置きたくないものだからです。
ひとつだけ明確にしておくと、Gemini 4 Argon は当社のカタログにはありません。当社の公開モデルAPIで google/gemini-4-argon を照会すると "model not found" が返り、他にホストしているところもありません — これは Google の Fairwind Program の下で制限されており、モデルIDは公開されていません。呼び出し可能になったらルーティングしますし、上記の FrontierSWE の数値は、その日を待つのではなく注視すべき理由です。それが敗れた相手のモデルはすでにそこにあります。
何を見るべきか
これを「これまでに分かったこと」から判断へと変えるシグナルは具体的だ。公開されたモデルIDとその料金表。一般提供開始日。本番設定下でのFrontierSWEの再実行——これにより、試行あたり129.36ドルのコストが実際の料金なのか、Proximalが指摘したキャッシュ構成による人為的な結果なのかが解決する。そして理想的には、第2の評価者がArgonのトレースを公開し、「Eureka!」という観察がサンプル数1ではなくなることだ。
それまでは、正直な要約は限定的であり、それでも保持しておく価値がある。Gemini 4 Argon は発表された。ある評価者によれば、長期的なエージェントトレースにおいて異常なほど表現豊かであり、我々が確認できる唯一の独立系ベンチマークでは、2つのモデルに次いで3位だった。そのうちの1つは、スコアとコストの両方で同時にそれを上回った。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
