
Gemini 4 Argon på FrontierSWE: Det ropar "Eureka!" och rättar sedan sin egen läxa
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 261 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Gemini 4 Argon har ett personlighetsproblem, och det är det mest intressanta någon har sagt om modellen sedan Google tillkännagav den 2026-09-30. På FrontierSWE-benchmarken med ultralång tidshorisont lämnade modellen som kom trea — efter GPT-6 Astra och Claude Opus 5.5 — ett minnesvärt intryck hos sina utvärderare: dess favoritord är "Eureka!", och den lägger en stor del av den tjugotimmars uppgiftsbudgeten på att vara extremt hård mot sig själv. Det är en läckagenära, enkällig observation från en benchmarkoperatör, inte ett leverantörspåstående och inte en releaseanteckning, och det är värt att vara precis om vad den berättar och inte berättar för dig. Ingen av de tre modellerna ovan har ett GA-datum för Argon knutet till sig; observationen gäller beteende i en harness, och siffrorna som följer med den är den första oberoende mätningen av Argon på en benchmark som Google inte kör själv.
Vad "Eureka!"-yttrandet egentligen är
Källan är ett inlägg från @nrehiew_, en ingenjör som arbetar med modellutvärdering, publicerat 2026-09-30, som citerar Sundar Pichais tillkännagivande av Gemini 4 Argon. Innehållet är tre påståenden: Argon är den mest underhållande modellen de har utvärderat på FrontierSWE; dess favoritord är "Eureka!"; och den är extremt självkritisk. Inläggsförfattaren beskriver den som en stor förbättring jämfört med tidigare Geminis samtidigt som den fortfarande behåller den personligheten, och kallar den imponerande.
Läs det noggrant, för det är lätt att övertolka. Det är en utvärderares intryck från att ha tittat på agentspår, inte ett poängsatt resultat, inte ett publicerat mått och inte något som Proximal Labs – som bygger och driver FrontierSWE – har satt sitt namn bakom som en slutsats. Det finns ingen kolumn för ”självkritik” på resultattavlan. Det som gör anmärkningen värd att skriva om är inte att den är auktoritativ; det är att den är den enda kvalitativa tolkning som någon utanför Google har erbjudit om Argon, och eftersom modellen inte är allmänt tillgänglig är spår som dessa för närvarande det enda sättet att se den bete sig.
Det landar också i en verklig fråga för alla som planerar att köra Argon som en agent. Kodkörningar över lång horisont är mestadels ett budgethanteringsproblem: en modell som avbryter sig själv för att tänka om, som betygsätter sitt eget mellanliggande arbete och som tillkännager genombrott, är en modell som spenderar tokens på process. Huruvida det är en styrka eller en skatt beror helt och hållet på om självkritiken konvergerar eller loopar. En enda utvärderare som säger ”imponerande” är en datapunkt, inte ett svar.
FrontierSWE v2, och varför tredjeplatsen är den egentliga historien
FrontierSWE är inte den typ av benchmark som man kan läsa ut ett rubriknummer från. Den är byggd av Proximal Labs och beskrivs i deras repo som en benchmark för kodningsagenter med ultralång horisont som testar implementering, prestandaengineering och ML-forskning. Version 2 släpptes i september 2026 med 21 nya uppgifter utöver den ursprungliga uppsättningen, totalt 34, och den förväntar sig att en agent ska fortsätta arbeta i upp till tjugo timmar. Allt körs genom Proximals egen harness, proximus, som är byggd på mini-swe-agent och lägger till context compaction, vision och ett explicit submit-verktyg. Poängsättningen är mean@5 — genomsnittet av fem försök per uppgift — med det rapporterade osäkerhetsbandet som sträcker sig från genomsnittet av varje uppgifts sämsta körning till genomsnittet av dess bästa körning.
Den metodiken är viktig för att läsa Argons rad ärligt:
• Poäng — Gemini 4 Argon 55,0 % mean@5, ±9,9, mot GPT-6 Astra 65,5 % och Claude Opus 5.5 62,3 %
• Spridning — Argons körningar sträcker sig från 44,5 % (sämst@5) till 64,3 % (bäst@5), ett intervall som överlappar Opus 5.5:s 52,0 %–71,5 % i toppen och inte Astras 55,1 %–73,0 % någonstans
• Kostnad per försök — Argon 129,36 USD, Opus 5.5 98,87 USD, Astra 1 029,65 USD
• Väggklockstid per försök — Argon 10,6 timmar, Opus 5.5 14,2 timmar, Astra 12,1 timmar
Det första du lägger märke till är att Argon ligger trea och att det inte är nära tvåan poängmässigt. Det andra – det som borde avgöra om du bryr dig – är att Argon i detta benchmark är strikt dominerad av Claude Opus 5.5. Opus 5.5 fick högre poäng (62,3 % mot 55,0 %) och kostade mindre per försök ($98,87 mot $129,36). Det finns ingen axel här där Argon vinner. Dess enda fördel är tid: 10,6 timmar mot Opus 5.5:s 14,2, vilket är verkligt om du betalar för väggklockstid och inte för tokens, och irrelevant om du betalar för en budget per försök.
Proximals egen resultattavla har en fotnot vid Argons rad som alla som citerar detta nummer bör upprepa: "Gemini 4 Argon: Cache-träfffrekvensen är mycket lägre på grund av en icke-produktionsinställning." Det är utvärderarna som flaggar att de körde Argon utanför den konfiguration som en produktionsdriftsättning skulle använda, vilket blåser upp dess kostnad och rimligen även dess latens. Det är ett förbehåll som specifikt gäller kostnadssiffran, och det är anledningen till att $129.36 bör läsas som en övre gräns snarare än en prislista.
Siffran som Googles eget diagram inte visar
Det är här som källarbetet blir genuint intressant, och där de flesta skildringar av detta resultat kommer att gå fel. Googles tillkännagivandeinlägg innehåller ett benchmarkdiagram med en rad för FrontierSWE v2. Den raden anger GPT-6 Astra 65,5 %, Claude Fable 5.1 56,3 %, Claude Opus 5.5 62,3 %. Gemini 4 Argon finns inte med. Proximals live-topplista har Astra på 65,5 % och Opus 5.5 på 62,3 % — samma siffror — men anger Claude Fable 5.1 till 56,5 %, inte 56,3 %, och listar Gemini 4 Argon på 55,0 %.
Anledningen till utelämnandet är inte mystisk, och Google säger det själva: metodanteckningarna som åtföljer deras utvärderingssvit anger att FrontierSWE-resultat rapporteras från Proximals officiella offentliga resultattavla. Google beräknade inte detta benchmark själva. De citerar samma tredje part som vi, och den enda Argon-siffran som den tredje parten publicerar är 55,0 %. Så den ärliga tolkningen är att Argons FrontierSWE-poäng är en genuint oberoende mätning – Proximal körde den, i deras testramverk, på deras uppgifter – och att den placerar Argon bakom två konkurrenter.
Allt annat i Googles diagram är leverantörsrapporterat och bör betraktas som sådant i ditt huvud: Argon 63,1 % på Vals Index mot Opus 5.5:s 67,0 %, 41,4 % AutomationBench mot Opus 5.5:s 42,5 %, 89,6 % Vibe Code Bench mot 90,3 % för både Astra och Opus 5.5, 87,5 % LVBench mot 83,7 %, 68,0 % CWE-bench v1 mot Opus 5.5:s 67,0 %. Det är Googles körningar av Googles valda utvärderingar. FrontierSWE-raden är den enda i den bilden som en läsare kan kontrollera självständigt, vilket är precis varför tredjeplatsen väger tyngre än mönstret med oavgjort eller svag vinst runt omkring den.
Vad Artificial Analysis säger
FrontierSWE är en lins. Artificial Analysis är den andra, och den stämmer med berättelsens form. I deras Intelligence Index v4.3.2 får Gemini 4 Argon i sin konfiguration med hög resonemangsnivå 52,56 – mätt oberoende på deras egen hårdvara, inte rapporterat av Google – till ett listpris på $2,00 per miljon indatatokens och $10,00 per miljon utdatatokens, med 95 % rabatt för cachad indata. Deras instrumentering sätter kostnaden för en enskild indextask till $1,99.
Jämförelsen som spelar roll är densamma som FrontierSWE tog fram. Claude Opus 5.5 i sin höga konfiguration får högre poäng på indexet, 53,58, till en lägre kostnad per uppgift, 1,82 dollar. Två oberoende utvärderare, med olika uppgifter och olika testramverk, placerar Argon bakom Opus 5.5 i både kvalitet och kostnad. Det är en konsekvent signal snarare än en enskild benchmarkingartefakt, och det är det starkaste man för närvarande kan säga om Gemini 4 Argons ekonomi.

Annonserad, inte släppt – och varför den formuleringen inte är pedanteri
Det finns inget modell-ID för Gemini 4 Argon. Åtkomst rullas ut genom Fairwind Program till granskade cyberförsvarare, parallellt med en stegvis öppning för betalande API-kunder och prenumeranter på Google AI Ultra, utan något publicerat datum för allmän tillgänglighet. Googles inlägg är ett tillkännagivande av en modell och en uppsättning utvärderingar, inte en lansering av en slutpunkt som du kan anropa. Om du har läst rapportering som beskrev detta som en lansering, ligger den rapporteringen före fakta.
Den distinktionen har praktiska konsekvenser för alla som läser FrontierSWE-siffran. Utvärderingen kördes mot en modell som Proximal hade tillgång till genom någon form av överenskommelse; den säger vad modellen kan göra, inte vad du kan få. Det innebär också att prestandasiffrorna har kortare halveringstid än vanligt. En modell som ännu inte är GA kan fortfarande förändras – avkodningsinställningar, systemprompter, standardinställningar för verktygsanvändning och säkerhetsstöd justeras fortfarande, och den angivna anledningen till att Argons cacheträfffrekvens var låg är just att utvärderarna inte körde en produktionskonfiguration. Räkna med att 55,0 % och $129,36 ändras.
Vad skulle ändra den här bilden: ett publicerat modell-ID med ett priskort, ett GA-datum, en ny körning av FrontierSWE under produktionsinställningar och en andra oberoende utvärderare som reproducerar tredjeplatsresultatet. Tills åtminstone de två första av dessa finns, behandla varje Argon-siffra – inklusive de bra i Googles eget diagram – som preliminär.

Personlighetsläsningen är den del som kommer att åldras bäst.
Benchmarkpoäng för en pre-GA-modell har en hållbarhet som mäts i veckor. Den beteendemässiga observationen gör det inte. Långsiktigt agentarbete är där en modells karaktär faktiskt visar sig, eftersom en budget på tjugo timmar med 34 uppgifter är tillräckligt med rep för att en modells tendenser ska förstärkas: hur den återhämtar sig från ett misslyckat angreppssätt, om den stannar upp för att planera om, om den kan skilja mellan ett svårt problem och ett felsteg. En utvärderare som tittar på många av dessa spår och beskriver en modell som självkritisk och benägen att utbrista när något fungerar, beskriver en modell som externaliserar sitt resonemang om sina egna framsteg. Det är en hypotes om varför Argons körningar sträcker sig från 44,5 % till 64,3 % – ett bredare spann än Opus 5.5:s – och den går att testa så snart modellen är anropbar.
Den andra halvan av uttalandet är den man bör vara skeptisk mot. "En stor förbättring jämfört med tidigare Geminis" är en jämförelse med modeller som aldrig har poängsatts på detta benchmark under detta harness, så den kan inte alls kontrolleras mot resultattavlan. Det är ett intryck, och det bör behandlas som ett sådant, hur trovärdig den som framför det än är.

Var detta lämnar dig om du faktiskt behöver en långsiktig agent idag
Du kan inte kalla Gemini 4 för Argon, så den praktiska frågan är inte Argon kontra något annat – utan vilken modell du bör köra för det arbete som Argon benchmarkades på. FrontierSWE:s egen rangordning ger svaret: GPT-6 Astra toppar listan med 65,5 %, men till $1 029,65 per försök, ungefär tio gånger kostnaden för de två modellerna närmast under den, medan Claude Opus 5.5 levererar 62,3 % för $98,87. Det mest prisvärda valet i detta benchmark är Opus 5.5, och det är också modellen som slog Argon på Artificial Analysis till en lägre kostnad per uppgift.
Båda dessa modeller, och de flesta av topplistans tio bästa — GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp och Muse Spark 1.2 bland dem — kan routas via OrcaRouters enda API tillsammans med 200-plus andra — en nyckel, 0 % påslag, så leverantörens listpris är vad du betalar och en leverantörs prissänkning landar hos oss samma dag. Den sista egenskapen är värd mer än vanligt på en pre-GA-modell: om Argons prissättning ändras mellan nu och GA, vilket fotnoten om icke-produktionscache antyder att den kan göra, förändras ingenting i din integration när det sker. Automatisk failover är den andra pusselbiten som passar det här specifika fallet — en obekant modell vars felmönster ingen ännu har kartlagt är precis vad du inte vill ha på en enda hårdkodad produktionsväg.
För att vara tydlig med en sak: Gemini 4 Argon finns inte i vår katalog. En uppslagning mot vårt publika modell-API för google/gemini-4-argon returnerar ”model not found”, och ingen annan hostar den heller – den är låst bakom Googles Fairwind Program utan publicerat modell-ID. När den blir anropbar kommer vi att routa den, och FrontierSWE-siffrorna ovan är anledningen att hålla utkik efter den dagen snarare än att vänta på den. Modellerna den förlorade mot finns redan där.
Vad du ska titta på
Signalerna som skulle förvandla detta från en lägesbild av vad vi vet så här långt till ett beslut är specifika. Ett publicerat modell-ID och dess prislista. Ett datum för allmän tillgänglighet. En omkörning av FrontierSWE under produktionsinställningar, vilket skulle avgöra huruvida kostnaden på $129.36 per försök är en verklig taxa eller en artefakt av den cachekonfiguration som Proximal flaggade. Och, helst, en andra utvärderare som publicerar Argon-spår så att ”Eureka!”-observationen slutar vara ett stickprov på bara en.
Fram till dess är den ärliga sammanfattningen snäv och värd att hålla fast vid: Gemini 4 Argon har annonserats, den är ovanligt uttrycksfull i agentspår med lång horisont enligt en utvärderare, och på den enda oberoende benchmark som vi kan kontrollera slutade den trea bakom två modeller – varav en slog den både i poäng och kostnad samtidigt.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
