Thẻ tiêu đề Hero ghi Gemini 4 Argon trên FrontierSWE: Nó hét lên Eureka, rồi tự chấm bài tập về nhà của chính mình, với một chip ghi FrontierSWE v2 trung bình 55,0 phần trăm ở mức 5, một chip ghi Thứ ba trong mười mô hình, và một chip ghi 129,36 đô la mỗi lần thử, và một dòng chân trang ghi số liệu FrontierSWE theo bảng xếp hạng công khai của Proximal Labs, 2026-09-30.
Guides & Insights

Gemini 4 Argon trên FrontierSWE: Nó hét lên "Eureka!", rồi tự chấm bài tập về nhà của chính mình

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Gemini 4 Argon có một vấn đề về tính cách, và đó là điều thú vị nhất mà bất kỳ ai đã nói về mô hình này kể từ khi Google công bố nó vào ngày 2026-09-30. Trên benchmark FrontierSWE với tầm siêu dài hạn, mô hình xếp thứ ba — sau GPT-6 Astra và Claude Opus 5.5 — đã để lại cho những người đánh giá nó một ấn tượng khó quên: từ yêu thích của nó là “Eureka!”, và nó dành phần lớn ngân sách hai mươi giờ cho nhiệm vụ để cực kỳ khắt khe với chính mình. Đó là một quan sát gần với rò rỉ, chỉ từ một nguồn duy nhất, của một đơn vị vận hành benchmark, không phải tuyên bố của nhà cung cấp và không phải ghi chú phát hành, và đáng để nói chính xác về những gì nó cho bạn biết và không cho bạn biết. Không mô hình nào trong ba mô hình trên có kèm ngày GA cho Argon; quan sát này nói về hành vi bên trong một khung kiểm thử, và những con số đi kèm là phép đo độc lập đầu tiên về Argon trên một benchmark mà chính Google không vận hành.

Lời nhận xét “Eureka!” thực sự là gì

Nguồn là một bài đăng của @nrehiew_, một kỹ sư làm về đánh giá mô hình, đăng ngày 2026-09-30, trích dẫn thông báo Gemini 4 Argon của Sundar Pichai. Nội dung chính là ba khẳng định: Argon là mô hình thú vị nhất mà họ đã đánh giá trên FrontierSWE; từ yêu thích của nó là "Eureka!"; và nó cực kỳ tự phê bình. Người đăng mô tả nó là một cải tiến lớn so với các Gemini trước đó trong khi vẫn giữ được cá tính đó, và gọi nó là ấn tượng.

Hãy đọc kỹ điều đó, bởi rất dễ diễn giải quá xa. Đó là ấn tượng của một người đánh giá khi xem các dấu vết agent, không phải một kết quả được chấm điểm, không phải một chỉ số đã công bố, và không phải điều mà Proximal Labs — đơn vị xây dựng và vận hành FrontierSWE — đã đứng tên như một phát hiện. Không có cột "tự phê bình" nào trên bảng xếp hạng. Điều khiến nhận xét này đáng để viết về không phải là nó có tính thẩm quyền; mà là nó là nhận định định tính duy nhất mà bất kỳ ai bên ngoài Google từng đưa ra về Argon, và vì mô hình này không được cung cấp rộng rãi, những dấu vết như thế này hiện là cách duy nhất để thấy nó vận hành.

Điều đó cũng chạm đến một câu hỏi thực sự đối với bất kỳ ai dự định chạy Argon như một agent. Các phiên lập trình dài hạn chủ yếu là một bài toán quản lý ngân sách: một mô hình tự ngắt để cân nhắc lại, tự đánh giá công việc trung gian của chính nó và loan báo những bước đột phá, là một mô hình tiêu tốn token vào quá trình. Việc đó là điểm mạnh hay một khoản thuế phụ thuộc hoàn toàn vào việc tự phê bình đó hội tụ hay lặp vô hạn. Một evaluator duy nhất nói “ấn tượng” chỉ là một điểm dữ liệu, không phải câu trả lời.

FrontierSWE v2, và lý do vì sao vị trí thứ ba mới là câu chuyện thực sự

FrontierSWE không phải là kiểu benchmark mà bạn có thể chỉ đọc một con số nổi bật là nắm được. Nó được xây dựng bởi Proximal Labs và được mô tả trong repository của họ như một benchmark dành cho coding agent với tầm nhìn siêu dài hạn, kiểm tra việc triển khai, kỹ thuật hiệu năng và nghiên cứu ML. Phiên bản 2 ra mắt vào tháng 9 năm 2026 với 21 tác vụ mới bổ sung vào bộ gốc, nâng tổng số lên 34, và nó kỳ vọng agent có thể làm việc liên tục tới hai mươi giờ. Mọi thứ đều được chạy qua harness riêng của Proximal, proximus, vốn được xây dựng trên mini-swe-agent và bổ sung khả năng nén ngữ cảnh, thị giác cùng một công cụ submit tường minh. Cách tính điểm là mean@5 — trung bình của năm lần thử cho mỗi tác vụ — với dải bất định được báo cáo trải từ trung bình lần chạy tệ nhất của mỗi tác vụ đến trung bình lần chạy tốt nhất của tác vụ đó.

Phương pháp luận đó quan trọng để đọc hàng của Argon một cách trung thực:

• Điểm — Gemini 4 Argon 55,0% mean@5, ±9,9, so với GPT-6 Astra 65,5% và Claude Opus 5.5 62,3%

• Độ trải — dải kết quả chạy của Argon trải từ 44,5% (worst@5) đến 64,3% (best@5), một khoảng chồng lấn với dải 52,0%–71,5% của Opus 5.5 ở phần trên và không chồng lấn chút nào với dải 55,1%–73,0% của Astra

• Chi phí mỗi lần thử — Argon $129,36, Opus 5.5 $98,87, Astra $1.029,65

• Thời gian thực tế mỗi lần thử — Argon 10.6 giờ, Opus 5.5 14.2 giờ, Astra 12.1 giờ

Điều đầu tiên bạn nhận ra là Argon đứng thứ ba và điểm số của nó không hề gần với vị trí thứ hai. Điều thứ hai — điều đáng lẽ phải quyết định xem bạn có bận tâm hay không — là trên bài đánh giá này, Argon bị Claude Opus 5.5 áp đảo hoàn toàn. Opus 5.5 đạt điểm cao hơn (62,3% so với 55,0%) và tốn ít chi phí hơn cho mỗi lần thử nghiệm (98,87 đô la so với 129,36 đô la). Ở đây không có tiêu chí nào mà Argon giành phần thắng. Lợi thế duy nhất của nó là thời gian: 10,6 giờ so với 14,2 giờ của Opus 5.5, điều này thực sự có ý nghĩa nếu bạn trả tiền theo thời gian thực và không trả theo token, còn không thì chẳng liên quan gì nếu bạn trả tiền theo ngân sách cho mỗi lần thử nghiệm.

Bảng xếp hạng của chính Proximal có một chú thích cho dòng của Argon mà mọi người trích dẫn con số này đều nên nhắc lại: “Gemini 4 Argon: Tỷ lệ cache hit thấp hơn nhiều do một thiết lập phi sản xuất.” Đó là việc những người đánh giá nêu rõ rằng họ đã chạy Argon ngoài cấu hình mà một triển khai sản xuất sẽ sử dụng, điều này làm thổi phồng chi phí của nó và có khả năng cả độ trễ. Đây là một lưu ý dành riêng cho con số chi phí, và là lý do $129.36 nên được hiểu là giới hạn trên thay vì một bảng giá.

Con số mà biểu đồ của chính Google không hiển thị

Đây là chỗ mà việc tìm nguồn trở nên thực sự thú vị, và cũng là chỗ mà hầu hết các bài viết về kết quả này sẽ sai. Bài đăng công bố của Google có một biểu đồ benchmark với một hàng FrontierSWE v2. Hàng đó ghi GPT-6 Astra 65.5%, Claude Fable 5.1 56.3%, Claude Opus 5.5 62.3%. Gemini 4 Argon không có trong đó. Bảng xếp hạng trực tiếp của Proximal có Astra ở 65.5% và Opus 5.5 ở 62.3% — cùng những con số — nhưng đặt Claude Fable 5.1 ở 56.5%, không phải 56.3%, và liệt kê Gemini 4 Argon ở 55.0%.

Lý do cho việc bỏ sót này không có gì bí ẩn, và chính Google nói như vậy: các ghi chú phương pháp luận đi kèm bộ đánh giá của họ nêu rằng kết quả FrontierSWE được báo cáo từ bảng xếp hạng công khai chính thức của Proximal. Google không tự tính toán benchmark này. Họ đang trích dẫn cùng một bên thứ ba mà chúng ta đang trích dẫn, và con số Argon duy nhất mà bên thứ ba đó công bố là 55,0%. Vậy nên cách hiểu trung thực là điểm FrontierSWE của Argon là một phép đo thực sự độc lập — Proximal đã chạy nó, trên harness của họ, trên các tác vụ của họ — và rằng nó đặt Argon xếp sau hai đối thủ cạnh tranh.

Mọi thứ khác trong biểu đồ của Google đều là do nhà cung cấp tự báo cáo và trong đầu bạn nên được gắn nhãn như vậy: Argon 63,1% trên Vals Index so với 67,0% của Opus 5.5, 41,4% AutomationBench so với 42,5% của Opus 5.5, 89,6% Vibe Code Bench so với 90,3% cho cả Astra và Opus 5.5, 87,5% LVBench so với 83,7%, 68,0% CWE-bench v1 so với 67,0% của Opus 5.5. Đó là các lần chạy của Google trên những đánh giá do Google lựa chọn. Dòng FrontierSWE là dòng duy nhất trong bức hình đó mà người đọc có thể tự kiểm chứng độc lập, và chính vì thế mà thành tích đứng thứ ba có sức nặng hơn kiểu hòa hoặc thắng nhỉnh xung quanh nó.

Artificial Analysis nói gì, một cách độc lập

FrontierSWE là một lăng kính. Artificial Analysis là lăng kính còn lại, và nó đồng tình với hình dạng của câu chuyện. Trên Intelligence Index v4.3.2 của họ, Gemini 4 Argon ở cấu hình suy luận cao đạt 52,56 — được đo độc lập trên phần cứng của riêng họ, không phải do Google báo cáo — với giá niêm yết là 2,00 đô la cho mỗi triệu token đầu vào và 10,00 đô la cho mỗi triệu token đầu ra, cùng mức chiết khấu 95% cho đầu vào được lưu trong bộ nhớ đệm. Công cụ đo lường của họ ước tính chi phí cho một tác vụ chỉ số là 1,99 đô la.

Phép so sánh đáng quan tâm chính là phép so sánh mà FrontierSWE đưa ra. Claude Opus 5.5 ở cấu hình cao của nó đạt điểm cao hơn trên chỉ số, 53.58, với chi phí trên mỗi tác vụ thấp hơn, $1.82. Hai đơn vị đánh giá độc lập, sử dụng các tác vụ và bộ khung đánh giá khác nhau, đều xếp Argon sau Opus 5.5 về cả chất lượng lẫn chi phí. Đó là một tín hiệu nhất quán chứ không phải một dị thường đơn lẻ từ việc đo lường hiệu năng, và đó là điều mạnh mẽ nhất mà hiện tại bạn có thể nói về khía cạnh kinh tế của Gemini 4 Argon.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

Đã công bố, chưa phát hành — và tại sao cách diễn đạt đó không phải là chuyện câu nệ chữ nghĩa

Không có model ID Gemini 4 Argon. Quyền truy cập đang được triển khai dần thông qua Fairwind Program cho các chuyên gia phòng thủ mạng đã được thẩm định, song song với việc mở dần cho khách hàng API trả phí và người đăng ký Google AI Ultra, mà không có ngày phát hành rộng rãi nào được công bố. Bài đăng của Google là thông báo về một mô hình và một loạt đánh giá, không phải ra mắt một endpoint mà bạn có thể gọi. Nếu bạn đã đọc bài viết mô tả đây là một bản phát hành, thì bài viết đó đang đi trước sự thật.

Sự phân biệt đó có những hệ quả thực tiễn đối với bất kỳ ai đọc con số FrontierSWE. Đánh giá được chạy trên một mô hình mà Proximal được tiếp cận theo một thỏa thuận nào đó; nó cho bạn biết mô hình có thể làm gì, chứ không phải bạn có thể có được gì. Điều đó cũng có nghĩa là các con số hiệu năng có thời gian bán rã ngắn hơn thường lệ. Một mô hình chưa GA vẫn có thể thay đổi — thiết lập giải mã, system prompt, mặc định dùng công cụ và lớp bảo đảm an toàn đều vẫn đang được tinh chỉnh, và lý do được nêu cho việc tỷ lệ cache hit của Argon thấp chính là những người đánh giá không chạy cấu hình production. Hãy kỳ vọng 55.0% và $129.36 sẽ thay đổi.

Điều gì sẽ thay đổi bức tranh này: một ID mô hình được công bố kèm bảng giá, một ngày GA, một lần chạy lại FrontierSWE theo thiết lập production, và một đơn vị đánh giá độc lập thứ hai tái lập kết quả vị trí thứ ba. Cho đến khi ít nhất hai trong số những điều đó tồn tại, hãy coi mọi con số Argon — kể cả những con số đẹp trong chính biểu đồ của Google — là tạm thời.

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

Phần đọc tính cách là phần sẽ trường tồn nhất theo thời gian

Điểm benchmark cho một mô hình tiền GA có hạn sử dụng tính bằng tuần. Quan sát hành vi thì không. Công việc agent tầm xa là nơi tính cách mô hình thực sự lộ diện, vì ngân sách hai mươi giờ với 34 tác vụ là đủ dư địa để các khuynh hướng của mô hình cộng dồn: cách nó phục hồi sau một hướng tiếp cận thất bại, liệu nó có dừng lại để lập kế hoạch lại hay không, liệu nó có phân biệt được giữa một vấn đề khó và một hướng đi sai hay không. Một người đánh giá xem rất nhiều dấu vết này và mô tả một mô hình là tự phê bình và hay thốt lên khi có gì đó hiệu quả thì đang mô tả một mô hình bộc lộ lập luận về tiến độ của chính nó ra bên ngoài. Đó là một giả thuyết về lý do các lần chạy của Argon trải rộng từ 44.5% đến 64.3% — một dải rộng hơn so với Opus 5.5 — và có thể kiểm chứng được một khi mô hình có thể được gọi.

Nửa còn lại của nhận xét mới là phần đáng hoài nghi. "Một cải thiện lớn so với các Geminis trước đây" là sự so sánh với những mô hình chưa từng được chấm điểm trên benchmark này theo harness này, nên hoàn toàn không thể đối chiếu với bảng xếp hạng. Đó là một ấn tượng, và cần được xem như một ấn tượng, cho dù người đưa ra nó có đáng tin cậy đến đâu.

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

Điều này đặt bạn vào vị thế nào nếu hôm nay bạn thực sự cần một agent tầm xa

Bạn không thể gọi Gemini 4 là Argon, vì vậy câu hỏi thực tế không phải là Argon so với bất cứ thứ gì — mà là bạn nên chạy mô hình nào cho công việc mà Argon được đánh giá. Thứ tự xếp hạng của chính FrontierSWE trả lời điều đó: GPT-6 Astra đứng đầu bảng với 65,5% nhưng với $1.029,65 mỗi lần thử, gấp khoảng mười lần chi phí của hai mô hình bên dưới, trong khi Claude Opus 5.5 đạt 62,3% với $98,87. Lựa chọn đáng giá nhất trên benchmark này là Opus 5.5, và đây cũng chính là mô hình đã đánh bại Argon trên Artificial Analysis với chi phí mỗi tác vụ thấp hơn.

Cả hai mô hình đó, cùng phần lớn top 10 trên bảng xếp hạng — trong đó có GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp và Muse Spark 1.2 — đều có thể định tuyến qua API duy nhất của OrcaRouter cùng hơn 200 mô hình khác — một khóa duy nhất, 0% phụ thu, nên giá niêm yết của nhà cung cấp chính là mức bạn trả và mọi đợt giảm giá từ nhà cung cấp đều được áp dụng ngay phía chúng tôi trong cùng ngày. Đặc tính cuối cùng đó có giá trị hơn mức thông thường đối với một mô hình tiền GA: nếu giá của Argon thay đổi từ giờ đến GA — điều mà chú thích về bộ nhớ đệm phi sản xuất gợi ý là có thể xảy ra — thì khi điều đó xảy ra, không có gì trong tích hợp của bạn phải thay đổi. Chuyển đổi dự phòng tự động là mảnh ghép còn lại phù hợp với trường hợp cụ thể này — một mô hình xa lạ mà chưa ai lập bản đồ các kiểu lỗi của nó chính là thứ bạn tuyệt đối không muốn đặt trên một đường dẫn sản xuất duy nhất được mã hóa cứng.

Để nói rõ một điều: Gemini 4 Argon không có trong danh mục của chúng tôi. Tra cứu trên API mô hình công khai của chúng tôi cho google/gemini-4-argon trả về "model not found", và cũng không ai khác lưu trữ nó — nó nằm sau Fairwind Program của Google mà không có ID mô hình nào được công bố. Khi nó có thể được gọi, chúng tôi sẽ định tuyến nó, và các số liệu FrontierSWE ở trên là lý do để theo dõi ngày đó thay vì chờ đợi nó. Những mô hình mà nó đã thua đều đã có mặt ở đó.

Xem gì

Những tín hiệu có thể biến điều này từ một câu chuyện "những gì chúng ta biết đến nay" thành một quyết định thì rất cụ thể. Một ID mô hình được công bố cùng bảng giá của nó. Một ngày phát hành chính thức. Một lần chạy lại FrontierSWE dưới các thiết lập production, điều này sẽ giải quyết được liệu mức chi phí $129.36 mỗi lần thử là mức giá thực hay chỉ là hệ quả của cấu hình cache mà Proximal đã chỉ ra. Và, lý tưởng nhất, một đơn vị đánh giá thứ hai công bố các dấu vết Argon để quan sát "Eureka!" không còn là một mẫu đơn lẻ.

Cho đến lúc đó, bản tóm tắt trung thực còn hẹp và đáng để giữ lại: Gemini 4 Argon đã được công bố; theo một đơn vị đánh giá, nó có khả năng diễn đạt bất thường trong các dấu vết agent tầm xa; và trên bài kiểm chuẩn độc lập duy nhất mà chúng ta có thể kiểm chứng, nó đứng thứ ba sau hai mô hình — một trong số đó đồng thời đánh bại nó về điểm số lẫn chi phí.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày