Thẻ tiêu đề hero ghi "Gemini 4 Argon — nấc nào của thang Gemini 4?", cùng một thang dọc gồm năm nấc xếp hạng liệt kê Claude Opus 5.5 ở 57.6, Gemini 4 Argon ở 52.6, GPT-6 Astra ở 52.7, Gemini 3.8 Flash ở 40.9 và Gemini 3.1 Pro Preview ở 29.7, một huy hiệu ghi "Không có Gemini 4 Ultra — trang Ultra chuyển hướng đến một gói đăng ký", và một dòng chân trang ghi "Các chỉ số Index theo Artificial Analysis, bản sửa đổi v4.3.2; Argon không thể gọi trên bất kỳ API công khai nào."
Guides & Insights

Nấc Argon của Gemini 4 trong Thang Gemini 4 — và vì sao không có G4 Ultra

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Câu trả lời ngắn gọn cho câu hỏi đã khởi nguồn cho bài viết này là Gemini 4 Argon là mô hình hàng đầu của Goog​le chứ không phải hạng cao nhất của hãng, bởi vì hạng cao hơn nó vẫn chưa tồn tại — và có thể còn không tồn tại dưới dạng mà bất kỳ ai đang mong đợi. Goog​le đã công bố đúng một mô hình Gemini 4, Argon, và trang chính chủ duy nhất trên tên miền của chính hãng nằm dưới đường dẫn /models/gemini/ultra/ hoàn toàn không phải là một trang mô hình: nó chuyển hướng đến các gói đăng ký Goog​le AI. Việc chuyển hướng đó là sự thật hữu ích nhất trong bài viết này, và có thể kiểm tra chỉ với một dòng lệnh từ terminal. Mọi thứ còn lại ở đây nói về việc Argon thực sự nằm ở đâu một khi bạn ngừng đọc mức giá của nó như một nhãn hạng và bắt đầu đọc nó như một con số.

Hai điều cùng đúng một lúc và chúng rất dễ bị nhầm lẫn. Argon là G​emini có năng lực nhất đang tồn tại, và Argon không phải là một mô hình thuộc tầng tiên phong. Nó dẫn đầu mọi mô hình G​oogle đã phát hành, với khoảng cách đủ lớn đến mức việc so sánh không còn thực sự là so sánh nữa, và nó đạt mức điểm trên Artificial Analysis’s Intelligence Index chỉ cách hai mô hình chủ lực đang cạnh tranh một phần nhỏ của một điểm, trong khi bản thân hai mô hình đó lại kém người dẫn đầu hiện tại trọn năm điểm. G​oogle định giá nó như thể nó nằm dưới tầng tiên phong một bậc, và phép đo độc lập cũng đồng tình. Vậy nên mức giá đó không phải là một quyết định marketing nhằm hạ thấp mô hình. Đó là một phát biểu chính xác về mô hình.

Đây là bài viết tổng hợp những gì chúng ta đã biết tính đến thời điểm này. Gemini 4 Argon được công bố vào ngày 2026-09-30 trong một bài đăng của Google DeepMind ghi công cho Koray Kavukcuoglu, và nó đang được triển khai trước tiên cho một nhóm chuyên gia phòng thủ không gian mạng được nêu tên cụ thể thông qua Chương trình Fairwind của Google — không dành cho nhà phát triển, không dành cho doanh nghiệp, không dành cho người tiêu dùng và không dành cho bất kỳ ai sở hữu thẻ tín dụng. Nó không có ID mô hình trong Gemini API, không có endpoint và không có giá trên mỗi token được công bố để bạn có thể bị tính phí. Các mã định danh mô hình, thông lượng và độ tin cậy đo trên lưu lượng thực không tồn tại đối với nó, nghĩa là phép đo bên dưới chỉ là một lần chạy benchmark của một phòng thí nghiệm và không hơn thế. Khi một con số đến từ Google, nó được ghi nhãn là của Google; khi nó đến từ Artificial Analysis, nó được ghi nhãn là của họ. Không có gì ở đây nên được hiểu là một tuyên bố rằng Argon là một sản phẩm có thể mua được.

Chiếc thang mà Google thực sự đã tung ra, đọc từ chính các trang của họ

Cách nhanh nhất để trả lời “Argon nằm ở đâu trong dòng sản phẩm Gemini 4” là ngừng hỏi về dòng sản phẩm và bắt đầu liệt kê những mẫu mà Google xuất bản trang cho. Dòng sản phẩm là một khái niệm tiếp thị; một trang là một sự thật. Đây là những gì các đường dẫn first-party phân giải thành tính đến ngày 1 tháng 10 năm 2026.

• deepmind.google/models/gemini/pro/ trả về mã 200 và tiêu đề của nó là “Gemini 3.1 Pro — Google DeepMind”. Vị trí Pro trên trang web của chính Google vẫn là một mô hình thuộc thế hệ 3.1.

• deepmind.google/models/gemini/flash/trả về 200 và tiêu đề của nó là “Gemini 3.8 Flash — Google DeepMind”. Vị trí Flash đã thay đổi ba lần — 3.5, 3.6, 3.7, 3.8 — trong khi vị trí Pro không hề thay đổi chút nào.

• deepmind.google/models/gemini/argon/ trả về lỗi 404. Argon không có đường dẫn riêng cho từng mô hình. "Nhà" của nó là trang về dòng mô hình tại deepmind.google/models/gemini/, nơi Google đặt mô hình mà họ đang dẫn đầu hiện nay.

• deepmind.google/models/gemini/ultra/ trả về mã 302 và dẫn đến one.google.com/about/google-ai-plans/, trang đăng ký dành cho người tiêu dùng. Điều tương tự cũng đúng với đường dẫn cũ hơn deepmind.google/technologies/gemini/ultra/. “Ultra” trên đường dẫn mô hình của Google là một bậc thanh toán, không phải một checkpoint.

• deepmind.google/models/gemini/nano/trả về 301 dẫn đến trang dòng Gemini. Cũng không có vị trí Nano nào là một trang mô hình độc lập.

• deepmind.google/models/gemini/model-cards/ — chỉ mục mà Google duy trì về mọi thẻ mô hình mà họ đã công bố — không có mục nào cho Argon và không có mục nào có “Gemini 4” trong tên. Các dòng Gemini mới nhất của nó là 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite và 3.1 Pro. Chỉ mục thẻ mô hình là tài liệu thay đổi chậm nhất trong bộ này, nên việc nó im lặng không phải bằng chứng rằng Argon sẽ không bao giờ có thẻ mô hình; đó là bằng chứng rằng giấy tờ vẫn chưa theo kịp thông báo.

• deepmind.google/models/, danh mục mô hình, liệt kê “Gemini 4 Argon” là thẻ hàng đầu với dòng giới thiệu “Kỷ nguyên tiếp theo của trí tuệ tiên phong của chúng tôi”, ngay phía trên “Gemini 3.8 Flash — Tốt nhất để xử lý các tác vụ agentic phức tạp ở quy mô lớn”. Hai thẻ Gemini, cách nhau một thế hệ, theo đúng thứ tự đó.

Ghép những điều đó lại, hình dạng của chiếc thang không hề mơ hồ. Bề mặt mô hình công khai của Google hiện có một mục ở nấc Gemini 4, một mục ở nấc Gemini 3.8, một nấc Pro cũ kỹ đã lùi lại ba thế hệ rưỡi, và không có gì phía trên bất kỳ nấc nào trong số đó. Từ “Ultra” trên tên miền của Google thực chất chỉ dẫn tới một gói đăng ký. Không có trang Gemini 4 Pro, không có trang Gemini 4 Flash, không có trang Gemini 4 Ultra, và không có thẻ mô hình Gemini 4. Google đã công bố một mô hình, chứ không phải một dòng mô hình.

Có Gemini 4 Ultra không? Bằng chứng, và điều gì sẽ bác bỏ nó

Điều này xứng đáng có một mục riêng vì đây là phần của câu hỏi mà trong một tuần nữa rất có thể sẽ được trả lời theo cách khác, và vì câu trả lời trung thực chỉ có giá trị trong một thời gian nhất định.

Bằng chứng tiêu cực ở đây mang tính cụ thể chứ không mơ hồ. Một mã 302 trên đường dẫn Ultra tới trang gói đăng ký không phải là một tín hiệu yếu; đó là một chuyển hướng do chính đội ngũ web của Google cấu hình. Nhiều blog.google mẫu URL cho một bài đăng về Gemini 4 Ultra đều trả về 404 — đường dẫn products, đường dẫn innovation-and-ai models-and-research, và đường dẫn thông báo thông thường. Việc đặt tên Ultra ở đây có tiền lệ, và tiền lệ đó chống lại một Gemini 4 Ultra. Thông báo Gemini ban đầu của Google đã giới thiệu Gemini 1.0 “được tối ưu hóa cho ba kích cỡ khác nhau: Ultra, Pro và Nano”, với Gemini Ultra được mô tả là “mô hình lớn nhất và mạnh mẽ nhất của chúng tôi”. Một bài đăng ra mắt nêu tên ba kích cỡ chính là dáng vẻ của một thông báo về cả một dòng sản phẩm. Bài đăng của Argon chỉ nêu tên một mô hình và không có bất kỳ “anh em” nào. Sau đó Google đã khai tử tên mô hình Ultra để chuyển sang các bậc số, và đưa từ này sang phía dịch vụ đăng ký của hoạt động kinh doanh, nơi nó hiện đặt tên cho gói dành cho người tiêu dùng cao cấp nhất. Một trang mô hình chuyển hướng tới trang gói đăng ký chính là dáng vẻ của một cái tên mô hình đã bị khai tử khi trang marketing xung quanh nó đã được dọn dẹp.

Thông báo cũng không có gì hứa hẹn về một phiên bản anh em lớn hơn. Bài đăng ra mắt Argon mô tả Argon là “mô hình tiên phong mới của chúng tôi” và mô tả việc triển khai theo từng giai đoạn, công tác bảo vệ an toàn cùng các đợt triển khai nội bộ, rồi dừng lại. Bài viết không nói “đầu tiên trong gia đình Gemini 4”, không hé lộ trước một bản Pro hay Ultra, và không nêu tên một sản phẩm kế nhiệm. Cách định vị của chính Google coi Argon là nhân vật chính, chứ không phải là bản nhỏ.

Điều gì sẽ phủ định kết luận thì dễ nói ra và đáng để theo dõi, bởi vì bất kỳ một trong những điều này sẽ lật ngược nó chỉ trong một ngày.

• Một mã 200 trên deepmind.google/models/gemini/ultra/ mà hiển thị trang mô hình thay vì trang gói, hoặc một đường dẫn con models/gemini/ mới xuất hiện cùng với pro và flash.

• Một dòng Gemini 4 Ultra xuất hiện trên trang chỉ mục thẻ mô hình — đây vốn là cách Google từ trước đến nay xác nhận một mô hình tồn tại như một hiện vật được ghi nhận trong tài liệu.

• Một ID mô hình thứ hai trong API Gemini thuộc không gian tên gemini-4-*. Hiện tại Argon chưa có mô hình nào như vậy, nên một ID Pro hoặc Ultra sẽ là bằng chứng đầu tiên cho thấy dòng mô hình này là có thật.

• Một mục trong danh sách mô hình của Artificial Analysis, hoặc một bảng benchmark trên trang dòng mô hình với cột thứ tư. Cả hai đều theo dõi các bản phát hành của Google đủ sát để có được thông tin sớm.

• Một bài đăng thông báo của Google I/O, Cloud Next hoặc DeepMind có sử dụng từ “family” khi nói về Gemini 4. Bài đăng của Argon thì không.

Cho đến khi ít nhất một trong những điều đó xảy ra, một bài viết khẳng định Gemini 4 Ultra sắp ra mắt chỉ là một dự đoán khoác lốt một bản báo cáo. Hãy đối xử với nó đúng như vậy, kể cả khi nó đến từ chúng tôi.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Đọc thang giá như một tuyên bố về phân hạng

Giá cả là phần duy nhất trong số này mà Google công bố một cách có chủ đích, kèm theo một chú thích, và đó là tuyên bố rõ ràng nhất về ý định phân hạng trong toàn bộ đợt ra mắt. Giá giới thiệu của Argon là 2 đô la cho mỗi triệu token đầu vào và 10 đô la cho mỗi triệu token đầu ra, với đầu vào đã lưu đệm được giảm 95%, và chú thích số một của chính Google nói rằng sau một giai đoạn giới thiệu mà họ không thể định nghĩa, “mức giá 4 đô la cho 1 triệu token đầu vào và 20 đô la cho 1 triệu token đầu ra sẽ được áp dụng.”

Cứ đối chiếu hai cặp đó với cả đấu trường, thì tuyên bố về phân hạng tự nó đã rõ rành rành.

• 4 / 20 đô-la là giá niêm yết của Claude Opus 5.5. Mức giá sau giai đoạn giới thiệu của Google dành cho Argon lại rơi đúng vào bảng giá của mô hình dẫn đầu hiện tại, đối với một mô hình kém nó năm điểm.

• $2 / $10 là dải khuyến mại mà cả GPT-6 Sol và Claude Sonnet 5.5 đều cùng nằm trong. Mức giá giới thiệu của Argon cũng là $2 / $10, khiến giá ra mắt của Argon nằm cùng dải với một Sol tầm trung thay vì ở dải tiên phong.

• $10 / $50 là mức mà cả Claude Fable 5.1 và GPT-6 Astra đều đang ở. Argon bằng một phần năm giá đầu vào của Fable 5.1 và bằng một phần năm giá đầu ra của nó, đồng thời điểm số của nó chỉ cách Fable 5.1 0,8 điểm.

• $0.75 / $3.75 là Gemini 3.8 Flash. Argon cao gấp 2,7 lần mức đó ở đầu vào và gấp 2,7 lần ở đầu ra — một bước nâng nhẹ nhàng, chứ không phải một vực thẳm.

Vậy là Google đã định giá Argon như một mô hình thuộc nhóm dưới $10/$50 và trên $0.75/$3.75, với điểm dừng cuối cùng là $4/$20. Không có gì trong thang giá đó nói lên “tiên phong”. Nó nói lên “đỉnh của dải giá trung, với một con số chủ đạo sẽ ổn định ở mức mà đơn vị dẫn đầu đang thu hiện nay, đổi lấy năng lực thấp hơn.” Đó là một lựa chọn thương mại có thể biện minh được. Đó không phải là cách định giá của một mô hình được xếp cao hơn mọi thứ hai bậc.

Một điểm cấu trúc đáng lưu tâm: bước giá của Argon là một bước thực sự, được định nghĩa trong một chú thích, và không ghi ngày. Các dòng Sonnet 5.5 và GPT-6 làm điều tương tự với các bậc ngữ cảnh dài, và Sol tăng lên $4/$15 sau 272K. Bước giá của Argon tính theo thời gian, không theo độ dài ngữ cảnh — mức $2/$10 vẫn áp dụng trên toàn bộ cửa sổ 1M và chỉ có lịch mới thay đổi mức giá. Đó là một cấu trúc bất thường và khiến mọi so sánh chi phí với Argon trở thành bài tập hai cột: phiên bản nào, và mức sử dụng nào.

Argon đứng ở đâu so với các đối thủ, dựa trên những con số hiện có

Artificial Analysis đã công bố phép đo về Gemini 4 Argon đủ nhanh đến mức đây là kết quả đánh giá độc lập duy nhất hiện có. Ở bản sửa đổi hiện hành ngày 1 tháng 10 — v4.3.2 — Argon đạt 52.56 trên Intelligence Index, được cấu hình ở mức nỗ lực suy luận cao. Các mô hình xung quanh nó không phải là một mẫu ngẫu nhiên của lĩnh vực.

• Claude Opus 5.5 đạt 57,62, được đo ở mức nỗ lực tối đa với fallback. Con số đó cao hơn Argon hơn năm điểm một chút, và đây hiện là vị trí dẫn đầu bảng.

• Claude Fable 5.1 đạt 53,35, được đo ở mức nỗ lực tối đa với cơ chế dự phòng. Argon kém nó 0,79.

• GPT-6 Astra ở mức 52.67, được đo ở mức tối đa. Argon kém 0.11.

• Claude Sonnet 5.5 đạt 55.98, cũng là mức tối đa với fallback. Đó là một mô hình tầm trung có điểm cao hơn Argon 3.4 điểm, và đây là con số đáng khiến bất kỳ ai đang viện đến câu “Gemini 4 Argon là mô hình tốt thứ hai trên thế giới” phải lo ngại.

• GPT-6 Sol đạt 47.63, đo ở mức tối đa, trên cửa sổ ngữ cảnh 872K. Argon dẫn trước nó 4.9.

• Gemini 3.8 Flash đạt 40.93 ở mức effort cao. Argon dẫn trước nó 11.6.

• Gemini 3.1 Pro Preview ở mức 29,72. Argon dẫn trước nó 22,8 điểm, và đó là lời khẳng định rõ ràng nhất cho thấy dòng Pro mà Google đang phát hành đã tụt lại xa đến mức nào so với chính nghiên cứu của họ.

Ba điều rút ra từ danh sách đó. Thứ nhất, Argon ngang bằng với hai đối thủ thách thức, Fable 5.1 và Astra, và rõ ràng đứng sau hai mô hình của Anthropic — Opus 5.5 và, một cách khó xử hơn, Sonnet 5.5. Thứ hai, khoảng cách giữa Argon và mô hình tốt nhất đã phát hành của chính Google là bước nhảy thế hệ lớn nhất trong đội hình hiện tại, xét một cách rõ rệt. Thứ ba, cách diễn đạt của tín hiệu rằng “biên giới ít nhất đi trước hai bậc” là đúng về bản chất nhưng hơi lệch về hình học: có một bậc mô hình rõ ràng đi trước Argon (Opus 5.5 ở 57.6) và một mô hình thứ hai ở bậc rẻ hơn cũng đi trước nó (Sonnet 5.5 ở 56.0), đây là một vấn đề nhức nhối hơn so với việc bị tụt hai bậc trên một chiếc thang mà Argon thực sự đang ở trên đó.

Cách đặt vấn đề so sánh giá trong câu hỏi gốc — “mức giá cho thấy đây là bản tương đương Sol/Sonnet của họ” — hóa ra đại khái đúng ở giá ra mắt và sai ở giá sau cùng. Argon khởi đầu ở mức giá của Sol và Sonnet 5.5 và chốt lại ở mức của Opus 5.5. Nó được định giá như một mẫu tầm trung toan trở thành mẫu giá hàng đầu, trong khi đo hiệu năng thì chẳng đạt mức nào trong hai.

Bức tranh chi phí trên mỗi tác vụ là nơi Argon mạnh nhất và cũng là nơi câu chuyện về các phân hạng có thêm một chiều thứ hai. Ở tác vụ Index, Argon tốn 1,99 đô la và tạo ra 142.374 token đầu ra. Opus 5.5 tốn 5,98 đô la và tạo ra 338.099. Sonnet 5.5 tốn 7,62 đô la cho 599.849. Fable 5.1 tốn 7,63 đô la cho 187.455. Astra tốn 3,26 đô la cho 68.691. Gemini 3.8 Flash tốn 1,24 đô la cho 154.230. Argon là cách rẻ nhất để mua một điểm số cận tiên phong, và nó rẻ hơn mô hình Flash xếp trên nó về điểm số chưa đến một đô la mỗi tác vụ.

Cài đặt effort là dấu hoa thị cho tất cả những điều trên và lĩnh vực này không báo cáo chúng một cách đồng nhất. Argon được đo ở mức high; Opus 5.5 và Fable 5.1 và Sonnet 5.5 ở mức max với fallback; Astra và ở mức max. Một lần chạy ở effort cao và một lần chạy ở effort tối đa không phải là cùng một phép đo, và thang effort của chính Anthropic dịch chuyển một mô hình vài điểm giữa các cài đặt. Nếu Argon ở effort tối đa đạt điểm cao hơn đáng kể so với 52.6, lập luận về tier sẽ thay đổi. Chưa ai công bố lần chạy đó.

Bảng của chính Google tuyên bố điều gì và nó khác với bảng độc lập như thế nào

Trang về dòng Gemini có một bảng hiệu năng do Google biên soạn gồm bốn cột — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — và mười chín hàng benchmark. Đây là tập hợp tuyên bố chi tiết nhất mà Google đã công bố cho mô hình này, và toàn bộ đều do nhà cung cấp tự báo cáo. Đọc nó đối chiếu với Chỉ số độc lập là hữu ích chính vì hai bên không đồng thuận về hình dạng của lĩnh vực.

• Trong bảng của Google, Argon thắng dứt khoát mười ba trong số mười chín hàng hoặc đồng hạng nhất, bao gồm Vals Index Knowledge work ở 68,9, AutomationBench ở 51,3, Harvey’s Legal Agent Benchmark ở 19,6, DeepSWE v1.1 ở 77,9, LABBench 2 ở 88,8, GraphWalks ở 99,7 cho dải ≤128K và 84,2 cho dải 256K–1M, Agent’s Last Exam ở 39,5, LVBench ở 91,7 và Chartography ở 71,6.

• Claude Opus 5.5 thắng ở những dòng thể hiện năng lực kỹ thuật bền bỉ: FrontierSWE v2 đạt 62,3 so với 55,0 của Argon, Terminal-bench 4.0 đạt 66,4 so với 57,4, Terminal-Bench Science 0.1 đạt 63,3 so với 57,6, và PostTrainBench đạt 49,3 so với 45,3.

• GPT-6 Astra đạt 68,1 ở Terminal-Bench Science 0.1 và 72,6 ở tập con ngoại tuyến của OSWorld-2.0, đồng thời hòa với Argon trên CWE-bench v1 ở mức 68,0. Claude Fable 5.1 thua ở mọi dòng, ngoại trừ một kết quả đồng hạng trên Vibe Code Bench.

• Trên Index độc lập, thứ tự là Opus 5.5 đứng đầu, rồi Sonnet 5.5, rồi Fable 5.1, rồi Argon và Astra thực tế ngang nhau. Bảng của Google hoàn toàn không có cột Sonnet 5.5, và đây là thiếu sót hệ trọng nhất trong đó: bốn cột của bảng đều đã được chọn, còn mô hình xếp trên Argon trên Index với mức giá thấp hơn lại không nằm trong số đó.

Không điều nào trong số đó khiến bảng của Google trở nên thiếu trung thực. Các bảng đánh giá của nhà cung cấp là được chọn lọc, chứ không phải lấy mẫu, và bảng của bất kỳ phòng thí nghiệm nào cũng vậy. Điều đó biến nó thành một lời khẳng định thay vì một phép đo, và có nghĩa là câu hỏi về phân hạng không thể được giải quyết chỉ dựa vào nó. Chỗ duy nhất mà bảng này thực sự giữ vai trò trụ cột cho bài viết này là ở khía cạnh phủ định: mười chín hàng, bốn cột, và không có cột thứ năm nào dành cho một mẫu Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

Điều duy nhất về Argon hoàn toàn không phải là câu hỏi về tier.

Mọi lập luận về tầng ở trên đều giả định rằng Argon là một mô hình mà cuối cùng bạn có thể gọi được. Đáng để tách điều đó ra khỏi câu hỏi về định vị, bởi vì hai điều này có câu trả lời khác nhau và chỉ một trong số đó là về năng lực.

Giới hạn token đầu ra của Argon là 1 triệu token, tăng từ 64K, và Google nói thẳng điều đó. Đó là mức trần đầu ra, không phải cửa sổ ngữ cảnh. Sự phân biệt này quan trọng vì hai thứ này liên tục bị đánh đồng trong các bài đưa tin về lần ra mắt này, và vì giới hạn đầu ra 1M là một khẳng định kỹ thuật khác với cửa sổ ngữ cảnh 1M — cái đầu tiên nói về việc một quỹ đạo đơn lẻ có thể chạy dài bao lâu, cái thứ hai nói về việc bạn có thể đưa cho mô hình bao nhiêu cùng một lúc. Google đã nói rõ ràng về giới hạn đầu ra và im lặng về cửa sổ ngữ cảnh. Artificial Analysis cũng ghi nhận 1.000.000 token cho ngữ cảnh của Argon, nhưng đó là trường dữ liệu của công cụ theo dõi chứ không phải tuyên bố của Google, nên hãy coi hai con số này đến từ những nơi khác nhau dù chúng trông giống hệt nhau.

Điều không thể có được một cách rõ ràng chính là quyền truy cập. Argon không được cung cấp rộng rãi, nó không có mặt trong API Gemini dưới bất kỳ định danh nào, và nó không có trên bất kỳ danh mục của bên thứ ba nào. Nó chỉ khả dụng cho các chuyên gia phòng thủ mạng đã qua thẩm định thông qua Chương trình Fairwind và cho chính các kỹ sư của Google, còn giai đoạn tiếp theo mà Google nêu tên — "bắt đầu với khách hàng API trả phí và người đăng ký Google AI Ultra" — thì chưa gắn với mốc thời gian nào. Bạn không thể đánh giá hiệu năng của nó trên khối lượng công việc của riêng mình. Do đó, mọi con số trong bài viết này đều là kết quả đo lường của người khác đối với một mô hình mà bạn không thể sử dụng.

Điều gì sẽ đưa Argon lên một bậc?

Đánh giá theo bậc chỉ là một ảnh chụp nhanh, và có khoảng năm điều có thể thay đổi đánh giá này, theo thứ tự tương đối về mức độ quan trọng của chúng.

• Một lần chạy ở mức nỗ lực tối đa được đo độc lập. Argon hiện là một phép đo ở mức nỗ lực cao đạt 52,56. Các thang nỗ lực của chính Anthropic dịch chuyển một mô hình vài điểm giữa các cài đặt, và nếu mô hình của Google cũng hành xử tương tự ở mức tối đa, thì vị trí thực sự của Argon so với Fable 5.1 và Astra sẽ tốt hơn những gì bài viết này nói. Đây là thay đổi đơn lẻ có khả năng xảy ra nhất.

• Một nguồn đo lường thứ hai. Một tracker chỉ là một phép đo. Một phòng thí nghiệm độc lập thứ hai chấm điểm Argon trên harness riêng của họ sẽ có giá trị hơn cho tuyên bố về phân hạng so với bất kỳ dòng benchmark bổ sung nào từ Google.

• Một Gemini 4 Pro. Nếu Google mở bậc Pro của thế hệ 4 bên dưới Argon, dòng sản phẩm sẽ trở thành một gia đình có hình hài, vị trí của Argon không còn là “kẻ duy nhất” mà bắt đầu là “đỉnh của ba”, và mọi lập luận trong bài này về một gia đình còn thiếu đều cần được viết lại. Đáng để theo dõi, và gần hơn câu hỏi về Ultra.

• Một mức giá không tăng nấc. Nếu giai đoạn giới thiệu đơn giản là không bao giờ hết hạn — Google chưa xác định khi nào nó kết thúc — thì mức giá ổn định thực tế của Argon là 2/10 đô la thay vì 4/20 đô la, và lợi thế chi phí trên mỗi tác vụ của nó so với Opus 5.5 mở rộng từ khoảng 3× lên khoảng 6×. Đó là một sự kiện thương mại, không phải sự kiện về năng lực, nhưng nó thay đổi diện mạo của một quyết định thu mua.

• Một thẻ mô hình Argon, thẻ hệ thống hoặc trang phương pháp đánh giá. Bảng hiệu năng liên kết đến một trang phương pháp trên tên miền của Google; một thẻ mô hình đầy đủ sẽ ghi cửa sổ ngữ cảnh, cấu hình triển khai và phạm vi an toàn vào hồ sơ, đồng thời sẽ là tài liệu đầu tiên cho phép người ngoài nhóm Fairwind kiểm chứng các con số của Google thay vì chỉ đọc chúng.

Ngược lại, thứ có khả năng khiến Argon tụt hạng nhiều nhất lại hoàn toàn không phải là một benchmark. Đó là bản đưa tin ngày 30 tháng 9 của Bloomberg, trong đó dẫn lời các nhân viên Google có quyền truy cập vào mô hình nói rằng nó làm việc thực tế kém hơn so với mức điểm số của nó gợi ý. Tuyên bố đó chưa được bất kỳ ai bên ngoài Google xác minh và không phải là một phép đo, nhưng đó là kiểu tuyên bố mà một benchmark độc lập thứ hai sẽ hoặc xác nhận hoặc bác bỏ. Cho đến lúc đó, nó tồn tại trong hồ sơ như một cáo buộc với một cơ quan báo chí được nêu tên và các nguồn tin giấu tên, và nó thuộc vào phần thảo luận xếp hạng bởi vì một mô hình có khoảng cách giữa benchmark và thực tế đang bị tranh cãi thì không thể được nâng hạng chỉ dựa vào các benchmark.

Điều này có nghĩa gì nếu bạn đang chọn một mô hình trong tháng này

Gạt bỏ lập luận về định vị, bức tranh thực tế đủ đơn giản để một đoạn văn có thể bao quát hết. Gemini 4 Argon là Gemini tốt nhất mà Google từng tạo ra và nó không có sẵn cho bạn, nên các mô hình Google mà bạn thực sự có thể chọn giữa chúng ngày hôm nay là những mô hình đã ra mắt: Gemini 3.8 Flash, đạt 40.93 trên Index với mức $0.75/$3.75, và Gemini 3.1 Pro Preview, đạt 29.72 với mức $2/$12. Nếu bạn cần một Gemini ngay bây giờ, đó là lựa chọn thực sự, và Argon không nằm trong đó.

Nếu bạn đang chọn giữa các nhà cung cấp khác nhau thay vì trong hệ sinh thái Google, thì không có gì trong thông báo của Argon làm thay đổi quyết định hôm nay. Đứng đầu Index là Claude Opus 5.5 với 57.62, cùng Claude Sonnet 5.5 ở mức 55.98 bám sát ngay sau, chỉ bằng một phần năm mức giá cho đầu vào và một nửa cho đầu ra. Gemini 4 Argon với 52.56 không có đường vào ứng dụng của bạn, nên nó không phải là ứng viên, cho dù điểm số cuối cùng có tốt đến đâu.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter là một API duy nhất đứng trước hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên, không đánh thêm phí, và tự động chuyển đổi dự phòng giữa các nhà cung cấp, nghĩa là quyết định đổi mô hình không đòi hỏi phải đấu nối lại bất cứ thứ gì: id trong phần thân yêu cầu chính là toàn bộ thay đổi. Các mô hình Google trên danh mục của chúng tôi hiện nay là những mô hình mà Google đã thực sự phát hành — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash và google/gemini-3.1-pro-preview. Gemini 4 Argon không nằm trong số đó và sẽ không như vậy chừng nào nó còn chưa có mã định danh mô hình công khai và chưa có bảng giá được công bố, nên không ai nên đọc bất cứ điều gì ở trên thành một tuyên bố về định tuyến. Khi Google đưa Argon lên một API có ID, thì đó sẽ trở thành một câu hỏi về định tuyến. Cho đến lúc đó, câu trả lời trung thực của OrcaRouter là nó vẫn chưa áp dụng được, và điều hữu ích mà danh mục làm được cho quyết định cụ thể này là cho phép bạn so giá những mô hình thực sự có thể gọi được cạnh nhau mà không cần mở bốn tài khoản để tìm hiểu.

Điểm mấu chốt

Gemini 4 Argon là sản phẩm chủ lực của Google chứ không phải mô hình tiên phong của hãng. Nó đạt 52,56 trên Chỉ số v4.3.2 của Artificial Analysis ở mức nỗ lực cao — ngang bằng với Claude Fable 5.1 và GPT-6 Astra, kém Claude Opus 5.5 năm điểm, và xếp sau Claude Sonnet 5.5, một mô hình rẻ hơn đến từ phòng thí nghiệm đối thủ. Google định giá nó ở mức $2/$10 cho giai đoạn giới thiệu, sau đó tăng lên $4/$20, khiến mức giá cuối cùng của nó rơi đúng bằng mức của Claude Opus 5.5 trong khi năng lực thấp hơn có thể đo lường được. Mức dẫn trước 11,6 điểm của nó so với Gemini 3.8 Flash là khoảng cách thế hệ rộng nhất trong dòng sản phẩm của chính Google và là bằng chứng mạnh nhất cho thấy thế hệ Gemini 4 là một bước tiến thực sự chứ không phải chỉ là một màn đổi nhãn.

Về câu hỏi đã khơi mào tất cả chuyện này: không có Gemini 4 Ultra. Đường dẫn Ultra của Google trên miền riêng của họ chuyển hướng đến một trang gói đăng ký, chỉ mục model-cards hoàn toàn không có mục Gemini 4 nào, mọi mẫu URL công bố cho một bài đăng Gemini 4 Ultra đều trả về 404, và bài đăng ra mắt chỉ công bố một mô hình mà không hứa hẹn một dòng mô hình. Đó là một phát hiện thực sự và là bằng chứng từ phía chính chủ chứ không phải suy luận, nhưng đó cũng là một sự thật có thời gian bán rã ngắn — chỉ một mã 200 duy nhất trên một đường dẫn sẽ đảo ngược điều đó, và nấc Pro của thế hệ Gemini 4 là thứ nhiều khả năng sẽ xuất hiện trước tiên hơn.

Hai lưu ý cần mang ra khỏi bài viết này. Mọi con số Argon ở đây đều là phép đo của người khác về một mô hình mà không ai ngoài một nhóm chuyên gia phòng thủ mạng đã qua thẩm định có thể gọi, còn bảng mười chín dòng của chính Google là một tuyên bố chứ không phải một phép đo — hữu ích đúng như bản chất của nó, và không thể thay thế cho Index độc lập. Và kết luận công bằng cho câu hỏi về phân hạng chỉ là tạm thời: Argon được đo ở mức nỗ lực cao, không phải tối đa, và một lần chạy ở mức nỗ lực tối đa là cách rẻ nhất có thể để bài viết này sai.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày