Thẻ tiêu đề hero ghi “Gemini 4 Argon vs Claude Opus 5.5 — phân tách benchmark”, với dải ngày ghi “Argon công bố 2026-09-30” và “Opus 5.5 phát hành 2026-09-22”, một nhãn ghi “Argon: thí điểm xác định, không phải khả dụng chung”, và dòng chân trang ghi “Số liệu Argon do nhà cung cấp báo cáo; số liệu chỉ số của cả hai mô hình theo Artificial Analysis.”
Guides & Insights

Gemini 4 Argon so với Claude Opus 5.5: Sự chia rẽ điểm chuẩn không ai ngờ tới

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Gemini 4 Argon và Claude Opus 5.5 không đồng ý với nhau về việc ai tốt hơn, và sự bất đồng này không phải là nhiễu. Trên Chỉ số Trí tuệ của Artificial Analysis, hai mô hình cách nhau năm điểm, nghiêng về phía Opus 5.5. Trên Vals Index — bảng xếp hạng tác động kinh tế có trọng số theo GDP — Gemini 4 Argon đứng ở vị trí số một và Claude Opus 5.5 đứng ở vị trí số ba, sau cả Argon lẫn Claude Sonnet 5.5. Cả hai bảng đều đo cùng hai mô hình đó trong cùng một tuần. Đó là toàn bộ nội dung bài viết: bạn nên chọn cái nào phụ thuộc vào việc công việc của bạn trông giống một câu hỏi trong bài kiểm tra hơn hay giống một ngày thứ Ba ở một công ty luật hơn, và vào việc bạn có quyền truy cập API tới Argon hay không, điều mà tính đến hôm nay thì gần như không ai có.

Google đã công bố Gemini 4 Argon vào ngày 2026-09-30 trong một bài đăng trên DeepMind được ghi công cho Koray Kavukcuoglu, Phó Chủ tịch Cấp cao phụ trách Google DeepMind kiêm Kiến trúc sư trưởng AI. Anthropic đã phát hành Claude Opus 5.5 sớm hơn tám ngày, vào ngày 2026-09-22. Một trong số đó là bản phát hành GA mà bạn có thể gọi ngay chiều nay. Cái còn lại là một đợt triển khai theo từng giai đoạn cho một nhóm chuyên gia phòng thủ an ninh mạng được nêu tên cùng với các kỹ sư của chính Google, với ý định được nêu rõ là sẽ tiếp cận "khách hàng API trả phí và người đăng ký Google AI Ultra" ngay khi các rào chắn an toàn sẵn sàng, và không có mốc thời gian nào gắn với việc đó.

Câu trả lời một dòng, trước phần chi tiết

Nếu bạn cần khả năng suy luận tổng quát được đo lường tốt nhất hiện nay và cần nó trên một khóa production, thì Claude Opus 5.5 hiện đã có trên OrcaRouter, còn Gemini 4 Argon thì không có trên bất kỳ API công khai nào. Nếu bạn đang xây dựng cho các tác nhân tài chính, pháp lý, thuế hoặc lập trình được chấm điểm dựa trên sản lượng kinh tế trên mỗi đô-la, thì các con số của Argon tốt hơn và giá của nó bằng một phần năm giá của Opus 5.5 cho mỗi tác vụ trên bảng xếp hạng đo lường chính xác điều đó. Nếu bạn đang làm phòng thủ an ninh mạng cho hạ tầng trọng yếu, Argon có một chương trình mà bạn có thể đăng ký, và câu trả lời có thể là có.

Mỗi con số thực sự đến từ đâu

Hai hội đồng chỉ số, hai phương pháp luận, và đáng để nói rõ đâu là cái nào bởi vì hai phe sẽ trích dẫn lẫn nhau suốt nhiều tháng.

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 đạt 57.6 và Gemini 4 Argon đạt 52.6, cả hai đều được đọc trực tiếp từ Artificial Analysis vào ngày 2026-09-30. Đây là tổ hợp của mười bài đánh giá, được cố ý thiết kế theo hướng tổng quát cho mọi tác vụ, và là bảng xếp hạng mà hầu hết mọi người coi là bảng xếp hạng "the".

• Vals Index, cập nhật ngày 2026-09-29 — Gemini 4 Argon đứng đầu với 68,90% (±0,97), Claude Sonnet 5.5 thứ hai với 67,04% (±0,92), Claude Opus 5.5 thứ ba với 66,97% (±0,89). Vals đánh trọng số cho các tác vụ tài chính, lập trình, pháp lý và thuế theo tỷ trọng của từng lĩnh vực trong GDP của Mỹ, vì vậy một mô hình tầm thường ở các câu đố nhưng xuất sắc ở việc xem xét hợp đồng và xử lý bảng tính sẽ đạt điểm cao ở đây.

Khoảng cách AA năm điểm là có thật và nó không hề nhỏ. Khoảng cách Vals hai điểm cũng là có thật, và với các khoảng tin cậy được in trên bảng xếp hạng, Argon 68,90 ±0,97 so với Opus 5.5 66,97 ±0,89 là mức chênh lệch khoảng 1,5 sai số chuẩn — tốt hơn một lần tung đồng xu, nhưng chưa đến mức áp đảo. Cả hai bảng đều không sai. Chúng đang đo những công việc khác nhau.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

Một lưu ý về cấu hình, và nó đi ngược lại việc đọc khoảng cách AA như một so sánh mô hình thuần túy. Artificial Analysis đưa Gemini 4 Argon lên biểu đồ ở mức cao của thiết lập nỗ lực và Claude Opus 5.5 ở "Adaptive Reasoning, Max Effort, Default Fallback". Đó không phải là cùng một điểm trên hai thang nỗ lực, nên con số nổi bật 57,6 so với 52,6 không phải là so sánh tương đương khi ngân sách suy luận được khớp. Đó là con số mà cả hai trang đều công bố, và là con số để trích dẫn nếu bạn công bằng với Anthropic, nhưng nó không phải là một thí nghiệm có kiểm soát.

Chi phí cho mỗi tác vụ là lúc khoảng cách trở nên đáng lo ngại.

Artificial Analysis cũng công bố bản hạch toán chi phí để vận hành bộ chỉ số của mình, và ở đây hai mô hình không hề gần nhau.

• Chi phí mỗi tác vụ lập chỉ mục — Gemini 4 Argon $1.99 so với Claude Opus 5.5 $5.98.

• Chi phí để chạy cả bộ chỉ mục — Gemini 4 Argon $2,407 so với Claude Opus 5.5 $8,708.

• Giá niêm yết trên mỗi triệu token — Gemini 4 Argon 2 USD đầu vào / 10 USD đầu ra (mức giá giới thiệu mà Google công bố, với đầu vào được lưu cache giảm 95%, tức 0,10 USD) so với Claude Opus 5.5 4 USD đầu vào / 20 USD đầu ra.

• Thông lượng — Gemini 4 Argon đạt 48,9 token đầu ra mỗi giây, token đầu tiên sau 2,79 giây; Claude Opus 5.5 đạt 92,2 token đầu ra mỗi giây nhưng độ trễ token đầu tiên là 702 giây trên cùng một bộ khung kiểm thử, đây chính là cái giá phải trả cho extended thinking phơi bày rõ ràng ra trước mắt.

• Chi phí mỗi lần chạy của Vals — Gemini 4 Argon $15.68 so với Claude Opus 5.5 $32.14 trên cùng một bộ tác vụ có trọng số theo GDP.

Có một điểm rắc rối đáng để nêu ra hơn là xoa dịu: bảng xếp hạng của Vals liệt kê mức giá của Argon là $4 đầu vào / $20 đầu ra, trong khi thông báo của Google ghi là $2 đầu vào / $10 đầu ra cho giai đoạn giới thiệu. Cách hiểu khả dĩ nhất là Vals đang hiển thị mức giá niêm yết tiêu chuẩn còn Google đang hiển thị mức giá khuyến mại, nhưng đó là một suy luận chứ không phải một tuyên bố đã được công bố từ phía bên nào. Nếu ngân sách của bạn phụ thuộc vào con số này, hãy hỏi Google.

Argon tuyên bố điều gì và điều gì đã được kiểm chứng

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Bài đăng của Google dày đặc số liệu, và mọi số liệu trong đó đều do nhà cung cấp tự báo cáo. Tôi không tìm thấy số liệu nào được tái lập một cách độc lập, và các bảng đo độc lập ở trên đo những thứ khác với những gì Google chọn đưa lên tiêu đề. Được nêu như là những tuyên bố của chính Google:

• DeepSWE v1.1 — 77,9%, được mô tả là một chuẩn mực tiên tiến mới trong lĩnh vực kỹ thuật phần mềm tầm xa trong thế giới thực.

• Hiểu video dài LVBench — 91,7%, được mô tả là tiên tiến nhất.

• AutomationBench (bài kiểm chuẩn của Zapier cho các tác vụ kinh doanh từ đầu đến cuối) — xếp hạng #1 với 51.3%.

• Khắc phục lỗ hổng bảo mật CWE-bench v1 — đồng hạng nhất ở mức 68%, tiếp nối kết quả của Gemini 3.8 Flash Cyber trên bảng v0.

• Gray Swan Indirect Prompt Injection — được mô tả là dẫn đầu, không có số liệu nào được công bố trong bài đăng.

• Vals Finance Agent v2 và Harvey's Legal Agent Benchmark — được mô tả là dẫn đầu, tương tự cũng không có con số nào được in trong thông báo.

Hai nhóm tuyên bố thực sự có hỗ trợ độc lập là những nhóm đáng tin cậy nhất: Vals xác nhận vị trí trên bảng chỉ số bằng một con số và một khoảng, còn Artificial Analysis xác nhận chỉ số 52,6 và mức giá. Những giai thoại về năng suất nội bộ — mức cải thiện 40% so với mốc cơ sở đã công bố trên một chương trình con lượng tử, hơn 300 TiB bộ nhớ được giải phóng trên toàn hệ thống máy chủ của Google nhờ các tác nhân Argon — là những kết quả nội bộ của công ty, không có kiểm nghiệm bên ngoài, và nên được hiểu đúng như vậy.

Opus 5.5 là gì, nếu bạn vừa mới chui ra khỏi hang

Claude Opus 5.5 là sản phẩm chủ lực của Anthropic: ngữ cảnh 1M token, đầu ra tối đa 128K, đầu vào đa phương thức gồm văn bản, hình ảnh và tệp, extended thinking, sử dụng công cụ và đầu ra có cấu trúc. Nó kế nhiệm Claude Opus 5 vào ngày 22/09/2026 và tâm điểm của buổi ra mắt có thể nói chính là việc giá giảm — phân khúc này đi xuống chứ không đi lên, ở mức $4/$20 với lượt đọc từ cache ở mức $0.20. Ngày nay, nó có thể được định tuyến trên OrcaRouter đúng với mức giá đó, giá niêm yết của nhà cung cấp được chuyển nguyên vẹn cùng với không tính thêm markup, và khi nhà cung cấp thay đổi giá thì bên chúng tôi cũng cập nhật trong cùng ngày họ cập nhật.

Trên các điểm số ở cấp độ tác vụ mà cả hai mô hình đều có, bức tranh là một thế bập bênh thực sự chứ không phải một sự thắng áp đảo:

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% so với Gemini 4 Argon 57,1%.

• SciCode — Claude Opus 5.5 đạt 66,9% so với 61,8% của Gemini 4 Argon.

• Bài kiểm tra cuối cùng của nhân loại — Claude Opus 5.5 61,4% so với Gemini 4 Argon 57,1%.

• Suy luận ngữ cảnh dài — Claude Opus 5.5 84,7% so với Gemini 4 Argon 79,7%.

• CritPt — Claude Opus 5.5 31,7% so với Gemini 4 Argon 27,1%.

• Toàn tri — Claude Opus 5.5 46.4 so với Gemini 4 Argon 42.4.

• GDPval — Claude Opus 5.5 1.846 so với Gemini 4 Argon 1.611.

• AutomationBench-AA — Gemini 4 Argon 77.5% so với Claude Opus 5.5 69.5%. Đây là điểm tác vụ đối đầu trực tiếp duy nhất mà Argon thắng rõ ràng, và đây cũng là nhóm tác vụ gần nhất với những gì Vals Index thưởng.

Vậy là quy luật nhất quán: Opus 5.5 dẫn đầu ở thang suy luận mang hơi hướng học thuật, còn Argon dẫn đầu ở khả năng thực thi tác vụ đầu-cuối. Đó không còn là mâu thuẫn giữa hai bảng xếp hạng nữa. Đó là cùng một phát hiện được diễn đạt hai lần.

Năng lực mà không ai đang so sánh

Trần đầu ra của Gemini 4 Argon là 1.000.000 token trong một quỹ đạo duy nhất, tăng từ 64K của thế hệ trước. Claude Opus 5.5 giới hạn đầu ra ở 128K. Cả hai đều có cửa sổ ngữ cảnh 1M token, nhưng ngữ cảnh và đầu ra là những khoản ngân sách khác nhau, và đây là bước nhảy thông số đơn lẻ lớn nhất trong thông báo.

Việc đó có quan trọng hay không phụ thuộc hoàn toàn vào thứ bạn chạy. Mức trần đầu ra 128K là khá hào phóng cho chat, đánh giá mã, trích xuất có cấu trúc và các bước agent. Nó là một bức tường cứng đối với việc tạo toàn bộ một bộ bản vá migration, một báo cáo kiểm toán đầy đủ, hay một tài liệu dài trong một lượt — những quy trình mà Google đã chọn để minh họa cho buổi ra mắt. Nếu pipeline của bạn chuỗi hai mươi lệnh gọi để giữ dưới mức trần, mức trần của Argon sẽ giúp bạn tiết kiệm độ trễ và mã điều phối. Nếu không, bạn đang trả tiền cho dư địa mà bạn sẽ không dùng đến.

Tính sẵn có là biến số quyết định, không phải chất lượng.

Đây là phần của sự so sánh không có thước đo chuẩn nào đi kèm và lại quan trọng hơn tất cả những phần còn lại.

Gemini 4 Argon chưa được cung cấp rộng rãi. Bài đăng của Google cho biết mô hình này đang được triển khai cho các chuyên gia phòng thủ an ninh mạng đáng tin cậy thông qua Fairwind Program, rằng công ty đang tham gia vào quy trình tiếp cận mô hình trước khi phát hành mang tính tự nguyện của chính phủ Hoa Kỳ, và rằng quyền truy cập rộng rãi hơn cho các nhà phát triển, doanh nghiệp và người tiêu dùng sẽ đến "càng sớm càng tốt", bắt đầu với khách hàng API trả phí và người đăng ký Google AI Ultra. Không có mã định danh mô hình, không có endpoint, không có hạn mức nào được công bố và không có ngày cụ thể. Nó không có trong danh mục của chúng tôi và cũng không có trên API công khai của bất kỳ ai khác, vì vậy trang định giá cho Argon vẫn chưa tồn tại.

Claude Opus 5.5 ra mắt hôm nay. Trên OrcaRouter, nó là anthropic/claude-opus-5.5, được truy cập thông qua cùng endpoint tương thích OpenAI như hơn 200 mô hình khác trong danh mục, với tự động chuyển đổi dự phòng giữa các nhà cung cấp khi một tuyến bị suy giảm, cùng một DSL định tuyến cho các trường hợp bạn muốn gửi một phần lưu lượng đến Opus 5.5 và phần còn lại đi nơi khác trên cùng một key. Không cần hợp đồng thứ hai, không cần SDK thứ hai.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

Khuyến nghị thực tế cho tháng tới khá kém hào nhoáng: hãy xây dựng trên Opus 5.5, giữ tên mô hình của bạn trong một giá trị cấu hình thay vì một chuỗi literal, và đặt một mô hình rẻ phía sau đường retry của bạn để một đợt tăng vọt độ trễ ở một lần chạy first-token kéo dài 702 giây không kéo sập sản phẩm của bạn theo. Điểm cuối đó không phải chuyện lý thuyết — độ trễ first-token của Opus 5.5 trên harness của AA là mười một phút, và dù đó là tạo tác do harness hay việc mô hình thực sự suy nghĩ lâu hơn bất cứ thứ gì trước đó, ngân sách timeout của bạn nên được đặt theo con số đó, chứ không phải theo lời quảng cáo.

Điều gì sẽ thay đổi phán quyết này

Ba điều, theo thứ tự khả năng xảy ra. Việc Argon được phát hành chính thức với mức giá được công bố, điều này sẽ khiến lập luận về chi phí trở nên có thể hành động ngay lập tức và sẽ kiểm tra liệu mức $2/$10 có trụ vững khi tiếp xúc với lưu lượng thực tế hay không. Một lần chạy độc lập, có thể tái lập của DeepSWE v1.1 và CWE-bench v1 bên ngoài Google, điều này sẽ hoặc xác nhận các tuyên bố của nhà cung cấp hoặc chọc thủng chúng. Hoặc một cấu hình Argon của Artificial Analysis ở thiết lập nỗ lực cao nhất, điều này sẽ giải quyết liệu khoảng cách năm điểm trên chỉ số là khác biệt về năng lực hay là sản phẩm phụ của các thiết lập mức nỗ lực.

Cho đến khi một trong những điều đó thành hiện thực, tóm tắt trung thực là Opus 5.5 là mô hình được xác minh tốt hơn còn Argon là tuyên bố có mức giá tốt hơn. Việc bạn thực sự có thể dùng cái nào trong số đó ngay hôm nay thì không phải là một lựa chọn sát nút.

Claude Opus 5.5 đã có mặt trên OrcaRouter với đúng mức giá niêm yết của nhà cung cấp, không cộng thêm phụ thu, cùng với phần còn lại của danh mục — nếu bạn muốn đánh giá nó dựa trên khối lượng công việc của chính mình thay vì dựa trên bảng xếp hạng, thì anthropic/claude-opus-5.5 là id cần gọi, và việc đổi sang một mô hình khác sau này chỉ là thay đổi một dòng trên cùng một key.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày